找到 1 篇关于此标签的文章
一位用户在英伟达 2016 年的数据中心显卡 P40 上跑 Qwen 系列 35B 模型,疑惑 IQ 量化(一种把模型压小的方法)会不会拖慢速度。这背后是本地 AI 硬件的二手市场正在被讨论。