这是什么

用户在 Reddit 的 LocalLLaMA 论坛发帖:他用一张英伟达 P40(2016 年发布的数据中心级专业显卡,24GB 显存,二手市场价在几百到一千多元人民币)跑开源工具 llama.cpp,加载 Qwen 系列 35B 参数(IQ 是 llama.cpp 的量化方法之一,比普通 Q4 更激进地把模型压缩成更小的体积)。

实测下来:生成速度在 37 到 83 tok/s(每秒吐出的文字数)之间波动;模型读他输入内容的过程(prefill,模型"看完"你的问题这一步)一开始每秒处理 600 个字,长输入后会降到 300-400。他主观感觉并不比普通 Q4 量化慢。

但他查到的两年前资料说 IQ 量化在 P40 上明显更慢——这个结论还成立吗?

行业怎么看

支持"IQ 更慢"一方的观点:IQ 量化在推理时需要 CPU 端实时反量化(把压缩数据还原成可用的数字),P40 的老架构对此并不友好,理论上会掉速。

反对意见(也是这位用户实测倾向的方向):两年前那篇讨论的数据可能已过时,新版 llama.cpp 已经做了不少优化;况且 P40 只有 24GB 显存,跑 35B 模型本身就在边缘,速度本来就不会漂亮。

值得注意的风险:P40 是当前讨论度最高的"最低门槛本地大模型硬件",但稳定性、功耗(单卡约 250W)、驱动兼容性都缺乏长期数据;二手卡市场鱼龙混杂,企业自用需谨慎。

对普通人的影响

对传统企业 IT:预算紧的部门确实在尝试用退役服务器显卡搭本地 AI 实验环境,P40 是讨论度最高的选项,但还属于非正式采购范畴。

对个人职场:除非有明确的数据隐私或离线需求,否则云端 API 的性价比仍远高于本地折腾。

对消费市场:本地 AI 跑在消费级硬件上的故事大多基于 RTX 4090/5090,P40 这条路属于开发者尝鲜,离大众还很远。