这是什么
这周我们注意到 Reddit 的 LocalLLaMA 版块里,一位自称「不是开发者、不是程序员」的 IT 架构师发了一篇长帖。他做了两件事:
第一,把原本只支持 RTX 3090/4090 的推理引擎 Ninfer(让大模型在本地高效运行的软件,类似 llama.cpp 和 vLLM 的同类)移植到了矿卡 CMP170HX 上。矿卡原本是挖矿用的,没有显示输出,但因为和 RTX 3090 是「近亲」(同属一个芯片家族),硬件结构大部分兼容。
第二,他不是自己写代码——他用 Hermes(一个 AI Agent)和本地跑的 Qwen3.8-27B 当「程序员」,自己只做架构指导和验证。
结果是:Qwen3.6-35B 在这张不到 1000 美元的矿卡上,性能比 RTX 3090 翻倍,还能撑住 26 万字上下文窗口(用 int8 压缩后占用 26GB 显存)。
行业怎么看
乐观声音主要来自本地 AI 社区:这个案例证明了「云端 GPU 并不是唯一答案」——矿卡价格只有专业卡的 1/5 到 1/10,配合开源推理引擎,本地部署大模型的成本可以大幅压低。同时,「AI Agent 干底层 CUDA 工作」意味着技术门槛正在被 AI 本身削平。
但反对意见更值得听:
- 这是一个人的实验,没有可复现的基准测试。他贴的 llama-swap 配置截图不能替代标准化的 benchmark。
- 矿卡的隐性成本被低估:电费高、没有显示输出要远程维护、生态兼容性差,普通企业 IT 团队接不住。
- 「AI 写的 CUDA 代码」质量不可控。Hermes 的自述里包含
cudaErrorCooperativeLaunchTooLarge错误处理——这种底层调试目前还离不开人。 - 云厂商几乎没回应。AWS、阿里云不会因为这个案例降价,他们的客户图的是「不用自己运维」。
我们的判断是:这是一个信号,不是趋势。它指向的方向(廉价硬件 + AI Agent 降低门槛)是真实的,但离「企业真的能扔掉云」还有距离。
对普通人的影响
- 对企业 IT:下次评估本地 AI 部署方案时,可以把二手矿卡列入备选。但要看运维成本和稳定性,不要只被「单价低」吸引。
- 对个人职场:不会写代码也能做底层技术项目这件事正在发生。如果你工作涉及技术决策但自己不写代码,「用 AI 当副驾」可能比你想的更可行。
- 对消费市场:本地跑大模型的成本继续下探,但离「插上电源就能用」还远——背后是软件兼容性、显存管理、模型蒸馏等一堆问题。