3.5 万人民币、一台 AMD 攒机工作站、Qwen 122B 模型跑出 49 token/秒——这是这周 Reddit r/LocalLLaMA 上一个具体案例的成绩。值得关心的不是硬件多猛,而是"本地跑大模型"第一次有了工作站级别的性价比方案。

这是什么

玩家把 Framework 的 Strix Halo 主板(AMD 把 CPU、GPU、内存整合在一块芯片上的方案,统一内存最高 128GB)和一张 R9700 独立显卡(AMD 面向 AI 推理的消费级加速卡)拼在一起,整机花了约 5,000 美元。

跑 Qwen-3.5 122B(阿里系开源的 MoE 大模型,"混合专家"指模型分成多块,每次推理只激活一部分)时,生成速度 49 token/秒,比单用 Strix Halo 的 24 token/秒翻一倍;32K 上下文(约 5 万汉字)下的预填充(先把整段输入读完再开始生成)速度提升 2.5 倍。

关键在拆模型的思路:每次都会用到的"密集层"、KV cache(模型对历史对话的临时记忆)和 drafter 模型(先用小模型猜词、大模型再确认的提速技巧)放在 R9700 显存里;不常用的"专家层"放在 Strix Halo 的大容量统一内存里。两块硬件之间每秒只需传约 12KB,普通 PCIe 通道就够用。

行业怎么看

支持方看到了趋势信号:当一台 3.5 万的工作站能跑通 122B 级别模型,"本地 AI"的成本曲线从"机房级"下移到"高端 PC"级。数据敏感的行业——律所、医疗、制造业工艺数据——第一次有了自建本地推理机的现实性价比。NVIDIA 同档位的 DGX Spark 也是奔着这个市场去的。

但质疑同样不少。第一,作者本人是资深硬件玩家,整个调优他自己形容"费了点脑子",普通企业 IT 团队很难照搬。第二,整套方案依赖 AMD ROCm 软件生态(AMD 自家的 AI 加速框架),相比 NVIDIA 的 CUDA 兼容性差距明显,换一个模型可能就崩。第三,这个巧妙拆法只对 MoE 有效,密集架构的 Llama 系列走不通。

对普通人的影响

对企业 IT:今年评估"本地 AI"方案时,可以把 AMD 平台整机列入对比,而不是默认只看 NVIDIA。

对个人职场:如果你不是 AI 工程师或硬件爱好者,这件事暂时与你无关;但它意味着,三五年内"在自己电脑上跑一个像样的 AI 助手"会从极客玩具变成可选项。

对消费市场:家用 AI 主机正从 PPT 走向真实组装,2026 年我们可能会看到更多品牌整机方案,价位 2-4 万之间。