这周我们注意到 r/LocalLLaMA 上一篇被反复讨论的攒机帖:一位巴西开发者准备用三张 16GB 消费级显卡,搭一台 48GB 显存的家用 AI 服务器,本地跑大模型推理和 Agent。整套预算里,AMD 方案比英伟达方案省约 650 美元——这笔差价够再买一块主板。
这是什么
这是本地大模型推理(Local LLM Inference)从极客玩具走向大众攒机的标志性信号。三张 RX 9060 XT 16GB 合计 48GB 显存,理论上能跑下 70B 量化模型,甚至通过 CPU 卸载(让部分模型权重暂时放内存里)试探 DeepSeek 级 MoE(Mixture of Experts,混合专家)架构的大模型。AM5 平台加 128GB DDR5 内存,整机方案约 3.5 万人民币就能拿下。
行业怎么看
支持者认为这是英伟达 CUDA 垄断被撬动的开始:48GB 新一代显存花 1.5 万人民币,AM5 主板加消费级电源就能跑,比上一代矿潮时期合理太多。而且 ROCm(Radeon Open Compute,AMD 的 GPU 计算平台)对 llama.cpp(一个主流开源推理引擎)和 vLLM(另一个高吞吐推理框架)的支持这两年肉眼可见地在追赶。
反对意见同样值得警惕:一是 PCIe 4.0 x4 这种带宽瓶颈在多卡张量并行(把一次矩阵计算拆到多张卡上同时跑)场景下会拖后腿,而 AM5 平台只有 28 条 PCIe 直连 CPU 的通道;二是 RDNA4(即 RX 9000 系列采用的 AMD 新显卡架构)的 ROCm 支持目前仍属于「能跑、但不保证」,遇到新模型出问题没有兜底;三是这位发帖者自己也承认,单线程性能、闲置功耗、ECC 内存(能纠错的服务器内存)这些「体验类指标」上,EPYC(AMD 服务器 CPU)方案反而更省心,只是单卡投资更高。
对普通人的影响
对企业 IT:预算紧又想要私有化部署(把模型装在公司自己机器上、不上传数据)的中型企业,会开始认真评估「AMD 攒机方案」作为 NVAIE(英伟达企业级 AI 订阅)或 H100 集群之外的替代选项。
对个人职场:技术决策者、数据科学家、独立顾问这批人,会更愿意花一两周时间自己搭一套本地环境试手,而非直接订阅云 API。
对消费市场:短期内还不会进主流消费视野——这仍然是开发者圈的小众游戏;但二手 EPYC 平台和 16GB 显存显卡的价格,会被这波需求悄悄推高。