一张退役的 AMD Mi50 显卡(闲鱼几百到一两千元)+ 一个开发者写的 llama.cpp(当前最主流的开源大模型推理引擎)分支 + 智谱开源的 GLM 模型 = 一台能本地跑中文大模型的服务器。这件事的技术含量不算顶尖,但它再次压低了 AI 推理的成本曲线,方向值得关注。
这是什么
Reddit 用户 milpster 在 r/LocalLLaMA 社区发布了 llama.cpp 的一个分支,标题写的是「GLM and I created」。专门针对 AMD GFX906 架构做了优化,也就是 Mi50、Mi60、Radeon VII 这一代数据中心 GPU。GFX906 是 AMD 2017-2019 年间的 GCN 5.0 架构代号,AMD 官方早就不主推这条产品线了。
但这代卡有一个被市场低估的优势:显存大。Mi50 单卡 32GB HBM2(高带宽显存),当代消费级显卡几乎做不到。对跑 7B-32B 参数的中等规模模型来说,这个显存容量反而是甜点。
GLM 是智谱 AI 开源的大模型系列。把三者组合起来,结论是:一台几千元成本的退役服务器,本地跑出能用的中文大模型推理服务,技术上已经可行。
行业怎么看
正面看,这是开源生态「把 AI 成本砸到底」的又一次尝试。从 llama.cpp、vLLM 到 SGLang,社区一直在持续压低推理门槛。AMD 老卡算力不及当代 GPU,但显存优势对中等规模模型依然够用,关键是价格只要当代消费级卡的十分之一以下。
但有几个常被忽略的问题:
第一,这是个人分支,不是稳定版本。milpster 本人在帖子里说「Looking for feedback」,长期维护、社区响应都是未知数。
第二,llama.cpp 的 fork 生态碎片化严重,每个项目解决一个边角问题,整合成本最终转嫁给使用者。
第三,便宜不等于划算。二手服务器卡的故障率、电费、运维工时,加上老架构的驱动兼容问题,企业真要部署时总账可能并不优于公有云或当代硬件。
对普通人的影响
对企业 IT:用退役硬件 + 开源模型搭本地推理集群,单次推理成本可压到公有云的十分之一以下,但前提是你们有运维能力,且业务对模型规模需求不大。
对个人职场:5000 元级别硬件现在能跑出可用的本地 AI 助手,对数据隐私敏感的岗位(律师、医生、研究者)多了一条不依赖云端 API 的独立路线。
对消费市场:短期看不到影响,但开源社区持续压成本,会慢慢松动云端 AI 服务的定价刚性,未来几年 AI API 的「高价时代」可能逐步下行。