这周 Reddit 上一个数字让编辑部停下来:100 美元,两块二手 AMD 显卡,阿里通义千问 270 亿参数模型,本地跑通,速度 7.39 token/s(每秒约 7 个字)。慢,但这条基线本身比速度更重要——它意味着大模型从云端走向桌面的硬件成本拐点,正在悄悄跨过。
这是什么
帖子作者的配置:两块 RX 580 8GB 显卡(共 16GB 显存,二手价约 50 美元/张),配一台带双显卡槽的二手工作站主板 + DDR3 内存,整套不到 100 美元。跑的是 Qwen 27B 的 Q3_K_M 量化版本——一种把模型体积压到更小、牺牲一点精度换速度和显存占用的压缩方案。
作者也承认:输入 token 多时体验痛苦,速度不到商用 GPU 的十分之一。但作为"能跑起来"的最低门槛,这是一条全新的基线。
行业怎么看
开源社区普遍兴奋——模型权重开放(Hugging Face 免费下载)+ 廉价硬件 = 推理成本的结构性下降,长期会压制云端 API 的报价空间。
反对意见也明确:云厂商和本地部署方案商会指出,7.39 t/s 只能应付聊天和简单问答,复杂任务(长文档分析、多步推理)依然要堆算力。AMD 显存带宽是硬伤——16GB 显存装不下更大的模型,也跑不动并发。这是"能用"和"好用"之间的鸿沟,短期内云端依然占优。
对普通人的影响
对企业 IT:中小企业自建轻量级 AI 知识库、文档问答系统的硬件投入,可能从过去的十万级降到万元级,前提是 IT 团队愿意折腾。
对个人职场:"AI 是大公司专利"的认知正在过时,会用开源工具在本地跑模型的人,正在获得一种不对称的效率优势。
对消费市场:智能音箱、车机、桌面助手这类端侧大模型路线,多了一个被验证可行的硬件参照。