这是什么
一位 Reddit 用户用一块售价约两千元的 AMD Radeon 7600 显卡,加 64GB 普通 DDR4 内存和一颗 Ryzen 5600 处理器,把 Qwen 系列一款 350 亿参数的 MoE 架构模型(即每次推理只激活约 30 亿参数的稀疏大模型)跑到了 21 token/s(每秒生成 21 个文字单位)。最初是 18 t/s,重编了 llama.cpp(主流开源推理引擎)、开启 AMD 的 ROCm 7.14 加速库、显存超频后才提上来。
值得注意的不是"跑得动",而是"跑得动还便宜"。350 亿参数级别、量化到 Q8 精度(把模型参数压到 8 位以缩小体积)的模型,过去通常需要 RTX 4090 或 A100 这种万元级显卡才顺畅,现在一张中端消费卡就能撑起来。
行业怎么看
支持者认为这是本地 AI 的拐点 — 当模型能在家用硬件上以可用速度运行,企业就有了不依赖云端 API(按调用付费的远程模型接口)的备选,对医疗、政务、制造业内部知识库等数据敏感场景尤其有价值。
反对意见同样存在:21 t/s 仍远低于云端常见的 60–100 t/s,长对话会有可感知的卡顿;llama.cpp 等开源推理栈在稳定性、版本管理、生产可观测性上都还不能直接替代商业方案。更关键的是,"35B 模型在家跑通"和"在企业稳定跑"之间,还隔着显存调度、并发处理、版本升级一堆工程坑,别把单点 demo 当成部署就绪。
对普通人的影响
对企业 IT:数据合规要求高的行业可以重新评估"必须上云"的默认假设,但建议先做小规模 POC(概念验证测试),别被单点跑通的帖子冲昏头脑。
对个人职场:写邮件、改文案这类任务,21 t/s 够用;但实时问答、代码补全仍建议用云端,等待的体感差距明显。
对消费市场:硬件厂和模型厂的"绑定价"正在松动,一体式 AI 工作站、小型推理盒子接下来会更多进入家庭和中小企业。