一位开发者上周在 AMD Strix(AMD 最新一代端侧 AI 处理器平台)上跑通了通义千问最新大模型 QFN,生成速度达到 30-40 TPS(每秒输出 token 数),预填速度 900-1000 TPS。跑了一周后他的结论是:日常工作场景下,这款新模型和 27B 版本「基本是一个水平」。
这是「good enough is good enough」(够用就好)的又一个数据点。值得我们关心的是:当模型能力跨过某个阈值后,普通用户的工作流并不会因为参数翻倍而发生质变——市场以为「更大」等于「更有用」,但用户实测给出的答案不一样。
这是什么
这位用户在 Reddit r/LocalLLaMA 社区发帖分享实测。他使用的硬件是 AMD Strix(Ryzen AI MAX 系列),运行的是通义千问社区推出的新模型 QFN,由 Halogen 团队做了推理优化。他原本期待「震撼升级」,但对比 27B 版本后发现,在对话质量、推理深度、代码能力等核心维度上两者「非常相似」。
他做了一个关键观察:当需要调用云端更大模型时,原因几乎总是「速度」或「上下文长度」,而非「智力」。换句话说,他不为「更聪明」付费,而是为「更快」和「更长记忆」付费。这对云端旗舰模型的定价逻辑是个微妙信号。
行业怎么看
支持派认为,这恰恰验证了端侧大模型的商业可行性——既然 27B 已能覆盖大多数个人生产力场景,企业不必为 90% 的需求采购云端旗舰,本地部署一台 AI 工作站可能就够了。AMD、苹果、高通近一年密集推端侧 AI 硬件,赌的就是这个趋势。
但反对意见同样值得注意。有研究者指出,「够用」是高度个人化的判断——该用户的工作以问答、文档处理为主,不涉及复杂 Agent(能自主规划执行任务的 AI 助手)链、多步推理或长代码生成,这些场景下 30B+ 模型仍有明显优势。此外,27B 的「够用」建立在已充分优化的基座上,新模型如果不在长尾能力上拉开差距,开发者社区的迁移动力会快速衰减。
更深一层的风险是:如果「够用论」被更多用户验证,云端大模型的算力溢价(高端算力相对普通算力的额外加价)将面临结构性挤压——这会直接动摇 OpenAI、Anthropic 等公司高端订阅的定价空间。
对普通人的影响
· 企业 IT:值得重新评估「上云还是上本地」的天平。如果员工日常 80% 的需求 27B 模型即可承接,配一台 AI 工作站的总拥有成本,可能低于三年云端 API(应用程序接口)订阅费。
· 个人职场:「AI 焦虑」可以适度降温。你日常用的 ChatGPT、文心一言、通义千问,能力上限对你手头的工作大概率已经溢出;真正限制你的是 prompt 质量(向 AI 提问的技巧)和工作流设计,不是模型大小。
· 消费市场:端侧 AI 硬件的「杀手级应用」尚未出现,但「够用模型 + 本地推理 + 隐私保护」这个组合,正在从极客玩具变成中产可选项。