本周一份新跑分榜抛出一个值得我们重新审视的数字:在特定编程任务上,4 张 RTX 6000 本地部署的开源方案拿到了与 Anthropic 旗舰 Claude Opus 5.5 持平的 100% 完成率 — 代价只是耗时从 14 分钟延长到 31 分钟。但更值得关心的是另一组数据:同一模型在五套「运行环境」(harness,可理解为 AI 智能体的操作系统)下,成绩从 22% 一路跳到 96%。
这是什么
airbench.ai 上线了一份面向「本地 AI 智能体」的开放跑分榜。智能体(Agent)指能自主完成多步任务的 AI,比如读邮件、下单、写代码。测试覆盖基础数学、看图、操作电脑、编程四类任务。核心结论:4 张 RTX 6000 跑 glm-5.3-flash 可拿到 100%,与 Claude Opus 5.5 持平;单张 RTX 5090 跑 qwen3.8-flash-next 在 OpenCode 上拿到 96%,且比 Claude Code 还快。
行业怎么看
表面看是「开源追平闭源」,但作者与一线开发者更强调另一组数字:同一模型在五套 harness 上的平均得分,从 56% 一路涨到 94%。结论指向一处被低估的杠杆 — 很多企业在模型选型上花的预算,可能跑错了发力点。
反对意见同样存在。开发者指出,这份榜单只测基础任务,真实企业场景中 harness 一旦面对 65k 长上下文,得分会掉到 45–61%;此外本地部署的硬件折旧、电力与运维人力,未必真比每月订阅 Claude Code 划算。
对普通人的影响
对企业 IT:选型逻辑可能需要重写 — 花大钱选模型,不如花时间选 harness;预算结构里应给运行环境留位置。
对个人职场:开源生态走到这一步,意味着即使公司不批 Claude 订阅,懂技术的人也能在自家设备上跑出接近旗舰的效果。
对消费市场:短期内云端 API 仍是大多数企业的默认选项;但本地方案的成本曲线一旦继续下探,订阅定价迟早会感受到压力。