这是什么
Agent Arena 是社区里给 AI Agent 评分的擂台,让模型在真实编程任务里比拼,能跑通才算赢。最近一轮 Code 类别的初步排名里,阿里的 Qwen 和智谱的 GLM 一并出现在头部位置,DeepSeek 更早一轮已经在榜。发帖观察者的原话是「两个月一切都变了」——意指自从 6 月 DeepSeek 那个模型发出来后,开源权重(模型参数公开可下载)的模型在 Agent 这种「不只是聊天、还得动手干活」的赛道上,开始能跟闭源顶级模型掰手腕。
行业怎么看
乐观派认为这是开源的胜利时刻:Qwen 和 GLM 都是中国企业主导的项目,意味着国产 AI 在 Agent 赛道不再只是跟随者。本地部署、可商用、可改权重——对企业客户来说,意味着不再被一家供应商绑定。
但我们也要划几个边界。第一,「初步结果」三个字很关键,正式排名随时可能洗牌。第二,Agent Arena 题目偏编程,不能直接等同于所有真实业务场景。第三,闭源阵营不会站着不动——Anthropic 和 OpenAI 下一版本若跳出一大截,这种「追平」叙事会迅速过期。还有一个常被忽略的声音:本地跑这些模型需要企业级 GPU 集群,中小公司未必真能落地,所谓「开源平权」对很多公司是张空头支票。
对普通人的影响
对企业 IT:选型天平开始倾斜。如果你们公司在评估客服、内部知识库、自动化流程等场景,开源方案的技术风险比半年前低了,谈判时不用再把「万一供应商掉队」当作头号顾虑。
对个人职场:懂业务、能设计流程的人更值钱了。模型越能干活,越需要有人告诉它「该干嘛、边界在哪、结果对不对」——提示词和流程设计会更被需要,纯执行岗反而承压。
对消费市场:暂时感觉不到。开源模型变强会慢慢传导到各种 app 里,但需要时间,你手机里的聊天助手这一两个月不会有明显变化。