一位 Reddit 工程师在统一基准下用 429 次严格测试,给 15 款开源大模型(参数 8B 到 35B)排出 Agent 任务(让 AI 自主调用工具完成多步操作)成绩单。通义千问 qwen3.8-27b 以 71.8% 拿下第一,但更值得我们关心的是垫底的 Bonsai:70% 的失败不是'选错工具',而是'做完却刹不住车'。

这是什么

测试用的是开发者自制的 Toolery 基准:143 个真实场景、每场景 3 次试跑,分易/中/难/极难四档。所有模型通过 LM Studio(一个本地运行开源模型的桌面工具)加载,无云端 API 调用。

冠军在中等难度任务得 93.3 分,到极难档骤降到 41.7%——即使第一,面对复杂多步任务仍有近六成概率翻车。垫底 Bonsai 27b 总分 50.5%,148 次失败中有 103 次(70%)属于'预算违规',即工具调用次数超出场景上限。

行业怎么看

支持者认为,统一基准正是开源生态缺的'照妖镜':过去大家只能看厂商发布的榜单,现在有人把模型拉到同一擂台上。

反对意见同样存在。资深开发者指出 Toolery 是单人自制基准,143 个场景的覆盖度有限;'预算违规'这个指标本身有争议——真实业务里多调几次工具未必是缺陷,可能换来更稳的结果。另一层质疑是开源测试常忽略延迟,而 Bonsai 恰好是本次跑测中最慢的模型(6208 秒总耗时)。

更深层的信号是头部开源力量在集中:前五名有 4 个来自阿里、IBM、Mistral 或其衍生品,中后段则充斥着各种小厂实验模型,质量参差。

对普通人的影响

[企业 IT] 数据合规要求高的行业(金融、医疗、政务),27B 级别开源模型已能在多数 Agent 任务上跑出 70 分以上,不必把数据交给云端也能用上 AI 助手。

[个人职场] 这位工程师只用了笔记本加 LM Studio 完成全部测试。如果你是产品经理、运营或咨询顾问,每周花几小时本地跑开源模型做对照实验,已能替代部分 ChatGPT Plus 的工作流。

[消费市场] '刹不住车'的失败模式正是消费类 AI 最容易踩的坑——智能音箱反复唤醒、外呼机器人死循环都是它的变体。判断一个 Agent 产品是否成熟,'知道何时停'比'答得多准'更值得普通用户关心。