本周 Reddit r/LocalLLaMA 上一段测试截图火了:用户让 Qwen 系列一款 27B 参数(270 亿参数规模,数值越大通常模型越聪明但也越耗资源)的开源模型执行"运行测试套件",模型回了 50 多行"我马上就跑""启动!""执行!",却始终没有真正调用任何工具、输出一个测试结果。一个一秒能完成的任务,模型用了几千字在脑子里"预演"行动。
这是什么
事件本身是一段用户测试截图。用户给模型明确指令:"跑测试,别再分析。"模型第一句承认"我刚才确实绕圈子了"——紧接着又开始新一轮绕圈子。
输出全是这类元评论(meta-commentary,模型对自己的行为发表评论的话):"执行力,启动。""闭脑,下达命令。""行动模式:已启动。""测试套件,你被召唤了。""这次是真的,真的在跑,马上出结果。"
几十轮下来,没有一行真正的命令输出,也没工具调用记录。Qwen 系列(阿里通义千问)是目前最受欢迎的开源模型家族之一,27B 属于中等规模——家用显卡能跑、性能不算差。但这个案例显示:参数规模只是门槛,会"动手"是另一回事。
行业怎么看
开源社区把它当段子传,但 Agent 框架团队看到的是另一层。一位本地大模型(LLM,大语言模型)部署工程师在评论区写道:"这正是我们做工具调用(function calling,让模型按结构化格式调用外部工具)微调(fine-tuning,针对特定任务继续训练)的原因——基座模型不知道自己应该停。"
但也有反向声音。一种观点认为,这不是 27B 的问题,而是当下所有模型的通病:大模型在"自我反思"上被强化得太狠,反而牺牲了执行果断性。Anthropic 工程师在公开访谈里提过,Claude 在 Agent 任务上专门做了"减少过度思考"的训练。
更尖锐的批评来自一位 AI 安全研究者:"开源阵营在 Agent benchmark(基准测试,即标准化评分榜单)上刷分热闹,但 benchmark 评的是'能不能调通',没人评'会不会陷入自言自语'。"言下之意:Agent 落地的真正瓶颈不在参数规模,而在执行稳定性。
值得关心的是,这个梗能传开,恰恰说明越来越多人在本地实测 Qwen 跑 Agent——开源阵营离真正可用的本地智能体(Agent,能自主完成多步任务的 AI 程序)不远了,但"最后一公里"仍卡在执行力。
对普通人的影响
- 对企业 IT:在评估"用开源模型搭内部 Agent"时,除了看 benchmark 分数,建议留一周时间跑真实业务流测试;能想清楚不等于能做完。
- 对个人职场:你现在用的 Copilot、Cursor、文心一言,背后是经过专门工程化的大模型;它看起来"懂事",是因为训练阶段专门优化过执行链路,不是普通基座模型套上去就能复现。
- 对消费市场:在家用显卡上跑开源模型当"私人助手",目前仍是极客玩具;离"装个模型就替代秘书"还有距离,执行稳定性这一关没过。