同一个本地模型,在 Claude Code 里的结果比在 Hermes 里更好,这已经足够说明一个判断:AI 应用的竞争,正在从“模型谁更强”转向“谁更会把模型用起来”。这则讨论来自 Reddit,源头是 StepFun 在介绍 Step 3.7 Flash 时给出的对比。
这是什么
表面上,这是一个关于本地模型(部署在自己设备或服务器上的模型)该接 Hermes 还是 Claude Code 的小问题。Hermes 可以理解为一类面向 Agent 的运行框架;Claude Code 则更像把模型放进代码任务流程里的工作台。讨论的重点不是模型换了,而是同一个模型换了“外壳”后,结果变了。
这说明,模型输出已经不只由参数决定,还受提示词编排、上下文截取、工具调用、错误重试等工程细节影响。很多人以为换模型才是升级,现实可能是先换执行框架,效果就能明显不同。
行业怎么看
行业里越来越接受一个事实:Agent(能调用工具、分步骤完成任务的 AI)落地难点,不只在模型能力,更在工程系统。谁更会管理上下文、拆解任务、处理失败,谁就更容易跑出稳定结果。从这个角度看,Claude Code 占优并不奇怪。
但反对意见也成立:一次演示或单一场景,不能证明 Claude Code 普遍优于 Hermes。不同任务、不同提示词、不同工具接法,结果都可能反转。另一个风险是,大家如果只盯着“套哪层壳更强”,容易忽略评测是否公平、是否可复现,这会让市场对产品能力产生误判。
对普通人的影响
对企业 IT:选型时不能只看模型榜单,更要看接入后的工作流、权限、安全和维护成本。很多预算浪费,不是买错模型,而是买了不会落地的框架。
对个人职场:会不会用 AI,正在从“会不会提问”升级为“会不会搭流程”。同样的模型,放进更顺手的工具里,产出差距可能很大。
对消费市场:未来大家买的未必是“最强模型”,而是“最好用的 AI 产品”。模型能力会逐步趋同,体验差距会更多体现在软件设计而不是参数宣传。