本周开源社区 r/LocalLLaMA 上发布的一款新模型值得我们花时间看:Ornith-1.5,397B 参数版本在 SWE-Bench Verified 上跑出 86 分,官方称整体接近 Claude Opus 4.8。这是开源模型在 Agent(AI 自主执行任务的能力)和编程任务上第一次摸到闭源顶配的边缘。

这是什么

Ornith-1.5 是新发布的开源大模型家族,三档尺寸覆盖不同部署需求:9B Dense(紧凑)、35B MoE(混合专家)、397B MoE(其编程子版本叫 DeepSWE 56)。 (一句话定义:MoE 即 Mixture of Experts,混合专家架构,参数大但每次推理只激活一部分,从而控制成本。) 官方公布的核心基准:
  • Terminal-Bench 2.1: 86.1
  • SWE-Bench Verified: 86
  • SWE-Bench Pro: 65.1
  • DeepSWE: 56
  • HLE: 44.6
  • ClawEval: 81.4
  • Tool Decathlon: 71.2
训练上主打 "self-improving"——模型在训练中自己生成数据、自己给自己出题。

行业怎么看

乐观派认为这是开源的转折点:以往 DeepSeek、Qwen、Llama 更多在"对标 GPT-4 级别"做文章,Ornith-1.5 把对标线直接拉到 Claude Opus 4.8 这种当前顶配。如果属实,企业不必为顶级 AI 能力向 Anthropic 或 OpenAI 付费。 但编辑部也注意到三个保留意见。 第一,基准分数不等于真实工程能力。SWE-Bench 是从 GitHub 真实 issue 抽取的离线测试,跟在企业内部系统上跑 Agent 是两回事。 第二,发布方身份与可复现性存疑。Reddit 提交者 KokaOP 与项目关系不明,"self-improving" 训练目前公开复现成功案例极少。 第三,部署门槛。397B 即便稀疏激活,单卡也跑不动;真正能"自己部署"的 9B 版本在上述基准上的成绩并未单独公布。

对普通人的影响

对企业 IT 采购:未来 6-12 个月,开源模型在编程和 Agent 场景里可能第一次具备替代部分 Claude 订阅的可行性,值得技术团队做一次内部 POC(概念验证)。 对个人职场:如果你日常用 Cursor、Claude Code,目前还不用换;但如果公司对数据外发敏感,9B 这类小尺寸开源模型开始有了"本地跑"的真正选项。 对消费市场:短期内看不到变化。C 端用户感知的是 ChatGPT、豆包、通义千问这些应用层,开源底层变强不会立刻反映到 App 体验上。