Ornith 1.5 与 Tiel-Coder 这两个 Qwen3.6-35B-A3B 的社区微调版,刚在一位 Reddit 开发者耗时 300 多小时的工具调用测试中大幅跑赢原版 35B-A3B、超过 Qwen3.6-27B 密集模型,逼近尚未发布的 Qwen3.8-27B 满血——而跑完全部测试的硬件门槛只是 32GB 单卡 V100。

这是什么

Qwen3.6-35B-A3B 是阿里达摩院去年下半年开源的小型 MoE 模型。"MoE"(Mixture of Experts,"混合专家")指总参数很大(35B)但每次推理只激活其中一小部分(约 3B),因此对硬件需求远低于同规模密集模型。本次对比的三个微调版分别是 KAT-Coder、Ornith 1.5 和较新的 Tiel-Coder(Tiel 基于 Ornith)。"工具调用"(tool calling)是 AI Agent 调用外部 API、操作软件、查数据库的核心能力——几乎所有 Agent 产品(无论叫 Copilot、Agent 还是别的)的底层都在拼这一项。测试平台是开源的 llama.cpp(本地推理框架)+ tool-eval-bench 评分工具,在 128k 上下文压力下共跑了 65 次。

行业怎么看

乐观的解读是:开源小模型经过社区微调,已经能在工具调用这种核心 Agent 能力上逼近顶级密集模型,而硬件门槛只是 32GB 单卡——企业部署成本从"集群"降到"工位机"的拐点可能已经出现。但值得警惕的反面是:这是单一测试场景下的结果,且微调社区高度分散、质量参差不齐——同一批测试里 Ornith-1.5-Heretic 翻车就说明了问题;原作者也强调 Qwen3.8 系列正式版"基本不会发",意味着这条微调路线短期内不会得到原厂背书。我们的判断:这是本地 Agent 实用化的早期信号,但离企业生产环境可用还差至少一个版本稳定性测试和工程化配套。

对普通人的影响

  • 企业 IT:原本需要 A100/H100 集群才能跑的工具调用能力,32GB 单卡就能跑——私有部署成本可能腰斩,但配套的监控、回滚、安全审计体系还跟不上。
  • 个人职场:暂时不构成行动信号,除非你做 AI 开发;真正值得关心的是,模型选型的话语权正在从"懂技术"向"懂业务 + 会调模型"的人转移。
  • 消费市场:短期不会有面向消费者的产品;中期看,端侧设备(手机、PC)跑 Agent 工具调用的技术可行性提高了,但落地仍依赖具体应用场景。