Andrew Ng 这周关注到的一组数据让我们编辑部眼睛一亮:韩国 AI 基础模型项目第二轮评测里,Motif-3 的综合得分(AAII 约 47.36)刚刚压过 Qwen 3.7 Max,LG 的 EXAONE 因为表现不及预期看起来要提前下车,留下 Upstage、SKT 和 Motif 三家继续争。值得关心的是,中国头部开源大模型在这个榜单上不再只是"参考对象",而是"别人要追的分数线"。
这是什么
Motif-3 是韩国 Motif Technologies 发布的开源大模型,参数量 3314 亿(激活 130 亿,即 MoE 架构——每次推理只激活一小部分参数,兼顾性能与成本)。参与对比的还有 MiniMax-3428B-A23B、GLM-5.1744B-A40B、Kimi-K2.61T-A32B、Qwen-3.7 Max 和 DeepSeek v4 Pro。
评测覆盖四类场景:Agentic(智能体任务执行)、Coding(代码)、Reasoning & Knowledge(推理与知识)、Long Context & Instruction Following(长文本与指令遵循)。Motif-3 在智能体类(GDPVal v2 38.7、τ²-Bench Telecom 94.7)和代码类(SWE-Bench Verified 76.2)表现稳健,但在高级推理类(IMOAnswerBench 83.2、Apex-Shortlist 75.5)被 Qwen 3.7 Max 拉开明显差距。
行业怎么看
Reddit r/LocalLLaMA 板块的本地部署玩家普遍认为:Motif-3 的发布意味着韩国政府主导的基础模型项目进入"三国杀"阶段,LG 提前出局在意料之中。技术层面,大家关注的不是单点跑分,而是 Motif-3 能否在企业落地场景里提供与 Qwen、Kimi 相当的中文与英文综合能力——这是当前开源生态里中国玩家的主战场。
但也有冷静声音。有评测者指出,AAII 这种综合得分掩盖了结构性问题:Motif-3 在 GPQA Diamond(83.4)和 HLE(37.0)这些高难度推理基准上明显落后于 MiniMax、Kimi、Qwen、DeepSeek 四家中国模型。换句话说,"反超 Qwen 3.7 Max"更像是阶段性领先,不是能力代差。还有人质疑 3314 亿参数 MoE(混合专家模型,即把一个大模型拆成多个"小专家"按需调用)在本地部署上的实际门槛——对企业用户而言,跑得起来不等于跑得起。
对普通人的影响
对企业 IT:如果你的技术团队正在选型开源大模型做内部知识库或客服 Agent,Motif-3 现在多了一个非中国选项,这在数据合规要求严格的场景(如跨境金融、跨国制造)多了一条路径。
对个人职场:Agentic 基准(GDPVal v2、τ-Bench 系列)开始成为企业招聘 AI 相关岗位的隐形参考线——熟悉智能体框架(能调用工具、自主完成多步任务的 AI 系统)的人在简历里越来越值钱了。
对消费市场:中国大模型厂商(阿里、字节、月之暗面、DeepSeek)在国际开源榜单上长期被参照,本身就是一种品牌资产——未来海外 SaaS(软件即服务)产品里嵌入中文 AI 能力时,这些名字会越来越常见。