K2 到 K2.5 阶段,月之暗面投入了约 20-25 万亿 tokens 做持续学习(continual learning,即模型上线后继续用新数据训练参数,而非冻结后不再更新)——这个数字已经接近一些小模型从头预训练的总规模。本周 Reddit r/LocalLLaMA 社区一位用户发帖追问 K3.5 会是什么水平。值得关心的不是模型本身,而是中国大模型公司在押注什么训练范式。
这是什么
Kimi 是月之暗面(Moonshot AI)的旗舰模型系列。K2 已具备较强的代码与长文本能力,K2.5 通过大规模持续学习进一步抬升表现。K3.5 至今没有官方发布信息,目前的社区讨论本质是预期管理。
行业怎么看
看好的一方认为,持续学习是 Kimi 系列拉开差距的关键变量,这条路径可能让月之暗面在国内大模型梯队里卡到一个差异化位置。
但我们更想提三个风险。第一,Reddit r/LocalLLaMA 用户多为本地部署和开源爱好者,嗨点不能直接对标真实企业市场。第二,训练 token 数堆到 20T 量级后,边际收益已经在递减,更多 tokens 不必然等于更强能力,单位算力成本的回报才是关键。第三,月之暗面至今未公布 K3.5 训练细节与时间表,预期管理本身也是一种营销动作;对比 DeepSeek 走的是「低成本预训练+开源」路线,路径完全不同,行业格局远未定型。
对普通人的影响
对企业 IT:如果 K3.5 真的在代码或长文档场景继续提升,国内 API 选型多了一个对比项,采购议价空间会变大。
对个人职场:写作、编程、研究类常用 AI 助手的潜在升级,但短期内普通用户更可能先在 Kimi 网页版和 App 上感受到变化。
对消费市场:持续学习路线意味着模型迭代更快,C 端用户将面对更频繁的「突然变聪明」或「突然变笨」,需要重新建立使用习惯。