这是什么
本周掘金一位开发者用赛博版《清明上河图》、天文机械钟、超级玛丽复刻三道高难度 Agent 任务(让 AI 自主完成多步骤复杂编程)实测两款国产模型——MiniMax 3.1 和太空兔(Space Bunny)。结论是:太空兔略好,但都明显落后 OpenAI 和 Anthropic 的旗舰。
具体看:赛博版《清明上河图》环节,MiniMax 用 56 分钟,太空兔用 44 分钟,两家都在努力表达空间感,太空兔细节更精致但桥的位置关系画错。游戏复刻更糟——MiniMax 折腾 37 分钟给出一个空白页(控制台一堆语法错误),太空兔虽然能跑通,但角色、地图还原度都很低。作者原话:「花一两个小时拆开精美的盒子,里面放了一坨东西。隔壁 Claude 旗舰一下子拆开,里面真的有精致的礼物。」
值得关心的是另一组数据:太空兔在 OpenRouter(AI 模型 API 聚合市场)上以 28.4T tokens 登顶,超过 DeepSeek、GLM、Xiaomi MiMo 等。关键变量:它免费。
行业怎么看
支持方的判断是:两家都走了「多轮迭代+截图验证」的标准 Agent 流程,说明底层架构跟上了主流。能意识到任务复杂、拆步骤、验证效果——这本身就是进步。
但我们更倾向反方意见:流量第一 ≠ 能力第一。OpenRouter 第一靠白嫖,不是好用。太空兔在功能层面胜过 MiniMax(按钮能点、月相时间对),但表盘飞起来这种基础 UI 没修干净;MiniMax 更夸张——为了截图,把 Chrome 复制了 4 份浪费大量 token,一行命令就能搞定。比起 Claude 旗舰能 90%+ 还原经典游戏的水平,差距是肉眼可见的代际差。
更深一层:免费策略换来短期 token 量,但换不来 PMF(产品找到可持续付费市场)。MiniMax 之前高调宣传「编程智能体全球第一」被打脸后停更很久,这次悄悄更新 3.1 算是务实——但安静不解决能力问题。在 Anthropic 和 OpenAI 猛烈的炮火下,国产大佬集体安静是合理选择,问题是安静多久才能拿出真东西。
对普通人的影响
- 对企业 IT:免费模型适合 PoC(概念验证)和原型阶段,但生产环境、复杂业务逻辑、长链路任务仍要预算留给付费旗舰。控制成本不能以牺牲稳定性为前提。
- 对个人职场:程序员若用 AI 写游戏、可视化工具、多步骤项目,国产模型目前还不能放手让它干完,重要项目要预留时间复核和做对。
- 对消费市场:免费 AI 产品还会越来越多。今天的免费是明天的付费转化漏斗,也可能是「不再免费」的试探。消费者短期记住免费,长期要看实际能力。