一份 800 美元的账单最近在开发者圈流传:某团队用 GPT-5.6 旗舰版跑了一整天,老板当场变了脸。我们注意到这不是孤例——OpenAI 把旗舰模型拆成 Sol、Terra、Luna 三档,再叠加六档'推理强度'(让模型多想一会儿再答),组合接近 30 种。选错一次的代价,是成本差 5 倍、延迟多 10 秒,但答案质量未必同步提升。

这是什么

三款模型按性能分:Sol 是旗舰(跑复杂代码、深度推理),Terra 是主力(覆盖 80% 日常任务),Luna 是廉价版(做分类摘要等高频小任务)。输入价每百万 token(token 大致相当于一个汉字或半个英文单词的处理单位)5/2.5/1 美元,输出则贵 5 倍。

每款配 none 到 max 六档推理强度。档位越高,模型多想一会儿——但不是线性变准。从 high 调到 max,成本再翻 2-3 倍,质量提升有限;个别情况反而因想太多而出错。

行业怎么看

一种声音认为这是好事:模型分层让企业能像买云服务一样按需付费,Terra + medium 对大多数业务够用,是真正的 AI 普惠。

但反对意见存在。AI 架构师的普遍担心是:30 种组合本质上是把'调参焦虑'从数据中心搬进了企业 IT 部门。没有专门优化团队的中小企业,往往只剩两个结局:要么盲选最贵版(800 美元的教训),要么保守退回 Luna 导致效果不行。

更深的判断是:OpenAI 在用定价逼用户'算账'。max 档一次调用可能 2-5 分钟、几美元——只有高价值、低频次的任务才配得上这个成本。AI 时代最大的浪费,可能就是'大炮打蚊子'。

对普通人的影响

企业 IT:预算结构要变。原来'AI 一笔费用',未来要拆成'基础设施 + 推理优化'两笔账,否则 800 美元的故事会反复上演。

个人职场:白领可能多一类'AI 用得贵不贵'的工作场景——运营、客服、内容岗使用 AI 工具的成本开始被算进绩效。

消费市场:暂时没直接影响。AI 应用价格战打不起来前,消费者用到的 ChatGPT 类产品仍是统一标价。