上线第3天,AI 总结功能就因未设输出上限触发成本告警,单次成本一度达到预期的6倍,我们判断:Token 预算(为模型处理和生成文本预先设定的计量上限)已经是生产系统的基础约束。文中另称,异常重试循环3分钟消耗了200万 Token,几乎用完当天配额。

这是什么

预算分三层:max_tokens(单次输出上限)限制一次响应,budget_tokens(内部思考预算)控制部分推理模型的推理消耗,Task Budget(整项任务总预算)控制 Agent(能拆步骤并调用工具的 AI 程序)多轮循环。文章在特定模型上的测试显示,思考预算从4000增至16000,答案质量近似,费用相差4倍。

但 max_tokens 不限制输入;过小会截断供系统读取的数据或代码,过大又会浪费,部分网关还会按声明上限预留配额。

行业怎么看

支持者认为,把预算写进接口和任务入口,才能把不可预测的模型账单变成可监控的配额;标题、代码补全、报告等场景应分别设上限,而不是套一个全局数字。

反对意见是,预算过紧会牺牲复杂任务质量,也不能阻止输入上下文持续膨胀。更可靠的做法是分层限额、按模型与任务监控,并为超限和工具重试设置明确停止条件;原文的“实测”只适用于特定模型与样本,不能直接外推。

对普通人的影响

对企业 IT:大模型费用有望从不可预测变成可核算,但长文档和复杂任务也可能因限额被截断,系统仍需准备重试、摘要或人工确认。

对个人职场:企业内部 AI 工具会更常设置输出长度和任务轮次限制,职场人应分段校验重要答案,不能默认“生成完成”就等于“内容完整”。

对消费市场:“无限使用”可能继续分层计价或设置额度,推理成本未必全部让给用户,价格下降与精细限流可能同时发生。