这是什么
OpenRouter 最新《State of AI》报告披露了一个被多数人忽略的数字:在 100 万亿 token(模型处理文字的最小单位)的真实调用样本中,单次请求的平均 prompt token(输入给模型的文字量)相比早期翻了约两番,接近 4 倍。这不是用户问的问题变长了,而是 Agent(能自主规划、调用工具、跨步骤完成任务的 AI 程序)在每次执行时,要把历史对话、工具结果、子任务上下文一起塞回给模型。
NVIDIA 这周端出的 Vera Rubin 与 Blackwell 两套 GPU(图形处理器,AI 训练与推理的核心芯片),主打卖点不是"更快",而是"每瓦性能"(Performance per Watt,即每消耗一度电能跑出多少计算能力)。换句话说,NVIDIA 已经默认一件事:Agent 时代算力的瓶颈不再是峰值速度,而是电费与散热。
行业怎么看
乐观派认为,硬件升级会复刻 2023 年那波"算力降价潮",让 Agent 落地成本断崖式下降,中小公司也能跑多步推理。NVIDIA 自己在博客里强调,Blackwell 在相同任务下能效比前代提升一个数量级。
但冷静的声音来自两个方向。一是电力基础设施侧:美国 Data Center Dive 等媒体近期反复指出,弗吉尼亚、俄勒冈部分数据中心园区已经因为变压器排队而暂停接入新机柜,GPU 再省电,机房也装不下了。二是模型架构侧:有研究者认为,真正能压住 Agent 成本的应该是"上下文压缩"与"分阶段缓存",而不是堆更猛的卡。Anthropic 在 MCP(Model Context Protocol,让模型调用外部工具的统一协议)上的布局,本质就是在做这件事。
还有一个容易被绕开的风险:能效数据是 NVIDIA 官方测试,在真实多步 Agent 工作流里,内存带宽(GPU 与显存之间搬运数据的速度)往往是更紧的瓶颈,每瓦性能未必等于每美元性能。
对普通人的影响
对企业 IT:如果在评估 Agent 采购,不要只盯 API(模型厂商对外提供的调用接口)单价,要追问"每次完整任务"的总成本——过去 6 个月这个数字可能已经悄悄翻倍。
对个人职场:用 AI 写周报、做表格的人感受不明显,但如果你开始让 AI 帮你"连续办多件事"——查数据、改格式、发邮件——背后调用量是问答式使用的 3-5 倍,这是月底账单变厚的前兆。
对消费市场:智能音箱、AI 助手这类 C 端(消费者端)产品的"无限使用"套餐大概率会调整定价或限流,因为厂商自己也扛不住每用户 4 倍的 token 消耗。