Salesforce 这周公开了一组数字:他们用 AWS 新工具把 AI 推理(让大模型跑起来算答案)的 GPU 成本压到原来的 1/8。值得关心的是,省钱不是故事的全部 — 真正难的是省钱之后的事。
这是什么
Salesforce 主推的 Agentforce 是他们的 AI Agent 平台,底层跑在 AWS 上。原本一个 GPU 跑一个模型,他们改成多个模型共享同一批 GPU,成本直接降到 12.5%。问题是 AWS 的默认调度逻辑只管省钱,不保证「多可用区容灾」 — 也就是同一个模型的副本能否均匀分布到不同机房,一旦某个机房出故障,整个模型就不可用。企业级 AI 接受不了这种风险。
AWS 为此新加了一个参数 SchedulingConfig,让企业自己指定「每个可用区放几份、按什么策略摆放」。本质上是把「省钱」和「可靠」拆开,让企业按合规要求自己配。
行业怎么看
支持者认为这是云厂商成熟的标志 — 不再只卖算力,开始卖「可配置的工程能力」。八倍降本的具体数字也说明 AI 基础设施的优化空间比想象的大。
但我们注意到另一面:这个方案本身就是 AWS 现有调度机制的补丁。Salesforce 能自己写代码解决,是因为他们有顶级工程团队;多数企业没有。换个说法,AI 基础设施的「企业级」标准目前还在被大客户逼着长,远未到开箱即用。被忽略的成本还有:每多一层调度配置,就多一层运维负担 — 省下的 GPU 钱,可能被工程师工资吃掉。
对普通人的影响
对企业 IT:「AI 项目预算」不该只算 GPU 钱,更要算合规和容灾的隐性成本。董事会上讲八倍降本之前,先确认 SLA(服务等级承诺,即对客户承诺的可用性数字,比如 99.99%)能签到几个 9。
对个人职场:AI Agent 上线后,「系统怎么又挂了」会变成更常见的工作内容。可靠性问题正从互联网公司 IT 部门,扩散到所有用 AI 的业务部门。
对消费市场:当 AI 嵌入客服、银行、政务等场景后,一次机房故障的影响会被放大。我们对「AI 宕机」的容忍度,会比传统软件低得多。