AWS 这周发了一个不起眼的更新。我们注意到它,是因为背后藏着一个数据:一家做欺诈检测的公司,每秒要往 5 个特征库写 1 万条数据,这意味着每秒钟 5 万次 API 调用。这种"调用海啸",正是企业 AI 项目从演示走到生产时的常见死法。
SageMaker Feature Store 是 AWS 的机器学习特征中台——可以理解成给 AI 模型存放训练和推理所需"特征数据"的中央仓库。这周它新增两个 API:BatchWriteRecord 一次最多能写 25 条记录,ListRecords 可以枚举库里到底有什么。
这是什么
简单说,AWS 在帮企业 AI 项目解决两个具体的工程瓶颈。
第一个:过去写一条特征数据就要调一次 API,现在可以攒 25 条一起调。按欺诈检测那个例子,原本每秒 5 万次调用,能压到大约 2000 次。对 AWS 这种规模的客户来说,能省钱;对依赖这条管线的应用层来说,延迟和稳定性都会改善。
第二个:之前使用内存存储层(速度更快但容量有限)的客户,一旦丢了数据标识就找不回来——没有备用的离线库可查。新加的 ListRecords 相当于给内存库补了一个"找回通道"。
按 AWS 的说法,这两个功能对现有用户免费开放,不另外收费。
行业怎么看
我们观察到两种声音。
正方观点认为这是被低估的更新。企业级 AI 项目失败率高,一个常被忽视的原因是"工程债"——演示跑得很顺,到生产环节就卡在 API 调用、状态查询、数据找回这类不起眼但必须做的事上。这次更新说明 AWS 在认真补基础。
反方意见更尖锐:开源方案 Feast、商用方案 Tecton 早就有批量写入和枚举能力,AWS 这只是"追平"。而且这两个 API 只对已经在用 SageMaker Feature Store 的人有效——根据我们的观察,绝大多数中国企业的 ML 特征管理并不跑在 SageMaker 上,这波更新对它们而言是"看到就好"。
更深一层看,AWS 在 ML 平台层的整体处境并不轻松。SageMaker 近年增速放缓,Databricks、Snowflake 都在往特征存储方向伸手。补一个 API 容易,把企业的 ML 全栈留在 AWS 上难。
对普通人的影响
对企业 IT:已经在用 SageMaker 的中大型企业,AI 项目的运维成本会下来一截。但前提是你已经在用——没在用的话,不必因为这次更新迁移过去。
对个人职场:能把 AI 从演示带到生产的工程师(数据工程师、ML 平台工程师方向)会更值钱。这类人在当前招聘市场上属于明显的稀缺型——企业不缺 AI 创意,缺的是把创意变成稳定服务的人。
对消费市场:间接且缓慢。当更多企业的 AI 后台跑顺了,你用的智能客服、推荐系统、风控提示才会更稳定、更及时。但这个传导通常需要 6-12 个月才会在消费者层面有感。