这是什么

阿里云 EMR(大数据处理平台)负责人李钰本周在 Apache Flink Forward Asia 2026 上提出一个判断:AI 数据基础设施的下一战场不在模型,而在底层数据是否被整合到「一份」。我们注意到,目前绝大多数生产级 RAG(让模型先查资料再回答)和 Agent(能自主调用工具完成任务的 AI)系统,跑的都是「双系统架构」——一边是数据湖(保存原始数据的超大仓库),一边是向量数据库(把数据转成数学坐标、按相似度检索的专用库),中间靠一长串 ETL(定时搬运和转换的脚本)串起来。早期能跑,但 Agent 一旦持续读写、频繁更新,问题就会浮出水面:数据改一次索引就要重刷,线上和离线看到的可能不是同一份数据,冷数据也得常驻集群付费。

行业怎么看

共识是,存储、治理、检索这三层正在向同一份数据收敛。分歧在于由谁来牵头。Databricks 从 Lakehouse(湖仓一体架构)一侧往外扩,Zilliz(Milvus 背后公司)从向量库一侧往外扩,而阿里云代表的 Paimon × Milvus 路径,强调湖格式中立、引擎可替换,绕开「数据归谁」这个敏感问题。但我们也想提一条反对声音:把湖格式当成统一底座,意味着 Spark、Flink、检索引擎都要深度耦合,工程复杂度未必下降;同时向量检索追求极致低延迟,把它和湖存储粘在一起是否会以性能换通用性,目前仍缺大规模生产案例验证。

对普通人的影响

对企业 IT:数据团队可能从「两套系统运维」回归到「一份数据管理」,治理成本下降但选型复杂度上升,未来两年湖格式之争会直接影响采购决策。

对个人职场:懂「湖仓一体 + 向量检索」全栈的人会变稀缺,传统 ETL 工程师需要补齐 AI 工程能力,单一技能溢价开始收窄。

对消费市场:基础设施整合会传导到应用层,多模态检索(同时理解文本、图片、视频的搜索)和长期记忆型 AI 产品的落地速度可能加快,但具体便宜多少、什么时候来,目前看不清。