这是什么
阿里云在 2026 云栖大会上把 DLF、Flink、EMR Spark/Ray/Daft、StarRocks、Milvus 五个数据产品重新打包为"Agentic Lake + Agentic Streaming"体系,释放一个明确信号:数据基础设施的主客户,正在从人变成 AI Agent(能自主执行任务的 AI 程序)。
开源大数据平台负责人王峰用"四个转变"概括了这次演进——数据结构从文本扩展到音视频等全模态;分析算子(处理数据的内置功能)从 BI 统计升级为 AI 推理;管理方式从封闭数仓走向开放湖仓(数据湖+数据仓库的混合架构);用户类型从自然人分析师转变为 AI Agent。
落到具体产品:DLF 用 Apache Paimon 作为核心湖格式(湖格式即数据湖中组织文件的统一规范),兼容 Lance、Iceberg 等,对接对象存储、关系数据库、实时视频流和钉钉/语雀等知识库;EMR Ray + Daft 处理向量化(把图片、文字转为 AI 能理解的数字序列)、标注、质量评估这些 AI 数据准备工作;StarRocks 提供标量+向量+全文的混合检索(按多种条件同时查找);Flink 则从流式计算引擎升级为 Streaming Agent 运行时平台。
这套体系已经在两个场景跑通:舞肌科技用 EMR Ray 构建第一人称手部三维重建管线,卓驭科技用 StarRocks 做智驾数据的故障回溯和相似场景检索。
行业怎么看
支持方认为这是必经之路。自动驾驶、具身智能(让 AI 操控机器人或汽车等物理设备)这些 AI 原生场景,每天的训练数据本身就是图像、点云(激光雷达生成的三维坐标点集)、视频混合,传统数仓的"只存表格"思路撑不住。阿里云把 Paimon 2.0 原生支持 LeRobot、RLDS、HDF5 这些具身智能行业格式,是冲着训练数据需求最旺盛的客户去的。
但也有冷静声音。几个值得留意的风险:第一,"五个产品协同"的整合复杂度极高,企业 IT 团队要同时维护湖格式、流处理、向量检索、AI 管线——这是一笔容易被发布会隐去的运维成本。第二,Agentic Lake 的前提是 Agent 真的需要这么复杂的湖仓架构。如果 Agent 主要靠 API 调取而非直接查询数据存储,中间这层平台可能反而冗余。第三,全模态数据的存储与计算开销显著高于结构化数据,AWS 和 Databricks 都在推类似概念,但成本模型都还没有清晰答案。
对普通人的影响
对企业 IT:未来两年规划数据平台时,需要重新评估"人"和"Agent"两类用户的比例——传统数仓路线可能撑不起 AI 训练场景,但盲目上"全模态湖仓"也可能跑出一笔算不清的账。
对个人职场:数据工程师、平台架构师的技能栈正在被重写——Paimon、向量检索、Agent 运行时这些原来只在 AI 基础设施团队出现的词,会逐步进入更广泛的数据岗位招聘需求。
对消费市场:现阶段影响还远。Agentic Lake 的成熟度决定了你家扫地机器人、自动驾驶汽车背后那套训练数据链路能不能跑顺,但不会直接改变产品体验——至少未来两年内是这样。