我们注意到,2025 年的 Agent 产品几乎都面临同一个尴尬:对话越长,AI 越容易跑偏。用户改了三轮 PPT 后,Agent 已经分不清哪版是当前版、哪条意见已作废。技术圈开始反思——问题不在模型记性不好,而在以"对话"作为主要上下文这件事本身就不对。
这是什么
作者把当下 Agent 的工作方式称作"以对话为中心":用户说需求,AI 看历史消息,再动手改。但对话是过程日志,需求、解释、尝试、失败、反馈全堆在一起,信息密度越聊越稀。
与之相对的是"以产物为中心":每轮 Agent 先读当前文件(PPT、代码、表格),拿到的是"现在的真实状态",再结合用户本轮新要求去改,改完通过运行环境验证。
为什么 Coding Agent(写代码的 AI 助手,如 Cursor、Devin)整体更靠谱?除了模型本身强,更关键的是代码本身就是一种"AI 友好"的产物——文本结构、能搜索、能局部改、有 Git 版本(每次修改的差异记录)和测试做验证。PPT、Word、3D 模型就麻烦得多:要让 AI 读懂页面结构、视觉关系、空间状态,再让运行环境渲染出来,目前还没有成熟的"读取—修改—展示—验证"机制。
行业怎么看
这条思路和近一年 Agent 领域的共识一致:上下文工程(Context Engineering,即如何给 AI 准备"工作记忆")比提示词工程更重要,而"用什么当工作记忆"是核心问题。Anthropic、LangChain 都在探索让 Agent 直接读外部状态、减少对长对话的依赖。
但也有反对意见值得警惕。第一,文章描述的理想方案要求每类产物都有专属的解析和验证层,工程量巨大,更像微软、谷歌、Adobe 这种"手握文件格式"的公司才能做好,独立 Agent 创业公司反而可能掉队。第二,聊天为主的 Agent 之所以流行,恰恰因为大多数用户的思维是"边说边想",强推产物中心会牺牲易用性。第三,把产物当唯一真相来源,会掩盖对话里的判断和取舍——这些隐性知识(程序员中俗称"tribal knowledge")恰恰是 Agent 最难复现的部分。
对普通人的影响
对企业 IT:如果未来 Agent 真要"以产物为中心",企业需要为 PPT、合同、图纸这些核心文件建立版本化和可机读的访问权限,否则 AI 拿不到"当前真实状态",还是会回到对话混乱的老路。
对个人职场:短期内,不要指望和 AI 多聊几轮就能让 PPT 越改越好;更有效的做法是每次只给一轮增量需求,并把当前文件直接交给它作为起点。
对消费市场:可以观察接下来 12 个月,看 Office、Google Workspace、飞书、钉钉会不会推出"产物感知"型 AI——能直接读懂并修改你的文档,而不是只在旁边陪你聊天。