掘金上有一篇被广泛收藏的文章,开发者 beixiyo 用了同一份规则文档两年没改,直到 Anthropic 升级到 Opus 4.8 后,AI 才"终于愿意遵守"——遇到不会的 API 不再编造,会主动说"我没验证过"。这件事看似只是一个工程师的吐槽,背后指向的是 AI 工具从演示到真正能用的临界点。
这是什么
这位开发者做的事情叫"AI 工作流配置":在 Claude Code(Anthropic 出的命令行 AI 编程工具)里写一份常驻规则文件 CLAUDE.md,告诉 AI 该怎么查资料、怎么写代码、遇到不确定时怎么处理。以前版本读到"以证据为准、不靠猜测"这条规则,依然会一本正经地编造不存在的函数。
变化发生在 Opus 4.8 之后。AI 开始主动说"我没验证过,请跑一下",会用 GitHub 命令(gh CLI,全称 GitHub 官方命令行工具)真的去拉仓库源码核对,不会的函数留 // @TODO 占位而不是编一个看着像的。这不是新功能,而是"诚实"终于从规则层面落到了行为层面。
配套的还有一套搜索路由:先把"去哪里查"写死——已知的库走 context7-mcp(一个把官方文档喂给 AI 的接口),已知仓库用 gh 查源码,不知道仓库用 gh-grep-mcp 全网搜代码片段,最后才是联网搜索。文章附带的配置文件已经开源到 GitHub。
行业怎么看
支持者认为,2024 年大家关注的是模型能做什么,2025-2026 年的战场变成了"模型愿不愿意听话"。Anthropic 这次升级重点之一是"行为校准"(让模型真的遵守显式指令而不是装作遵守),对认真配工作流的人是一次回报。
另一种声音更冷静:一位开发者在评论区指出,这本质上还是"工具的胜利"——再聪明的模型,给它一个能直接拉 GitHub 源码的命令行(gh CLI)和一个干净的文档接口(context7),表现都会上一个台阶。所谓"模型终于听话",有相当比例是"工具链终于齐了"。还有读者怀疑这是 Anthropic 的软文,但缺少独立证据。
更现实的判断是:这件事对个人开发者影响明显,对企业 IT 部门意义有限——后者卡的不是模型听不听话,而是权限、数据合规、审计,公司里的 Claude Code 多数时候根本不让联网查 GitHub。
对普通人的影响
对企业 IT:短期内不会变。模型升级的收益大多流向能用 CLI 工具、能直连 GitHub 的个人工程师,企业的数据出域红线还在,工具链改造优先级靠后。
对个人职场:会写代码的人最先受益——尤其是每天都在用 AI 但经常被"AI 编的代码跑不起来"折磨的那批。不会写代码的人感受到的差别可能更小,因为工作流的精髓在于文件、命令、权限这套东西。
对消费市场:间接影响。AI 工具更"老实"意味着它犯的低级错误更少,但不会突然变聪明——消费者不用关心版本号,工具好不好用会自己反映在结果里。