开发者社区这周在流传一个叫 crewai-pse 的开源项目 — 它用 30 行正则表达式(一种文本模式匹配工具),让一个程序去检查另一个 AI 写的文章有没有虚构的类名、文件路径。这件事值得关心,因为它戳中了行业被回避的问题:让 AI 审核 AI,本身是个逻辑死循环。
这是什么
AI 行业现在流行“多智能体协作”(Multi-Agent,多个 AI 角色分工合作的架构)。比如写一篇文章,规划、撰写、审核各由一个 AI 环节负责。听起来分工明确,但审核环节本身也是个大语言模型(LLM)— 它审的是另一个 LLM 的输出,就像让嫌疑人自己评判自己的证词。
crewai-pse 的解法很老派:放弃让 AI 做质检,改用正则提取文章里所有反引号包裹的代码标识符,再用 grep 去磁盘搜有没有这个文件。搜不到就标红,让人来改。正则匹配是确定性的 — 搜不到就是搜不到;LLM 评估是概率性的,它会“觉得”某个类名存在,只是因为训练数据里见过类似命名。
行业怎么看
支持者认为这呼应了软件工程的老原则:能用确定性代码验证的事,就别让概率系统判断。这不是倒退,是把“AI 不能做什么”想清楚了。
反对声音也成立。这个方案能抓代码引用,抓不住数据虚构、人物杜撰、历史事件捏造 — 这些才是 AI 幻觉的重灾区。有人评价:“用正则验证 AI 输出,就像用算盘做现代审计 — 能用,但远远不够。”
更现实地说:多数企业连“AI 生成 + AI 评估”这套都没搭起来,先别讨论替代方案。crewai-pse 的真正价值不在可复制,在于提醒行业:AI 系统的可靠性,不能靠堆 AI 解决。
对普通人的影响
对企业 IT 和数据团队:值得问一句 — 你们用的 AI 文档生成、报告系统,最后一公里的“质检”是谁在做?如果是另一个 AI,得想想出了错谁负责。
对个人职场:ChatGPT、文心一言写的方案,关键数据、客户名、项目时间,正则救不了你 — 这些只能人眼复核。AI 越自信,你越要慢一点。
对消费市场:未来 AI 助手会越来越“流畅地胡说”,用户得建立基本判断力 — 凡是听起来太顺、太完整的回答,都该多问一句“这是真的吗”。