这是什么

上周 arXiv 一篇量化论文记录了一次 AI 自审系统的翻车:让一个大模型写日内交易特征,让另一个大模型审它的因果逻辑——两轮下来双方都批准了一个含"未来数据"的特征。具体来说,那个特征用"当天累计成交量除以全天总成交量",而全天总量在预测那一刻根本还没发生。人工复查才找到这个泄漏。 值得关心的是,论文给出的解法不是"训练一个更聪明的审稿 AI",而是换思路:在数据切分、特征定义、评估器上加锁,让 AI 只能从一组固定的"因果算子"(即预先批准的操作清单,例如"求均值""做差分")里选,不能任意拼装特征。在这个受限空间里,那个会泄漏未来的除法根本不存在。

行业怎么看

支持方认为,给 AI 越多自由就越容易出"听起来合理但暗藏 bug"的产物。限制工具集是务实的工程妥协,比堆算力训更强的审稿 AI 更可控。 我们认为反方同样值得听:算子注册表虽然能让已知错误无法出现,但也限制了 AI 能发明的范围。量化研究的价值经常来自人脑想不到的奇怪特征;锁死操作等于锁死了这部分探索。论文本身也承认,目前没公开数字证明这套"受限版"在实盘表现更好。 这件事归根到底是工程选择题,不是模型能力题。

对普通人的影响

  • 对企业 IT:当 AI 被引入生产链路(写代码、审代码、查合规),最贵的不是模型授权,是围绕它的边界设计——哪些数据能看、哪些操作能调用。这笔账比买模型更早要做。
  • 对个人职场:很多人已经在用 AI 帮你写、改文档。知道 AI 自审也会看走眼,能让你别盲目相信"让两个 AI 互相对一遍"就稳了。
  • 对消费市场:短期内不会有人把工资交给 AI 理财助手;这件事正好提醒:产品宣传里"AI 多重校验"听着硬,工程上一道没对齐就全白搭。