这是什么

DeepMind 这周公布了一项新尝试:把医学界的"双盲"思路搬进 AI 评测。所谓双盲,就是人类评委在比较两个模型的回答时,不知道哪个答案来自哪家——既不知道是 GPT、Claude 还是 Gemini。这套路在临床试验里用来排除安慰剂效应,在 AI 这里,目的是消除对知名品牌的先入为主,让"哪个更好"这个判断更接近真实水平。

行业怎么看

支持者认为,AI 榜单长期被品牌光环污染——同样的输出,标上 OpenAI 就得分更高,这种偏差让公开跑分越来越像营销工具。反对意见也很明确:匿名后外界更难验证过程是否公正;大厂失去了"我排第一"的营销筹码,未必愿意把自己送进匿名擂台。我们认为方向是对的,但距离"行业标准"还很远,关键看 OpenAI、Anthropic 这些对手是否愿意参与。

对普通人的影响

  • 对企业 IT:选型时"权威跑分"这根拐杖变细,可能要更依赖内部试点测试。
  • 对个人职场:写报告或做选型推荐时,"X 模型排名第一"会更难直接引用。
  • 对消费市场:用户短期内感受不到变化,但长期看 AI 产品的"品牌溢价"可能被削弱。