这是什么

来自 laugh.so 团队的一项研究追踪了 3 个开源模型——Tulu 3(基于 Meta 的 Llama 3.1 70B)、OLMo 3.1 32B 和阿里 Qwen2.5——在 11 个后训练阶段(post-training,即在大模型预训练完成后、用来教会它理解和回答人类指令的二次调优)的变化,用 100 个讲笑话的提示、64 名人类评分员、2330 次两两对比得出一个清晰结论:

后训练确实让模型更好笑了——7 个训练步骤中有 5 个被判定更好笑,笑话平均缩短 10-20 词,更快到梗。但代价是多样性塌方:6 个步骤中,模型对同一提示的输出越来越像,要 8 个不同笑话,它给 8 个变体。其中 Qwen2.5 从基础版到指令微调这一段,是多样性跌幅最大的一次。

研究把这种交换叫做"幽默税"(humor tax)。

行业怎么看

这项研究的方法论值得肯定——它是少数能逐阶段拆解后训练影响的工作,覆盖的也都是读者熟悉的开源模型。

但也有冷静声音。有研究者指出,"幽默"只是后训练影响的冰山一角,更值得关心的是这种"多样性下降"是否同样发生在推理、写作、代码等更实用的任务上。也有产品经理私下对编辑部说:这恰好解释了为什么市面上 AI 助手越来越像——大家都在用类似的 RLHF(人类反馈强化学习)方法做后训练,模型被优化得"安全、礼貌、像那么回事",但创造性在被系统性地磨平。

研究还试了一个反直觉的解法:让模型讲笑话前先"规划一两句"。结果所有 4 个模型的多样性都掉了,但好笑程度没有稳定提升——"打草稿"并不能让 AI 更会讲笑话。"喜剧人设"提示词能挽回一点多样性,却只让 2 个模型更好笑。

对普通人的影响

对企业 IT:如果你们在用 AI 做营销文案、品牌口号、社媒内容,需要意识到:模型越"成品化",输出越同质化。要多样性,可能得刻意保留基础模型或更早的训练阶段。

对个人职场:为什么你让 AI 帮你头脑风暴,给的方案都大同小异?这不只是提示词的问题,是后训练阶段就把多样性修剪掉了。换更早期的模型或多换几次随机种子(生成时的随机起点),可能比改提示词更有效。

对消费市场:所有 AI 助手越来越像同一个产品,并非巧合。当行业都依赖类似的后训练流水线,"听起来像 AI"会成为新的同质化——未来差异化可能不靠模型本身,而靠产品形态和数据接入。