这是什么
Reddit r/LocalLLaMA 社区一个团队测试了 1.5B 到 120B 的开源模型(B 指十亿参数,参数越多模型理论上能力越强),发现 120B 模型在'自信胡说'时输出完全相同的错误答案 —— 这打破了'模型越大越靠谱'的常识。
他们研究的问题很实际:本地用 Ollama 等工具跑大模型时,怎么知道 AI 在一本正经胡说八道(行业术语叫'幻觉' hallucination)?传统学术方法是'语义熵'(Semantic Entropy)—— 让模型回答 5 次,用 DeBERTa 这种额外的小神经网络判断答案意思是否一致,再算混乱度。但本地硬件跑这个代价高:占显存、慢 100 毫秒以上、吞吐量崩。
他们的替代方案很朴素:直接用字符串匹配 + Shannon 信息熵(一种衡量'不确定性'的数学方法),纯 CPU 跑,1.3 微秒完成,不吃 GPU。
行业怎么看
他们拿 Qwen、Mistral 系列在 GSM8K(数学题)和 TriviaQA(百科问答)上跑了对照实验,结果分四档:
- 1.5B 小模型:AUROC(分类器效果指标,1.0 满分)约 0.58。模型太小,格式都不统一,匹配不上。
- 7B 中型:AUROC 约 0.71,意外追平重型 DeBERTa 模型(0.706 vs 0.705)。
- 27B 大模型:AUROC 约 0.89,效果最好。
- 120B 顶级模型:AUROC 跌到 0.09,几乎完全失灵。
最后一条是研究最炸的发现 —— 他们叫它'前沿陷阱'(Frontier Trap):120B 模型幻觉时,5 次独立采样给出完全相同的错误答案,'自信地胡说'还高度一致,连传统检测方法也救不了。
反对意见值得说:测试只在 TriviaQA 和 GSM8K 两个数据集上跑,覆盖场景有限;社区也有人担心这个结论会被误读成'小模型更安全'——实际上小模型只是更容易被发现胡说,不是更不容易胡说。这是两个完全不同的事。
对普通人的影响
对企业 IT:本地部署开源模型做结构化任务(数学、代码、SQL 抽取、JSON 解析),27B 是性价比甜点;超过这个规模,需要专门搭'幻觉一致性'防线,不能默认越大越稳。
对个人职场:用 AI 写周报、做数据查询、查资料时注意 —— 如果 AI 连续几次给出相同答案,不一定是真的,可能是'自信的胡说'。关键决策换个模型或换个问法再验一次。
对消费市场:本地 AI 工具在变便宜(开源模型 + Ollama 类工具普及),但'越大越贵'不等于'越大越靠谱'——未来 AI 选型会从'参数竞赛'转向'任务匹配 + 防幻觉机制'。