社区开发者本周在 Qwen 一款 4B 模型上做了个测试:禁用「等等」「也许」这类犹豫词后,常用精度版本下 MATH-500 数学题正确率从 60% 涨到 66%,推理 token(模型生成的中间思考文字)反而减少 14.8%。这不是民间偏方 — 我们注意到,Meta 一篇论文早就指出,AI 解题时频繁蹦出这些词是「过度思考」的信号,禁掉它们反而更准。

这是什么

具体做法是用 llama.cpp(一种本地跑开源大模型的工具)的 logit bias(调整特定词的输出概率)功能,把「wait」「maybe」「perhaps」等近 50 个犹豫词全部压低。开发者测试了 BF16、Q8_0、Q4_K_M、Q3_K_M、Q2_K 五种精度(数字越小压缩越狠,显存占用越低但精度损失越大)。结果很整齐:BF16 从 74% 升到 84%,Q2_K(极端压缩版)从 12% 翻倍到 24%,几乎所有精度都有 6-14 个百分点的提升。

说人话:让 AI 解题时别自言自语,答案更准,成本也更低。

行业怎么看

支持方兴奋。这是开源社区的胜利 — 大公司发论文,普通开发者一周内就在不同精度上复现并扩展。推理 token 降 10-20%,意味着同样硬件能跑更多任务,对本地部署成本敏感的企业是直接利好。

反对意见也很明确。第一,这是单模型单测试集(MATH-500)的结果,结论不能直接外推到所有任务;第二,方法粗暴 —「however」「but」这类正常转折词也被禁了,可能损害语言连贯性;第三,聊天场景下没人愿意跟一个不会说「也许」的 AI 对话,体验会变「愣」。

对普通人的影响

对企业 IT:本地部署开源大模型的隐性成本可能继续走低,中小公司自建 AI 助手的门槛又降一截。

对个人职场:用 Qwen 等开源模型做数据分析、报表时可以试这个技巧,但写文案、对话场景就别指望也涨点了。

对消费市场:AI 解数学题、考试辅导类应用会更靠谱;聊天机器人的「语气」可能变机械。