这周 Reddit 的 LocalLLaMA 板块(一个聚集本地部署开源大模型用户的英文论坛)有人发帖,放出一个基于阿里 Qwen 的 27B 参数变体,标题很直白:单 token 生成更慢,但综合结果更快更好。我们注意到,这种"用推理时长换回答质量"的打法——行话叫测试时计算(test-time compute)——第一次明确出现在中等规模开源模型上。

这是什么

简单说,作者拿 Qwen 系列做微调,让模型在给出最终答案前多走几步内部推理。代价是每生成一个字更慢,收益是准确率、逻辑链长度都上来了。这跟 OpenAI o1、o3 的核心思路一致:不是靠训练时堆参数,而是让模型"想久一点"。27B 是中等参数规模,能跑在一张消费级显卡(比如 4090)上,跟动辄上千亿参数的大模型形成对比。

行业怎么看

支持者认为这是开源社区的关键拐点:以前"慢思考"是大厂专利,因为多步推理烧算力、成本不划算;现在有人愿意接受速度换质量,意味着开发者愿意为"更好的回答"付时间成本。

反对意见同样明确:第一,目前只是社区个人实验,没有第三方独立复现,所谓"更好"可能在原作者测试集上过拟合;第二,27B 跑慢思考时单卡显存吃紧,落地成本未必真比直接调 API 低;第三,测试时计算的红利有上限——再慢下去用户体验崩塌,收益会快速递减。

对普通人的影响

对企业 IT:如果这类模型稳定下来,公司可能不再为大模型 API 付高额费用,一台本地服务器就能跑出接近 o1 水平的回答。

对个人职场:愿意等 30 秒而不是 3 秒拿答案,会成为新的工作习惯。写代码、做研究这类需要准确度的任务,慢一点反而是优势。

对消费市场:消费级 AI 产品(聊天助手、写作工具)短期内看不到这种变化——用户对延迟极敏感;除非硬件或算法再有突破,否则"快"仍是消费产品的第一指标。