这是什么

阿里这周发布 Qwen 3.8 27B(270 亿参数版本),知名开发者 Simon Willison(Django 框架共著者,长期评测 AI 模型的技术博主)给出的评语是:"模型本身很优秀,但默认过度思考。" 所谓"过度思考",指模型出厂默认开启 Chain-of-Thought 推理链(即在回答前先在内部一步步推演),即使面对简单问题也要消耗大量 token(模型处理和计费的最小文本单位)和等待时间。结果是:用户问得越简单,钱花得越冤枉,响应也越慢。

行业怎么看

这件事值得我们专门拎出来看,因为它不是孤例,而是开源中小模型近半年来的一个普遍症状。 乐观一方会说:27B 能跑到这个水平本身就是胜利——小参数路线在逼近闭源大模型;开发者只需在调用层关掉推理链即可。Simon Willison 自己的倾向也偏这一边。 但反对声音更值得听:模型"默认过度思考",说明厂商在按 benchmark(跑分测试集)调优,而非按真实使用成本调优。一个被训练成"先穷举再收敛"的模型,部署到生产环境(真实业务场景)后,每一次 API 调用都在烧钱。如果再用 Agent 架构(让 AI 自主串联多个工具完成多步任务),每一步决策都会被这种倾向放大。 我们认为更大的隐患在生态层面:如果开源社区把这种默认配置当成事实标准,"过度推理"会成为整个生态长期承担的隐性税——因为没人主动去关掉一个藏在默认值里的开关。

对普通人的影响

- 对企业 IT:我们建议选开源模型搭内部问答或知识库前,先压测 token 消耗和响应延迟——"跑分强"和"用得起"是两件事。 - 对个人职场:如果你在用 Qwen 系列 API 做工作流,记得在调用层关掉默认推理链(通常是一个开关参数),这是当下最直接的省钱手段。 - 对消费市场:未来 AI 产品会分化成"快答型"(便宜、快、不一定准)和"深思型"(贵、慢、更稳)两类,用户会被训练出"什么时候该等"的判断力。