这周一个简单测试给我们提了个醒:阿里千问系列新模型 Qwen3.8-27B 在三档「推理强度」(让模型生成前"多想一步"的设置)下跑同一任务——画一张"骑着自行车的鹈鹕"SVG 图。结果:最高档 xhigh 耗时 717 秒,是最低档 low(111 秒)的 6.4 倍,视觉评分只从 21.8 提到 24.0(满分 25)。10% 的质量提升,要 7 倍算力成本。

这是什么

Qwen3.8-27B 是阿里千问系列中等尺寸的开源模型,可在消费级显卡(如 RTX 5080 笔记本、16GB 显存)上本地运行。所谓"推理强度三档",指的是让模型在回答前进行不同程度"思考"的开关——low 几乎不思考直接答,xhigh 会在内部反复推演后再输出。这次测试用的提示词要求模型只返回一张"骑着自行车的鹈鹕"的标准 SVG 代码,不带解释。

行业怎么看

支持者说,可调档机制是工程上的进步——复杂数学、代码生成用 xhigh,简单问答用 low,用户能按场景付费。反对声音有两类:一是测试本身不严谨(只跑了 3 个种子、单一任务、第三方评分),不能当结论;二是即便如此,测试暴露的"边际收益递减"问题是真的。如果产品经理习惯让 AI"开最大脑",单次 API 成本可能翻 7 倍,但用户感知到的质量提升不到 10%——这中间的成本黑洞,是 2026 年 AI 落地的真问题。

对普通人的影响

对企业 IT:API 计费模型需要重新设计,按档位差别定价或默认低档、让用户主动升级,否则云账单会失控。

对个人职场:用 ChatGPT、Claude、文心一言等的"深度思考"模式时,要判断哪些任务真值得等——改写一封邮件大概率不需要 xhigh。

对消费市场:未来 AI 订阅很可能分层(基础版 vs 深度思考版),差价会拉大,免费用户可能只能用 low 档。