这是什么
Reddit 上一位开发者用四台 NVIDIA DGX Spark(桌面级 AI 工作站)组成两组互联,跑了 DeepSeek V4 Flash、Qwen3.8 Flash Next、Qwen3.8-27B、Qwen3.6-35B-A3B 四款模型,重点测试「长上下文」(最长到 90 万 token)和「不同思考深度」对结果的影响。
他公开的数据里最值得记的是:把 AI 调成「深度思考」模式(thinking level 设到 high 或 xhigh),得分反而比 low 模式更低,输出 token 数(AI 生成的字数)却多出 3 倍以上。最极端一例:DeepSeek 高思考模式比低模式多用了 2.5 倍时间,得分却从 20/24 跌到 16/24。
行业怎么看
这件事和市面常见的 AI 营销话术是反的。过去一年,主流模型把「会思考」「深度推理」当作高端卖点——OpenAI 的 o 系列、Anthropic 的 extended thinking、各类国产「深度思考」开关,定价都比普通模式贵数倍,逻辑是「多想一会儿,答案更准」。
这位测试者的结论是:在他的任务集(12 道代码生成 + 12 道代码补全)上,深度思考是「主动的反作用」。他建议日常工作用 low 或 off 模式,复杂推理才考虑调高。
反对意见也要说:这是单一系列测试(24 道题),不是 LiveBench 公开榜的官方成绩,样本量小;任务偏代码补全,结论未必能推广到数学竞赛、论文写作等更复杂任务。模型厂商也未必会承认这个结论,把它当作「单一用户单一场景」会更稳妥。
对普通人的影响
对企业 IT:如果公司正在采购 AI 推理 API,「开不开深度思考」是直接的成本变量。盲目默认开启相当于按 3 倍 token 价买单,这钱花得值不值,需要业务方自己评估。
对个人职场:日常用各类 AI 助手时,可以试着关掉「深度思考」按钮,对照速度和答案质量。「开了显得更专业」未必是真的。
对消费市场:DGX Spark 这类桌面工作站能跑 90 万 token 长上下文,意味着大模型本地化的硬件门槛在持续下移,个人和小公司自建 AI 工具链的成本会继续降低。