一位 Reddit 用户在 M5 Max 笔记本上跑出的实测数据,正在戳破「本地化部署开源大模型」的一个关键幻觉:所谓「深度思考」模式,token 消耗是普通模式的 5.5 倍、推理耗时 6 倍。

这是什么

事情源于 r/LocalLLaMA 上一位用户(u/DerTomsn)在 MacBook Pro M5 Max(苹果 2025 款旗舰笔记本芯片)上用 oMLX(针对 Apple Silicon 优化的本地推理框架)跑的实测。模型是通义千问团队发布的 Qwen3.8-27B,测试「思考模式」(xhigh 档,即让模型在给出最终答案前先输出长串推理过程)开启与关闭两种状态的差异。

数字很直接:开思考模式,token 消耗涨 5.5 倍、推理耗时涨 6 倍。关掉呢?输出质量明显下滑,整体表现掉到同期 MoE 模型(MoE = Mixture of Experts,混合专家架构,即模型只激活部分参数、跑得更快)Qwen3.6-35B-A3B 之后。换句话说:这个 27B 级别的模型,「会思考」是它的核心竞争力,但代价是 5-6 倍的算力账单。

行业怎么看

这件事值得放在两个趋势的交叉点看:第一,「推理模型」(Reasoning Model,即在给出最终答案前先进行长链思维的一类模型)从 OpenAI o1 开始被行业普遍接受,DeepSeek R1、通义 Qwen3、文心 X1、Claude 都加了类似机制;第二,本地部署(self-hosting,即企业自建服务器跑模型)一直被视作降低 AI 成本、保护数据隐私的最优解。

但这次实测戳破了一层窗户纸:所谓「本地部署省钱」,前提是模型不思考。一旦用户真的用上「深度思考」功能,token 成本曲线不是线性增长,而是 5 倍跳变。对企业 IT 做预算的人来说,这是被严重低估的隐性成本。

也有反对声音值得记录。一位基础设施工程师在我们的读者群指出:API(云端调用)模式下,即便按 token 计费,思考模式的单次调用成本仍远低于自建 GPU 集群的电费与折旧——「本地部署省钱」在大多数场景下并不成立。真正适合自托管的,是那些不需要深度推理的轻量任务;硬要把推理能力搬到本地,企业要重新算账。

对普通人的影响

对企业 IT:评估自建 AI 集群时,模型「思考」功能带来的 5-6 倍算力开销必须计入 TCO(总拥有成本,即从硬件采购到电费维护的全周期支出),否则实际账单会严重偏离预算。

对个人职场:现在 M5 Max 这类消费级笔记本确实能在本地跑 27B 级别模型,但一旦用「深度思考」功能,电脑会明显发热、风扇狂转——把它当生产力工具而不是 demo 玩具,心态要摆正。

对消费市场:未来 AI 产品的定价会进一步分化,「标准版」与「深度思考版」可能拆成两个订阅档位,差价可能远超目前常见的 Pro/Plus 分级。