本周 Reddit 上有个开发者做了对照实验:'大模型当大脑、小模型当手脚'的混搭架构,API 成本几乎没省,速度反而更慢。结论是——'开源+闭源'省钱的路,比想象中要绕。

这是什么

这位开发者在 LocalLLaMA 社区公开了他的测试方案:他让 GPT-4 级别的云端大模型当 planner(规划者),让 Qwen 2.7B 这种本地开源模型当 actor(执行者),跑同一批 agentic(让 AI 自动完成多步任务)任务。结果发现——规划阶段消耗的 token(大模型按"字"计费,输入输出都算)过大,把本地小模型省下的成本又填了回去;而且多了一次模型调度(两个模型来回交接),整体完成时间反而比纯云端慢。

这种思路业内叫 multi-model workflow(多模型协作)。它的诱惑是:大模型能力强但贵,小模型便宜但弱,混起来"取长补短"。但这次实测说明,至少在通用任务场景下,"取长补短"并不一定落到账单上。

行业怎么看

支持者会指出,这个测试本身不够严谨:他用的是通用小模型 Qwen 2.7B,如果是专门微调过的代码模型或垂直领域模型(比如法律、医疗专用),成本结构可能反转。而且 planner-actor 架构带来的可控性、可审计性,是单一黑盒大模型给不了的——对合规要求高的行业,这些价值没法用 token 单价衡量。

我们更在意另一个常被忽略的声音:这种"省钱架构"在企业内部经常被神化,以为开源+闭源天然比纯 API(按调用付费)便宜。但真实账单往往相反——人力调试成本、推理延迟带来的业务损失、多套系统的运维开销,都没被算进"AI 预算"里。Reddit 上一个看似技术的小测试,戳中的是企业 AI 选型(技术方案选择)的认知盲区。

对普通人的影响

对企业 IT:选型时不要被"本地+云端"的叙事带跑。算总账要把调试成本、延迟损失、运维复杂度都折算进去,而不是只比 token 单价。

对个人职场:你大概率不需要自己搭这套系统。ChatGPT、Claude、Cursor 这些成熟工具已经处理了大部分"混合"问题,普通人用现成的就够。

对消费市场:未来一年你会看到更多"本地 AI 助手"硬件(带 NPU 即神经网络处理芯片的电脑、独立 AI 盒子)上市,但冷静预期——它们不是来"替代"云端大模型的,更像是离线场景的补充。