这是什么
4 小时 18 分钟对 21 分钟,输出 949 行对 1759 行 — 这是一位 Reddit 开发者本周跑出的对比。他把同一份 3.9 万行、约 60 万 token 的 C 语言射击游戏代码,交给三套 AI 配置改写成单文件 HTML/three.js 网页版。
代码量超过任何模型的上下文窗口(模型一次能「看见」的文字上限),AI 必须自己走查文件、判断哪些函数重要。三组结果分别是:
- 云端 Claude Code Opus 5:21 分钟,1759 行,结果「勉强能用」
- 本地 Hermes 编排的 Qwen 3 27B:4 小时 18 分,949 行,结果「坏的」
- 本地 codehamr 编排的 Qwen 3 27B:1 小时 40 分,1056 行,结果也是「坏的」
本地配置用的是 FP8(一种低精度浮点格式,能塞进更大模型但牺牲一点精度)+ vLLM 推理引擎 + RTX 6000 Pro 96GB 显卡。
行业怎么看
这组数据至少暴露了两件事,值得我们冷静判断。
第一,本地的「便宜」是有上限的。即便是 27B 这种中等规模、用 FP8 在 96GB 显存上跑,4 小时烧掉的电费和显卡折旧不是小数目。云端 21 分钟按 token 计费,单次任务看未必更贵。本地跑的隐性成本——搭建、调试、电费——多数团队没认真算过。
第二,模型权重不是胜负手,编排(harness / agent framework,即让 AI 能多轮规划、调用工具、修改自己代码的「脚手架」)才是。原帖作者最在意的发现:同一套 Qwen 27B 权重换两套不同工程编排,最终都跑出残缺结果。这说明中等规模开源模型对「被怎么用」极度敏感——提示词写得薄,再复杂的脚手架也救不回来,只会空烧 GPU 时间。
但反对意见也必须摆出来:一次运行、一个提示词不能算定论,原作者自己也说「这不是什么代表性测试」。云端 Claude 21 分钟搞定,背后是 Anthropic 在工具调用、代码理解、长上下文上多年积累的工程经验,这恰恰是开源本地生态目前欠缺的。把单次对比当成「开源 vs 闭源」的胜负判据,是过度推论。
对普通人的影响
对企业 IT:本地部署大模型不是「装上就能省钱」。在复杂编程任务上,云端 API 的工程成熟度仍领先一个身位。算总账时要把工具链开发、调试时间、人力成本都算进去。
对个人职场:如果你正在评估要不要用 AI 编程工具,现阶段云端订阅比自购显卡折腾部署更现实,除非你的代码或数据真到了必须本地化的程度。
对消费市场:「下载到本地就能替代 ChatGPT」的宣传,听听就好。开源模型跑得快但用不好,会是接下来一年的常态——模型本身只是入场券,配套工具链才是分水岭。