这是什么

10 小时、1000 万 token、单张 RTX 3090 显卡 — 这是上周 Reddit r/LocalLLaMA(本地部署开源大模型的发烧友社区)一位开发者交出的实测数据:把阿里通义 Qwen 3.8 27B 模型,搭配 DeepSeek 开源的调度框架(Harness — 让模型能持续执行长任务、不迷失目标的「操作系统层」),跑出一个 10 小时不脱轨的编程 Agent。

速度因上下文长度在 37-60 token/秒之间波动。代价是模型会「深思熟虑」 — 最长一次空转 20 分钟才动笔。这位用户也坦言:27B 是稠密模型(每次推理都要算全部参数),全天当 Agent 用不现实,他在等阿里出 35B 的 MoE 版本(Mixture of Experts — 只激活部分参数,体积更小、推理更省)。

行业怎么看

我们注意到,真正值得关心的不是「模型又多强」,而是「调度框架正在和模型脱钩」。当 Harness 这种引擎层代码可以被独立开源、不绑定特定模型权重,AI 行业正在进入类似早期 Linux 的模块化阶段 — 用 Qwen 的脑子、DeepSeek 的调度、自己写的界面,正在变成一种可拼装的组合拳。

但反对意见也得摆在桌面上:这只是一个 Reddit 用户的个人跑分,没经过 SWE-Bench、AgentBench 这类第三方评测验证。「10 小时不失败」恰好是企业最在意的指标,也是样本量上去后最容易暴露出问题的承诺。37 token/秒的速度,意味着一个普通编程任务要等几分钟到几十分钟 — 个人开发者能忍,生产线就是另一回事。

对普通人的影响

对企业 IT:一张约 1.5 万元的 RTX 3090 + 免费开源模型,已经能跑一个稳定数小时的编程 Agent。对中小软件团队的「算力账」是直接利好,不必每行代码都按 token 付费给美国 API。

对个人职场:暂时只对「愿意等、愿意调」的技术角色有意义。「会调本地模型 + 接受慢 10 倍」正在变成一个新技能门槛,大多数白领暂时还用不上。

对消费市场:短期无感。等消费级硬件再降一档、本地模型再缩 50% 体积,「家里跑个 AI 助理」才有进入普通家庭的可能。