上周 Reddit 上一位开发者完成了一个有意思的实验:他用阿里 Qwen 3.6 27B 开源模型,自制多 Agent 编排框架(planner / coder / debugger / validator),让它自主写出了一个能产出 x64 ELF 可执行文件的 C99 编译器。整个过程跑了 6 周,最长连续一周无人干预。我们关心的是:开源模型已经能扛数周级工程任务,但「自主」两个字仍然需要打引号。

这是什么

具体配置:Tesla P100 加 RTX 4070 跑 Qwen(推理 13-14 tokens/s),Intel Arc B580 上跑 Gemma4 12b 做验证。开发者围绕 Qwen 搭了编排器,目标是强迫模型「先查再做」而不是依赖记忆里的训练数据。

两个核心难点值得记一下:一是上下文管理——一旦触发剪枝,6-7 分钟 prefill 之后预测又触发剪枝,形成恶性循环,直到第 3 周才找到解法;二是 x86 指令集幻觉,模型倾向于「编造」操作码而不是查文档,必须把编码 Agent 的提示词改得极其死板才压住。

行业怎么看

正面解读是,这件事说明开源权重模型也能胜任长程 Agent 工作,是 Anthropic、OpenAI 闭源 API 之外的一条新路径;而且整套系统跑在消费级显卡上,部署成本低。

但反对和风险声音也有三条值得听。第一,6 周完成的是玩具级 C 编译器,对比成熟工程师几天的工作量,效率并不漂亮。第二,「自主」水分大——过程中开发者反复调整 prompt 和 orchestration,并没有真正放手。第三,x86 幻觉暴露了模型在专业垂直领域的可靠性短板,写编译器勉强过关,写医疗、法律、金融系统呢?

对普通人的影响

对企业 IT:开源加消费级硬件意味着私有部署门槛大幅下降,但企业仍需自建编排与监控能力,不能直接买现成方案。

对个人职场:Agent 现阶段更像程序员的「加速器」而非替代;懂 Agent 编排与上下文管理的人,会比单纯写代码的人更值钱。

对消费市场:27B 模型能在本地连续跑数周做复杂任务,意味着高性能工作站与游戏 PC 的定位可能被重新定义。