Miles v0.1 这周在 GitHub 开源,把大模型"调教"(强化学习后训练,让模型反复做题-批改-改进)的工程难题第一次系统性拆开。"调教"大模型曾是 OpenAI、Google 的核心黑箱;我们注意到,中国团队正在把这件事变成开源流水线。

这是什么

Miles 来自 RadixArk 团队,基于已有框架 slime 开发。传统训练和推理是两步:先训好模型,再部署上线。但"调教"模型不一样——模型要不断生成回答、打分、更新、再生成,推理引擎其实是嵌在训练循环里的。 Miles 把这件事拆成三块:SGLang 让模型快速生成回答,Megatron-LM 算梯度("该往哪个方向调整"的数学信号)更新参数,Ray 调度进程和 GPU。它支持两种部署:共置(同一组 GPU 轮流做采样和训练)和分离(采样训练各占一组 GPU,能真正并行)。 最值得关注的是"权重同步"——模型每更新一次,负责生成那边的模型就过时了。Miles 给出多条同步方式:CUDA IPC(同一台机器内 GPU 直传)、NCCL 广播(多机多卡同步参数)、基于 Mooncake 的 RDMA(让两台机器的 GPU 像在同一台机器上交换数据)、还有只传权重变化量的 disk-delta 方案。

行业怎么看

支持者认为这是大模型基础设施开源化的延续——推理引擎有了 vLLM、SGLang,训练框架有了 Megatron、DeepSpeed,现在最复杂的"训练-推理循环"也开始有人拆开来开源。这会降低中小公司自己做"调教"的门槛。 但保留意见指出三件事。第一,硬件门槛没变,文章作者自己也说"现在没有合适的硬件跑完整训练"——没有几十张 H100(NVIDIA 顶级 AI 芯片,单张几十万元人民币)这类卡,框架只是看得见摸不着。第二,RL 训练本身的不稳定性——异步模式下数据陈旧度(模型更新几轮后,采样数据可能来自过时的旧模型),作者明确点出"不只是系统调优,也影响最终训练效果"。第三,开源框架众多(slime、OpenRLHF、Verl 等),设计差异不小,企业选型本身也是成本。

对普通人的影响

对企业 IT:以后做行业大模型定制(法律、医疗客服)不再必须依赖大厂 API(应用程序接口,即调用别人模型的"通道"),中小团队理论上可用开源框架自己做"调教",但得有算力预算。 对个人职场:理解"调教"模型的工程复杂度,跟 AI 供应商谈判时不会被"我们 RL 训练很强"这种话术轻易忽悠——背后是大量工程细节,不是玄学。 对消费市场:开源 RL 框架成熟后,会出现更多真正"懂特定场景"的 AI 产品,而不是千篇一律的大模型套壳。