100 个 episode、71 分钟训练数据,跑出 79.1% 仿真躲球成功率 — 这是宇树 G1 接入 Hugging Face 旗下 LeRobot 后给出的关键数字。我们认为,开源人形机器人真正的拐点不是模型更大,而是开始学会「分工」:上层 AI 决定做什么,下层控制器保证动作能落地。
这是什么
Unitree G1 是宇树科技推出的人形机器人,LeRobot 是 Hugging Face 主导的开源机器人学习框架。这次接入的核心是 π0.5 视觉语言动作模型(VLA,即「看懂图像+听懂人话+输出动作」的一体模型):它读取相机画面和机器人当前姿态,输出 64 维的 SONIC 动作 token;token 再由解码器结合本体感知历史,变成 29 个关节的目标位置;最后交给底层比例—微分控制器(PD 控制器,工业里最常见的「按误差追目标」算法)逐帧跟踪。
关键的设计取舍是分层:慢速模型负责「听懂指令、决定动作意图」,快速控制器负责「维持平衡、生成关节目标」。这与操作系统把策略和机制分开是同一种思路 —— 上层不必懂「白桌是什么」,下层也不必懂「任务是什么」。底层那一套 PD 控制其实是工业里用了几十年的老技术,真正的增量是 VLA 与控制层之间那条可替换的 token 接口。
训练用 4 张 H100 微调 12000 步,深度躲球策略在 3 个随机种子的仿真里达到 79.1%;无深度输入是 0%,有特权状态的 oracle 上限是 97.4%。
行业怎么看
乐观派认为,这是开源人形生态第一次形成可替换的「策略—动作—控制」接口契约,未来模型升级不必重写整台机器人,是真正的工程化拐点。
但反对意见同样值得重视:第一,仿真数据漂亮不等于真机能干,公开演示视频不能替代受控真机成功率测试;发布方没有披露任何地面变化、网络延迟、长期磨损的数据。第二,双层控制在机器人圈并不新鲜,「慢规划+快执行+PD 跟踪」几乎是教科书结构,这套 VLA+token+PD 的包装更像把老问题用 AI 重新讲了一遍。第三,更现实的风险在采购端:拿着 79.1% 的仿真数字做量产决策,会显著高估落地时间表。我们倾向于把这件事看成「工程语言的开源化」,而不是「机器人能力的新突破」。
对普通人的影响
对企业 IT:人形机器人短期内不会进入你的 IT 预算;它仍属于工厂实验线或研发部门,与日常系统运维没有关系。
对个人职场:AI 替代叙事正从「写文案、写代码」延伸到「做体力活」,白领的护城河从「信息处理」进一步转向「判断与责任归属」,这条线会持续移动。
对消费市场:别被演示视频误导,未来 12–18 个月家用机器人能稳定完成的仍只是窄场景任务,「全能管家」远未到来。