01 触发事件

本周的 ChinAI 第372期译介了《晚点》对中国具身智能行业的调查。报道没有跟随发布会叙事,而是记录了几个现场:一家估值超过 200 亿元人民币的具身智能公司,机器人叠毛巾用了 15 分钟,结束时仍未完成;另一家工厂里,机器人用 70 秒把轴承从托盘夹到旁边的塑料箱;更早一次展示中,人形机器人用 90 秒抱箱、转身上架。原文还追问,多少台生产线上工作的机器人,才能抵得上一个比亚迪工厂工人?

这组数字的共同点不是单纯慢,而是演示的完成标准和工业采购标准错位。叠毛巾可以结束于开始做,工业任务却要有节拍、成功率、异常处理和连续运行。原文没有披露样机阶段、型号、任务成功率或工厂名称,所以我不把三段观察外推成行业平均;但它把估值问题从能否做出动作推到了每个动作产生多少价值。我可能把单个现场看得过重,但这组案例至少说明,公开 demo 还没有回答工业部署的核心问题。

投行人士回忆,5 月到访一家估值超过 200 亿元人民币的具身智能公司时,工程师让机器人演示叠毛巾,15 分钟过去,任务仍未完成。

02 这事的真正含义

具身智能的核心不是把 language model 接到机械臂上,也不是在视频里生成一次漂亮动作。它要进入一个生产函数:在固定空间、固定夹具、规定节拍和异常分布下,持续完成任务并产生可核算的产出。一个 robot 能抓取、转身、行走,只能证明某个 policy 在某个 demo 中穿过了一个样本,不能证明它已经拥有可部署的 task completion rate、mean time to human intervention、全天候 uptime 和安全冗余。

资本市场正在用 foundation model 的 option value 给物理世界产品定价,却没有使用工厂的 denominator。软件 agent 的错误可能只是一次错误回答;机器人多出来的一次抓取、一次停顿、一次人工接管,都会直接进入 cycle time 和 labor cost。于是,估值 200 亿元人民币与叠毛巾 15 分钟并不矛盾:前者押注未来 learning curve,后者描述当前生产率。真正的矛盾是,投资者把两种时间尺度混在了一起。报道者甚至判断,即使再快十倍也未必能进入工厂使用;这不是我的 benchmark 结论,而是报道对现场的判断。

这也改变了对 China advantage 的理解。工厂密度、制造供应链和真实场景,可能降低硬件试错与部署摩擦;但这些优势只有在系统稳定运行时,才会变成 distribution advantage。若一个动作需要十倍提速才能进入工厂,供应链只是更快的实验迭代,不是自动的商业 moat。当前报道没有给出具体客户、订单、收入或留存数据,所以我对规模优势已经兑现保持怀疑,对场景供给可能在后续兑现更开放。

03 历史类比 / 结构对照

最接近的结构对照是 2014 年前后的 AWS。云的价值不来自客户拥有一台服务器,而来自把计算能力包装成可调用的 service,用延迟、可用性和按需价格重新定义产品。客户购买的不是机器,而是稳定的能力消耗。

机器人行业要跨过同样的抽象层:客户买的不是会走路的硬件,而是每班完成多少件、次品率多少、需要多少人工照看、异常出现时怎样降级。硬件参数、model benchmark 和 demo completion rate 都不能替代三个数字:单位任务成本、人工干预率、连续运行可靠性。

这也解释了为什么通用人形可能是一个诱人的叙事,却未必是当前的最小可行切口。通用形态有利于演示和融资,专用工作单元更容易定义环境、固定夹具、容错范围和 ROI。先把一个动作做成 SLA,再扩展到相邻任务,和一开始承诺整个物理世界,商业路径完全不同。我没有内部跑过这些公司,也不能确认其真实数据;但这组报道足以支持一个更窄的判断:行业当前缺的不是动作,而是可审计的任务接口。

04 对 AI builder 意味着什么

本月做具身 AI 或工业 agent 评估时,先别按视频看起来像不像人来选供应商。把每个 demo 放进同一张表:人工 baseline 的节拍、机器人完成时间、成功率、重试次数、人工接管、停机恢复和异常处理。对机器人公司而言,最值得销售的不是通用智能,而是一个边界明确、可以验收的 task SLA;对系统集成商而言,应该把 perception、planning、control、safety 分开测量,不要只报一个端到端成功率。

对 model 和应用 builder,还要重新计算 integration cost。一个依赖云端 inference、遇到视觉遮挡或物体姿态变化就暂停的方案,在 demo 中可能足够,在工厂里却会把网络抖动、推理成本和维护人力重新塞回流程。Gateway 的价值也不应只是把多个 model route 到更低的 token price;它应暴露稳定性、fallback 和 observability。物理执行系统里,续费理由通常不是单次 benchmark 更漂亮,而是故障可追踪、失败可恢复。这个判断我可能把报道中的案例看得过重,但先测任务经济、再谈模型能力,仍然是本月就能执行的评估纪律。

05 反方观点 / 风险

我可能把早期技术的慢,误判成最终产品形态的慢。机器人叠毛巾用了 15 分钟,不意味着训练数据增加、sim-to-real 改进、专用夹具和更快 inference 不会把它压到可接受区间。资本给 200 亿元人民币估值,也可能是在购买未来渗透率、工业安全价值和国家战略期权,而不为当前吞吐率付费。若某家公司已经拥有未披露的订单、真实工厂的夜班运行数据,公开 demo 的低完成率可能只是最差切片;原文没有披露这些变量,这个反例不能排除。

另一个风险是我对专用工作单元的偏好过强。通用机器人虽然资本密集,却可能在多个任务间摊薄数据和硬件成本;中国制造密度也可能提供更密集的 deployment、failure 和 repair 反馈,形成后来者难以复制的 learning loop。当前报道没有证明这些优势不存在,只证明了它们尚未被这些现场记录证明。

所以我不下结论说中国具身 AI 没有未来,也不把这三段观察当作行业平均值。我真正的主张更克制:截至 ChinAI 第372期呈现的证据,估值领先于可观察的 task economics,资本市场的机器人会动与工厂采购的持续创造价值之间仍有一道需要数据填平的鸿沟。若接下来出现连续班次、明确节拍、人工接管率和订单留存数据,我的判断需要重算;在那之前,别用演示视频替代生产率证据。