25 帧每秒、单帧低于 30 毫秒,而且 100% 在浏览器里运行——我们判断,这比“又一个开源演示”更重要:AI 数字人正在从高门槛算力服务,变成普通软件都可能调用的本地能力。

这是什么

Reddit 上有开发者尝试把 LivePortrait 的 ONNX 版本放进 Chrome 配合 WebGPU(让浏览器直接调用显卡)运行,最初生成 1 帧要 30 秒,几乎不可用。后来他改走蒸馏模型(把大模型能力压缩进更小模型)路线,做出一个概念验证版,号称在自己的 5090 显卡上单帧低于 30 毫秒,约等于 25fps 实时效果。

这件事的关键不在画质已经成熟。开发者自己也承认,当前质量“还可以”,训练样本少、训练时间只有几小时,不同人像效果差异也大。真正值得关心的是:过去必须放在云端跑的人像驱动,现在开始有机会直接放进网页。

行业怎么看

如果浏览器内实时生成人像动画变得可行,视频客服、直播分身、教育讲解、虚拟主播这类产品的部署成本会明显下降。企业不一定再把每一帧都交给云端推理,响应速度、隐私和边际成本都会改善。

但我们也要看到反面:这还是早期实验,离稳定商用有距离。第一,效果依赖显卡,不同设备体验可能差很多;第二,训练数据少意味着泛化差,复杂表情和不同脸型未必稳定;第三,本地化能力越强,肖像滥用、低成本伪造内容的风险也越高。行业的机会与治理压力,会一起到来。

对普通人的影响

对企业 IT:如果这类模型继续变小,很多“视频化交互”应用可直接嵌进官网、培训系统或客服页面,不必先上昂贵的云推理架构。

对个人职场:演示、培训、销售沟通里,数字人口播和人像驱动工具会更便宜、更快,内容生产门槛继续下降,但“真人出镜”的可信度也会被稀释。

对消费市场:普通用户会更快看到浏览器内可玩的头像、照片动起来、实时视频形象替身等产品,但也要更早适应“看到人脸会动,不等于就是真的”这件事。