本周我们在 Reddit 编程论坛 LocalLLaMA 上看到一条热帖:开发者 juanviera23 用一张 RTX 5090(显存占用 19GB)跑出了 Google DeepMind 的 Genie 世界模型,720p、每秒 16 帧——值得标记的是,这是世界模型第一次离开数据中心,进入消费级硬件。

这是什么

DeepMind 在 2024 年初发布的 Genie 是一种「世界模型」(World Model)—— AI 能根据文字提示或一段视频,实时生成可交互的虚拟空间,像一个靠想象运转的游戏引擎。DeepMind 原版演示需要云端集群,业内当时普遍判断复刻它至少要 8 张 H100,是大实验室的专属玩具。

juanviera23 这次放出的开源版本,单张 NVIDIA RTX 5090(消费旗舰,零售一万多元人民币),显存只用 19GB(卡上总共 32GB),就能跑出 720p、16 帧的可玩画面。也就是说,一台两万元的 PC,现在可以本地让 AI 实时造世界。

行业怎么看

支持方认为这是开源社区的标志性时刻。从「8 卡 H100」到「1 张消费卡」,复刻周期不到六个月;游戏开发者已经在讨论用它做原型——以前一个月才能出的关卡 demo,现在可能一天就能跑起来。

但反对意见同样清晰。第一,16 FPS 离「真正好玩」仍有距离,DeepMind 原版 30 FPS 也算勉强;第二,世界模型生成的内容不连贯,AI 不会「记住」自己上一帧造的角色,长期一致性是公认的硬骨头;第三,比起游戏,硅谷真正押注的方向是合成数据——用世界模型给机器人和自动驾驶造训练场景,这条赛道的商业化更近。我们也注意到另一种分歧:开源能跑不等于产品化,可用性、生态、合规才是后面真正的坎。

对普通人的影响

对企业的 IT 部门:短期不必行动。如果已经在做本地 AI 推理,加这张 Genie 模型的硬件门槛就是一张 5090;真正要评估的是开源推理框架的稳定性与维护节奏。

对个人职场:设计、产品、文案岗位可以开始留意概念验证——以后做可交互原型,也许直接用提示词,省掉和工程团队反复对齐的来回。

对消费市场:当下还是「能跑」的展示阶段,距离「让你玩得停不下来」估计还要半年到一年。