这周 fal 公布的一组数据值得划重点:用 MiniMax 开放权重的 H3 做底座,H3 Max 能在大约 2.46 秒内完成 5 秒、768p 视频的模型推理——比视频自身播完还要快。这不只是硬件升级,而是「模型训练 + 推理工程 + 硬件」三层协同设计正在成为一种新范式。但我们也要提醒一句:2.46 秒是 GPU 推理时间,不等于用户从点击到看到视频的端到端等待。
这是什么
fal 没有从头训练视频模型,而是基于 MiniMax 开放权重的 H3 做二次开发。MiniMax H3 本身是多模态生成模型:文本、图片、视频、音频能进入同一个上下文,由模型理解素材之间的关系。
fal 在这个底座上做了两件事。一是后训练(基础模型已具备完整能力,再用新数据和目标让它朝特定方向优化),让模型适应更少的采样步数。视频扩散模型要从噪声出发经多轮去噪才能出结果,传统做法是尽量做几十步;fal 把「降低推理成本」写进训练目标,让模型在更少步数下仍保持质量。二是自研 Falcon 推理引擎,覆盖量化(用更省资源的数值表示)、并行、缓存、调度等环节,把每一步的实际执行成本压下去。三层叠加,再加上 NVIDIA GB200 NVL72 集群,才有了 2.46 秒。fal 把这种思路叫做 co-design:模型训练和推理优化不再是两个独立阶段,而是从一开始就共同寻找质量、速度、硬件效率的平衡。
行业怎么看
主流声音:这是「中国开源底座 + 海外工程团队」协作的典型样本。MiniMax 开放权重把基础能力交出去,fal 用工程能力把它变成可商用产品,分工比以往更细,也代表开源模型在视频生成领域的第一次完整商业化落地。
但三点风险值得留意。第一,数字口径有误导。fal 自己的 API 文档把 2.46 秒定义为 GPU 后端去噪时间,不含排队、启动、权重加载、编码、传输。在高并发场景下,用户实际等待可能远高于此;拿这个数字做营销宣传时要谨慎。第二,协同设计门槛高——fal 的判断是「硬件可采购、推理引擎需长期系统积累、后训练要团队有改动模型的能力」,三层能力齐全的团队不多。这意味着成绩容易被复制成「堆 GPU」,而真正的方法论护城河很难平移。第三,开源权重的商业闭环尚未跑通:MiniMax 开放 H3 换来 fal 这种工程伙伴,但生态能否反哺回 MiniMax 自身,目前还看不清。
对普通人的影响
对企业 IT:视频生成从「分钟级」进入「秒级」后,营销、电商、本地化等批量生产场景变得可能;但采购方要分清「模型推理时间」和「端到端延迟」,别被供应商的演示数字带着走。
对个人职场:自媒体、短视频、电商运营的内容产能上限被抬高,竞争节奏也更快;靠「快」建立的壁垒会比过去更短,拼的是判断力而非执行力。
对消费市场:C 端用户短期内还感受不到——视频 App 里的几秒等待仍然存在;但 6-12 个月内,AI 视频工具可能从「试用玩具」变成日常工作流。