这周 AWS 发了一篇技术博客:用同一个容器镜像(可理解为打包好的运行环境)在 SageMaker 上部署两个 API 接入点,一个跑 40 亿参数的 FLUX.2-klein 生成图片,一个跑 13 亿参数的 Wan2.1-VACE 把图片变成短视频。看起来只是工程师的一次例行更新,但背后是一个被低估的信号——目前最主流的开源 AI 推理框架 vLLM("推理"即运行训练好的模型、对外提供服务的整个过程),已经从只能处理文字扩展到能同时处理图片、音频、视频。
这是什么
简单说,AWS 在教工程师怎么在租来的云上,部署 AI 生图和生视频能力。流程是:写一句话,让 FLUX.2-klein-4B 生成一张静态图,再用 Wan2.1-VACE-1.3B 把这张图变成几秒钟的短视频。
值得关注的不是这两个具体模型,而是底层用的 vLLM-Omni 框架。vLLM 是开源大模型推理的事实标准,过去主要服务文字大模型;现在它的"全模态"版本把图片、音频、视频都纳入进来,而且接口与 OpenAI 兼容——意思是原来调 OpenAI API 的代码,改个地址就能切到自建服务上。
行业怎么看
支持者认为这是开源阵营的标志性时刻:过去企业要用 AI 生图生视频,要么调 Stability、Runway、字节即梦这些闭源 API,要么从零搭。现在 vLLM-Omni 提供了一条中间路线——开源模型 + 开源推理框架 + 云厂商托管,理论上"既控成本,又不锁死在一家供应商"。
但反对意见同样值得听。第一,自建不是零成本——FLUX.2 和 Wan2.1-VACE 都依赖高端 GPU(图形处理器,AI 训练和运行所需的昂贵芯片),部署、运维、扩容的真实账单可能超过直接调 API。第二,教程里的两个模型都是小尺寸开源版本,生成质量和闭源旗舰仍有差距,电商、广告这类对画质敏感的场景未必能直接用。第三,AWS 把这件事写成博客,本质是卖云资源——教程越简单,越多企业被引导到 SageMaker 上长期付费。
对普通人的影响
对企业 IT 部门:多了一种"自建 vs 调 API"的选项,但要不要真做,需要算清楚 GPU 闲置率和团队运维成本,不建议盲目跟进。
对个人职场:短期最直接的变化是,你日常用的国内 AI 工具(豆包、即梦、可灵)背后多了一层竞争压力,长期看 AI 生图生视频的边际成本可能继续下降。
对消费市场:现在还看不到直接影响——消费者接触到的 AI 生图生视频产品,体验差距更多取决于产品团队水平,而不是底层框架。