本周腾讯 ARC 把一套叫 SCoPE 的方案开源到 Hugging Face:基于阿里 Wan2.2 视频模型,叠加一层「摄像机轨迹」作为位置编码,给定首帧、文字描述和运镜路径,就能输出镜头可控的成片。换句话说,AI 视频生成从「抽卡」开始走向「按脚本拍」。
这是什么
SCoPE 全称 Sightline-Coordinate Positional Encoding,直译是「视线坐标位置编码」。它做的事很具体:在已有的视频扩散模型(一种把噪声逐步还原成视频画面的 AI 架构)里,把摄像机机位、运动方向当作额外的位置参数输入。
之前用 AI 生成视频最大的痛点之一是镜头——AI 自己会「乱晃」,运镜毫无章法;想要镜头稳定、推拉摇移按想法来,基本只能反复抽卡(反复生成直到撞到一张能用的)。SCoPE 这类方法的核心思路,是把「摄影师」从结果里请出来,放到输入里:你写运镜脚本,AI 照着拍。
仓库自带 Wan2.2-I2V-A14B(一个 140 亿参数的图生视频模型)的全部权重(模型参数文件),下载即可推理,不需要额外拼装。
行业怎么看
可控运镜是今年视频生成的主战场之一。Runway、Pika、快手 Kling、字节即梦都在做类似方向,SCoPE 只是开源社区里的一种技术实现路径。腾讯 ARC 这次选择站在阿里 Wan2.2 之上做叠加,而不是自建底座,本身也说明:开源生态里,「谁的基础模型强」比「谁的品牌响」更关键。
值得保留的疑虑:运镜可控不等于叙事可控。AI 仍然不知道什么时候该用推镜头制造压迫感、什么时候该切硬切给节奏——镜头语法这块,模型学不来。另一个现实问题是商用授权:代码往往采用可商用协议,但模型权重可能带额外条款,企业真正落地之前要先看清边界。
对普通人的影响
- 对企业 IT 与营销:短视频广告、产品介绍片的外包拍摄预算有了继续压缩的空间,5 秒产品镜头不再非找摄影师不可。
- 对个人职场:自媒体、短视频运营多了一件趁手工具,但审美、脚本、分镜这些活儿依然稀缺,工具不会让内容自动变好。
- 对消费市场:普通用户在抖音、视频号上会更频繁地刷到镜头感「不像 AI」的 AI 内容——这件事本身不显眼,但已经在发生。