目前主流视频生成模型只能撑 5-10 秒就崩——人物变形、场景跳脱是 Sora、Kling、可灵都被吐槽过的通病。Google Research 本周发表的研究直接瞄准「自动化生成几分钟连贯视频」这个下一步,把跨镜头一致性问题作为系统性课题来处理。

这是什么

这里有个关键词——「一致性」(coherent,指同一个角色在不同时间点长相不变、镜头切换风格不跳) 是视频生成领域的行话。Google 的思路是让 AI 自己先把长视频的剧本大纲、分镜逻辑编排好,再按章节生成,而不是事后拼接短片段。这条路一旦打通,自动剧本、自动分镜、跨片段角色记忆这些模块才能被整合为一条可用的工作流。

行业怎么看

乐观派认为这是视频生成从「玩具」走向「工具」的关键一步——长片段不可用是当前所有主流模型的共同短板,这正是市场在等的突破。但冷静的反对意见同样存在:一位影视技术从业者对我们直言,演示环境和真实生产是两回事,复杂光影、人物微表情、空间逻辑依然需要人工兜底,「自动化」的承诺还没有在工业管线里真正兑现。从论文到能接进生产流程,中间还隔着数据、算力、和最后那一公里的人为把关。

对普通人的影响

对企业内容团队:营销视频、电商短视频从脚本到成片的链路会被压缩,但完全替代剪辑师还早。

对个人职场:基础视频剪辑岗位价值会重新定价,创意判断和审美把关比剪切操作更值钱。

对消费市场:刷到「AI 短剧」「AI 广告片」的比例会上升,判断真假需要新的鉴别能力。