我们注意到,一个完全的新号作者最近在小红书发了 6 首自己用 AI 做的国风治愈 MV,从《念未歇》做到《有风无风皆自由》,六首下来流程跑通,全靠「干中学」。这件事值得关心的是:当 AI 把技术门槛拉得足够低,决定产出质量的就不再是会不会用工具,而是审美和判断。

这是什么

作者没受过专业训练,也没先去啃教程。他的工作流是:豆包拆歌词写分镜提示词 → 即梦出图 → 即梦图生视频 → 剪映合成剪辑。工具组合很朴素,国产 AI 就能撑起完整流程。

关键迭代点在第四首。他前三首直接「文生视频」(用文字描述直接生成视频),结果抽象文字很难预判画面,反复「抽卡」(反复重新生成)又烧钱又耗时间。第四首他改成「文生图 + 图生视频」两步走——先把关键帧定住,画面不对就在图阶段改,再拿去生成视频。效率大幅提升,后面几首基本一次过。

另一条心得是风格一致性。他让豆包固定输出莫兰迪低饱和色系、Q 版小女孩 + 小猫的角色设定,再做一张定妆图(三视图,确定角色正面侧面背面形象的标准参考图)作为参考,到第五首以后图生视频一次就能满意。

行业怎么看

从 AIGC(AI 生成内容)创作者社区的反馈看,「干中学」是被反复验证的路径。多位有经验的人指出,AI 工具版本迭代极快,看教程学完可能已经过时,边做边调整反而更高效。

但也有反对声音值得警惕。有从业者提醒:这种「先做再学」对个人创作没问题,对企业级应用是另一回事。生产环境对成品稳定性、合规性、版权链路(有明确来源、可追溯、可授权的素材使用链条)有要求,纯靠摸索很容易踩坑。MV 是个人作品,错了可以改;商业内容交付,返工成本完全不一样。另外,「文生图 + 图生视频」比纯文生视频更可控,但目前 AI 视频在运镜逻辑、人物一致性上仍不稳定,长视频片段尤其明显,这一点作者自己也在复盘中承认了。

对普通人的影响

对企业 IT:单兵 + AI 工具组合能产出曾经需要专业团队的内容,企业的内容生产预算和人效假设需要重新算。

对个人职场:非创意岗位的人也能用 AI 做出像样的视觉作品,技能边界被工具拉宽,但审美和判断能力反而变得更值钱。

对消费市场:小红书、抖音上 AI 生成的精致内容会越来越多,用户对「原创」「真实」的辨识成本上升,平台和创作者都要面对新的信任问题。