这是什么
一张 RTX 5060 Ti 16G 显卡,跑出 60 秒带人声、带旋律、带氛围感的 AI 完整歌曲——这件事这周发生了。
Comfy-Org 把 MiniMax 的 Music-3 模型打包成 ComfyUI 原生节点后,社区在一台 RTX 5060 Ti 16G + 64G 内存的机器上跑通了完整歌曲。官方整包 61.8 GB,但 int8 量化版只要 11.1 GB,三个核心文件就能让 16G 显存从容工作。
具体改动有三处:ComfyUI 升到 0.31.0 以上(旧版直接报 Unknown node type)、workflow 里把 DiT 切到 int8 版本(4.6G→2.3G)、VAE 解码打开 tiled 分块。少做一步,进度条就卡在 80% 然后 OOM 报错。
值得专门说一句的是 prompt 结构:歌词里的 [intro] [verse] [chorus] [bridge] [outro] 是结构性指令,模型会按它组织段落;caption 写得越具体,分轨和人声质感的差别越大。
行业怎么看
编辑部的判断:这件事的真正信号不是"AI 又多了一个玩具",而是 AI 音乐的硬件门槛从"机柜级"跨过了"桌面级"这个临界点。
乐观的声音是:本地跑意味着没有云端 API 费用、没有 rate limit、没有隐私顾虑——对短视频团队、广告公司、自媒体工作室来说,"原型阶段"的边际成本压到了几乎为零,过去需要反复登录、付费、等渲染的环节被跳过。
需要冷静的反对意见同时存在:
- int8 量化是"能跑"不是"跑得好",母带级音质细节一定有损失,真要商用输出大概率仍要靠云端或本地 fp16
- 速度仍是短板——本地一张卡一首 60 秒歌要等好几分钟,Suno/Udio 在云端十几秒就能交付
- 最大的灰色地带没动:本地生成的曲子能不能商用、训练数据来源是否合规,这些问题不会因为硬件门槛降低就自动消失
对普通人的影响
对企业 IT:过去要给团队配 AI 音频能力,要么买云端 API、要么自建 GPU 服务器;现在一张中端显卡就能撑起小工作室的 AI 作曲工具链,IT 预算的优先级可能需要重新排。
对个人职场:做短视频、播客、广告文案的从业者,多了一个零成本的"快速出 demo"工具——不用再为一段背景音乐反复登录、付费、等渲染。
对消费市场:当 AI 出歌工具跌到"自己电脑就能跑"的阶段,未来一年我们大概率会同时看到两件事——自媒体 BGM 量产爆发,以及音乐人和流媒体平台的版权反弹。