上周三晚上 11 点,我盯着剪辑软件等了 8 分钟,就为了一句配音

我做了一个 2 分钟的短视频,文案写完了,画面剪完了,最后就剩 AI 配音。我用的是某主流语音工具,生成一句 15 秒的配音,居然要 8 分钟——那天服务器在排队。

我当时想:要是能「说一句话,AI 立刻念出来」就好了。

nari-labs 这个团队,把语音生成做到了 50 毫秒响应

上周 nari-labs 在博客里讲了一件事:他们把一款叫 Qwen3-TTS 的开源语音模型,做到了 50 毫秒以内响应——也就是 0.05 秒,比你眨眼还快。

「我的朋友阿杰」是杭州一个做有声书的独立创作者,他之前用 ElevenLabs 一个月要 200 多块,自从换了本地跑的 Qwen3-TTS,成本几乎归零。而且因为速度够快,他开始尝试「念一句、立刻生成一句」的工作流,录完一本书的时间从 3 天缩到 1 天。

我也卡过本地部署这个坑——第一次跑模型时电脑风扇狂转,温度直接到 90 度。后来才知道,需要至少 16G 显存的显卡,或者先用云端跑。

你今天复刻这个方案要花多少

:0 元。模型是开源免费的,本地跑不用付 API 费用,云端跑大概几分钱一段。

时间:如果你之前没用过 AI 语音工具,从下载到出第一段声音,预计 1-2 小时(中间可能要装点东西、看个教程)。

技术门槛:模型是开源代码,需要会用一个叫 Hugging Face 的「AI 模型商店」下载模型。如果你不想自己折腾,花几十块在淘宝找人帮你跑也行。

第一步:打开 huggingface.co,搜索 "Qwen3-TTS",找到 nari-labs 的页面,点进去先听 Demo(演示按钮)。听效果再决定要不要自己装。

三类人我的建议

如果你刚起步(还没开始做内容):现在不试也没事。先用剪映、讯飞这类自带语音功能的工具就够。等你真的每月要给 10 条以上视频配音,再考虑换 TTS。

如果你有 1-2 个稳定客户:在用 ElevenLabs 这类付费工具的,可以试试 Qwen3-TTS 的开源版做备用方案,能省一大笔。但要记得客户如果在意音色,先确认能复刻他的声音。

如果你在扩规模(团队 3 人以上、每月要做几十条音频):我会认真研究这个秒级响应的特性——它能让你做「实时语音交互」类的产品,比如直播间 AI 客服、电话自动应答。这块现在还早,但很快会有人抢先。