开源 TTS(文字转语音)模型 TontaubeV1 在 400 段有声书盲测中以 50.1% 胜率击败 ElevenLabs Flash v2.5,并优于 Fish Audio、Cartesia Sonic 3 等付费产品。但别急着给采购部发邮件:TontaubeV1 目前至少需要 24GB 显存才跑得动,量化版本还要等。值得关心的是,开源阵营又在 ElevenLabs、OpenAI、Azure 这些付费寡头主导的语音 AI 领域凿开了一道口子,企业选型桌上的筹码开始变化——但变化的速度和深度都还没到来。

这是什么

TontaubeV1 由两兄弟创业团队发布,2.9B 参数、开源权重,主打三件事:超长文本流畅生成(流式输出加滚动上下文窗口,理论上没有长度上限)、零样本声音克隆(一分钟参考音频复制声线)、本地低延迟推理(单卡 RTX 5090 上 0.08 倍实时,批处理可降到 0.02 倍,约 50 倍实时速度)。技术上用四个自回归模型分别生成从语义骨架到声学细节的多层码本,配合字符级文本分词。

行业怎么看

乐观的声音是,开源又一次在商业堡垒上凿开了口子——语音 AI 不再是几家付费寡头独享,企业部署有了「自己跑」的选项。但三点需要打折:第一,跑分来自开发者自评的 LLM-as-judge(用另一个大模型当裁判),Tontaube 自己承认尚未做大规模人耳盲测,结果还没经过 TTS Arena 等独立平台验证;第二,ElevenLabs 的真正护城河不只是模型本身,还有 SDK 易用性、客户支持、合规审计——开源赢了基准,未必赢得采购决策;第三,目前至少 24GB 显存才能跑通,消费级硬件和企业机房都够不到,量化版本要等。它更像一个「开源冲击商业」的信号弹,不是短期替代方案。

对普通人的影响

对企业 IT:短期内多数不会切走——高端 GPU 采购、合规、运维都是隐性成本,云 TTS 仍是默认选项,但选型谈判桌上多了一个筹码。 对个人职场:自媒体人和有声书创作者短期仍依赖 ElevenLabs 等付费工具,但开源挤压下订阅价格大概率会松动。 对消费市场:手机和车机端的本地语音合成质量会随之提升,一两年内可见到「不联网也好听」的 AI 助手。