这是什么

本周我们注意到一件小事,但指向大趋势。一个叫 Gepard 的开源模型,在第三方测评平台 Coval 上跑出 68.7 毫秒的首字延迟——比榜上 24 个付费 API 都快。它只跑在一张消费级显卡 RTX 4090 上(市价约 1.5 万元),模型采用 Apache 2.0 协议(可商用、可改、可分发)。换句话说,以前要按秒付钱给 ElevenLabs、OpenAI 的语音合成,现在可能一张显卡就够。

行业怎么看

支持方视此为"声音领域的 Llama 时刻"——2023 年开源大模型追平闭源,2025 年轮到语音。开源拉低了有声书、短视频配音、客服 IVR(电话菜单系统)的成本下限,中小团队也能做以前大厂才负担得起的语音产品。

但反对意见同样明确,值得我们警惕。首先,延迟低不等于质量好——TTS 的真正考验是音色拟真度、情感起伏、长文本稳定性,68.7 毫秒只解决了"快不快"。其次,这次测评是模型方自己跑自家 API,测评方 Coval 没有独立复核,存在调参刷榜的空间。第三,企业采购 TTS 还看合规、品牌音色、私有部署能力、过往客户案例,这些都是开源模型短期内补不上的短板。

对普通人的影响

对企业 IT:客服机器人和智能硬件的语音模块成本会继续下探,今年的采购预算可以重新谈。

对个人职场:做短视频、有声内容、播客的人会发现工具变便宜,但赛道也会更卷——会用 AI 不再是加分项。

对消费市场:AI 配音的有声书、短视频会更多,真人配音的稀缺性反而上升;"这究竟是真人还是 AI 念的"会越来越难分辨。