这是什么

本周,一个叫 Sopro 的开源 AI 语音克隆(TTS,即「文字转语音」)模型悄悄更新到 V2 版本:1.2 亿参数,普通笔记本的 CPU 就能直接跑——技术门槛正在被悄悄拆掉。首段音频延迟约 300 毫秒,代码采用 Apache-2.0 协议(允许免费商用),目前支持英语、欧洲葡语、法语、德语。

行业怎么看

支持者认为这是「轻量级 TTS」路线的胜利——企业做语音客服、有声内容时,可以摆脱对云端大厂 API(调用接口)的依赖,数据和成本更可控。但我们注意到另一面:开源 + CPU 可跑,意味着语音克隆的门槛被大幅压低。反诈研究者已经警告,AI 拟声诈骗(用几秒样本模仿亲属声音)将在今年加速扩散。此外作者也承认,极高音、卡通嗓音、嘈杂参考音仍是短板,1.2 亿参数相比 ElevenLabs 等商业大模型仍有质感差距。

对普通人的影响

对企业 IT:本地部署语音合成成为可能,客服、有声书、播客场景的合规与成本结构可能重写。

对个人职场:自媒体、客服培训从业者多了一个免费工具,但需注意商用授权与合规边界。

对消费市场:当你接到「老板」「家人」电话要求转账时,请多一份警觉——技术白菜化的另一面,是诈骗工具的白菜化。