本周 Google 上线 Gemini 3.5 Transcribe,把语音转文字(ASR,即把声音自动转成文字的技术)的词错误率(WER,每 100 个词里识别错的数量)从上一代约 7.3% 压到 2.6%。这件事值得关心,是因为语音输入正在从「能用」走向「敢用」——会议记录、客服录音、法律取证这些场景的可靠性门槛被进一步压低。
这是什么
Gemini 3.5 Transcribe 的核心能力是「上下文理解」——不只是把声音逐字翻成文字,而是能听懂语境,自动删掉「嗯」「啊」这类填充词,甚至你在说话时自我纠正(「星期二……不对,星期三」),它直接输出修正后的版本。
它支持 85 种语言自动检测,允许企业注入自定义词汇表(医疗、法律、金融术语)。Google 提供两条 API 路径:非流式处理完整音频,带说话人区分和字级时间戳;流式(实时转写)延迟低于 1 秒,但拿不到前两项能力——二者不可兼得,这是行业共性取舍。
行业怎么看
Artificial Analysis 的基准测试是这次进步的关键支撑:相比前代 Chirp 3,精度提升约七成,处理速度也快约七成。开发者社区普遍认为,纯「转录 + 摘要」的工作流,Google 自家的 NotebookLM 反而更稳定,因为有专门的音频管道。
但也有冷静的声音需要留意。第一个风险是成本:按 token 计费的模式下,长音频账单不便宜,企业接入前必须先做样本测试。第二个风险是环境依赖:多人同时说话、强背景噪音下,模型表现会下降,目前没有任何 ASR 能绕开这个物理上限。第三个取舍:说话人区分只在非流式版本提供,实时字幕类产品拿不到——这是工程上的硬约束,不是 Google 单独的问题。
对普通人的影响
对企业 IT:会议录音、客服质检、播客后期这类场景值得重新评估供应商,2.6% 的错误率意味着人工校对成本会显著下降,但要先算账再换系统。
对个人职场:开完会不用再边听录音边补笔记,AI 直接出结构化纪要;但留痕也会更彻底,说过的话更难撤回。
对消费市场:语音输入法、车载助手、智能音箱的体验会顺滑一截,但用户短期感知有限——多数人只在乎「它有没有听错我」,不关心 WER 是 2.6% 还是 5%。