Google Cloud 这周把 Gemini 3.8 Live 推上企业生产:支持 97 种语言,能边说话边查保单、调工具。但我们认为 — 实时 AI 的真正护城河不在声音,而在后台慢下来时旧结果不串台。

这是什么

普通问答等一个结果就行,但实时多模态 AI(能听、能看、能说)同时处理麦克风、摄像头、模型和工具 — 查保单要三秒,语音回执只要两百毫秒。如果所有事情排队,用户先听见三秒沉默。

Google 的解法是异步事件流(async event stream,每件事带编号、加时间戳):输入、模型、工具、播放都成独立事件,附带会话 ID、轮次 ID、时间戳。协调器据此决定接受、延后或丢弃。

关键概念叫背压(backpressure):下游处理不过来时要求上游降采样或暂停。摄像头帧可以丢,转账回执和人工批准不能丢 — 不同事件有不同“可丢性”。

行业怎么看

支持方认为这是把实时 AI 从演示推到生产的关键一步,远程客服、视频理赔、屏幕协作场景因此可用。97 种语言覆盖对欧美企业出海有意义。

但冷静的声音也在。撤销、断线重连、慢工具测试这些“舞台外”风险被演示藏起来;工程门槛高,小厂商难复制 Google 的基础设施闭环;Extended Thinking(深度推理)仍为私有预览,采购容易踩坑。

我们的判断:护城河不在声音或头像,而在“连续交互不牺牲事务正确性”。上线前至少看六项指标:事件端到端延迟、队列深度、丢帧率、工具超时率、取消成功率、过期结果拦截数。

对普通人的影响

对企业 IT:客服、理赔、远程协作三个场景会先看到 AI 介入。选型时别只看演示,要问“取消成功率”“过期结果拦截数”这些工程指标。

对个人职场:未来一年 AI 客服电话、视频助手会更多,但支付、授权、删除等关键步骤仍切人工 — 不是技术做不到,是合规要求。

对消费市场:97 种语言覆盖意味着跨境服务成本下降,但定制头像仍需白名单;Google 没提中国大陆和东南亚延迟,To C 陪伴类产品要再等等。