它加了什么:一路视频,和一个不等人的调用方式

9 月 24 日 Google 在官方博客介绍了 Gemini 3.8 Live with Live Avatar,并说明当天起在 Gemini Enterprise 中可用。做法是把上一周发布的 Gemini 3.8 Live 原生实时对话模型和一路低延迟流式视频原生耦合:模型同时处理音频与视觉输入,输出的不只是语音,还有一个会动、有表情、口型对得上话的视觉形象。官方给的落点是客服接待、互动式导览这类企业场景。

四个可以拿去比对的点

  • 语言覆盖:原生多语言语音到语音同步,官方称可在 97 种语言之间无缝切换,切换时口型与表情动态适配,不降低视频保真度、不产生视觉漂移;
  • 轮次体验:官方反复强调的是自然的轮次切换(turn-taking)而不是声音像不像,也就是说优化目标是「能不能插话、能不能接上」;
  • 异步工具调用:形象在继续对话的同时在后台触发工具调用、拉取数据,官方举的例子是酒店办理入住——查系统的同时在说话;
  • 形象定制:除了一批预置形象,企业可以用一张高质量参考图生成一个会动、能响应的专属形象,同时保留参考图的相似度与品牌设定;这条路径目前只在企业白名单下开放。

透明与合规:水印是默认项

官方明确说明,Live Avatar 的所有输出(音频与视频)都嵌入 SynthID 不可感知水印,用于保持 AI 生成内容的可检测性,降低误认与错误归属的风险。对做企业内容的企业来说,这不是可选项,而是产品默认行为;如果业务上要求输出「不可溯源」或需要逐帧比对存档,这一点必须在选型阶段就确认。

和上一代语音助手比,差别在哪

多数语音助手在触发后端操作时会出现一段明显的沉默——先执行、再说话,用户只能等。Live Avatar 把这两件事拆成并行:对话线程继续,工具在后台跑完再把结果接进话里。对客服这类「一轮一轮接」的场景,感知到的差别主要就来自这里,而不是口型准不准。

动手前建议先量三个数

  1. 用户说完到出现第一句回应的时延(这是用户唯一真正感知到的延迟);
  2. 后台工具调用期间,对话是否真的保持连续——用一段真实的多轮工单跑一遍,而不是用官方 demo;
  3. 一次会话中工具调用的失败与重试成本,尤其是查不到数据时它会不会硬答。
判断要不要用它的标准,不是像不像人,而是「你原来那几秒沉默值多少钱」。