这次发布的两个版本
Google DeepMind 在 9 月 15 日发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking,两者都是面向开发者的音频模型,通过 Gemini API 与 Google AI Studio 提供。3.8 Live 的定位是语音智能体:它能在继续说话的同时在后台调用工具与 API、处理近实时的视觉输入,并在同一段对话里自动识别与切换 97 种语言。
Extended Thinking 版本额外做了一件事——推理与说话同时进行。它会用「让我查一下」这类提前给出的口头提示承接请求,随后逐步朗读多步骤任务的进展。官方演示包括把草图加语音反馈直接变成可运行的 React 组件,以及并联多个异步函数完成一次预订流程。
真正的主角是价格
音频输入每分钟 0.005 美元、音频输出每分钟 0.018 美元,官方折算依据是每百万输入 token 3 美元、每百万输出 token 12 美元。按这个口径,一小时的语音对话约 1.38 美元。作为对照,OpenAI 的 GPT-Live-1 是每分钟 0.05 美元,同样一小时至少 3 美元。
这不是几个百分点的差别。对客服外呼、预约确认、语言陪练这类「全程都在说话」的产品,单位经济模型会因此换一条曲线——过去限制它们的是每分钟成本算不过来,现在限制它们的是任务完成率。
分数与缺口
- Artificial Analysis 语音对话质量指数:Extended Thinking 以 82.6 排第一,官方称领先 OpenAI 最新的 GPT-Live-1 系列
- τ-Voice:68.6%——这是带工具调用的语音任务完成率,意味着约三分之一任务做不完
- Sierra τ-Voice-banking:35.1%——银行这类高合规场景的完成率明显更低
- Big Bench Audio:97.7%——音频理解类任务表现更强
- ServiceNow 的 EVA-Bench 上,官方称两个模型在准确率与对话质量之间推高了帕累托前沿
能力清单里最实用的两项
官方把 Live API 的新能力拆成五项:异步函数调用(回答继续播报,任务在后台完成)、实时视觉上下文、字母数字精确识别(确认码、理赔号、技术参数这类语音系统最容易出错的地方)、97 种语言的中途切换与口音一致性、以及把实时音频与结构化数据合并后返回增量更新。其中字母数字识别与增量更新最贴近真实业务——多数语音系统翻车不是在闲聊,而是在念单号与核对信息。
还有一个容易被忽略的细节
所有由 Google AI 产品生成的音频都带 SynthID 水印,官方称这种不可感知的水印直接织进音频输出,用于让 AI 生成内容保持可检测。对做合规与内容留痕的团队,这省掉了一层自建标注;但它只解决「是不是 AI 生成」,不解决「谁授权这次通话」。
生态与上线节奏
Live API 的集成方包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 与 Vision Agents,这些平台负责背后的实时媒体流基础设施,开发者可以把精力放在交互设计上。官方同时提到 Salesforce、Genspark、Lumeris 等合作方。上线渠道则分得很散:开发者可立即通过 Gemini API 与 AI Studio 使用;企业侧在 Gemini Enterprise 为 private preview;普通用户侧 3.8 Live 进入 Search Live,Extended Thinking 进入 Gemini Live,并向部分订阅层的 Workspace(Docs Live、Gmail Live、Keep Live)开放。
该自己验的三件事
第一,听感与打断:第三方评测认为 OpenAI 那套在全双工与自然度上仍占优,务必在同一段真实话术上做 AB,重点听抢话与打断后的恢复。第二,任务完成率:τ-Voice 68.6% 是通用口径,你自己的工具链可能更好或更差,用真实任务集跑一轮才有意义。第三,账单:按分钟计费会让超时未挂断、失败重试与静默计费放大成本,上线前就把时长上限与自动挂断策略配好。
语音 Agent 的门槛已经从「每分钟多少钱」换成了「一小时内它能完成几件事」——前者 Google 今天替你砍掉了三分之二,后者得靠你自己的任务集来回答。