面向开发者的新一代语音识别模型
Google 近日发布 Gemini 系列最新语音转文字模型 Gemini 3.5 Transcribe,官方称其为该系列目前准确度最高的语音识别模型,面向开发者、企业及普通用户开放。模型重点提升了嘈杂环境、复杂专业术语与自然口语表达下的转写能力。
准确率方面,Google 给出的数据是:流式语音识别场景平均词错误率 4.0%,非流式场景 2.6%;能更准确地识别订单编号、邮政编码等字母数字混合信息。功能上支持自动自我修正、删除“嗯”“啊”等口语填充词、自动格式化输出,还可将文件分析、图像生成等复杂任务委派给其他 Gemini 模型,形成多模型协作。
语言支持上,模型覆盖 85 种语言并支持地区口音和方言;对预录音频可为最多三名说话者进行带时间戳的语音归属识别,并适配用户自定义词汇表。开发者可通过 Google AI Studio 与 Google Antigravity 中的 Gemini API 以公开预览形式使用;macOS 版 Gemini 应用与 Android Gboard 的 Rambler 功能已接入该模型,Google 还计划将其引入 Chrome 浏览器。
- 流式 WER 4.0%,非流式 2.6%
- 覆盖 85 种语言,支持自定义词汇表
- 最多 3 名说话人带时间戳语音归属
- 公开预览:Google AI Studio / Gemini API
语音识别已经卷到词错误率小数点后一位,模型之间的差距更多体现在口音、噪声和垂直词表这些“刁钻场景”,这也正是 Transcribe 想证明自己的地方。