什么是全双工语音交互

传统语音助手是「轮流说话」模式:你说完→AI 想一会→AI 说→你说。就像对讲机,一方说完另一方才能开口。全双工则是像打电话:双方可以同时说话,AI 能在你说话的过程中做出反应——点头、插话确认、甚至中途打断你。

字节跳动发布的 SeedRealtime 就是冲着这个目标去的。它用统一架构原生融合音频、视频与文本,在连续的多模态信息流上实时交互。目前已在豆包 App 全量上线。

实测体验

打开豆包 App 的语音对话模式,最直观的感受是:不用等。你说话的时候它就在处理,你说完几乎立刻就有回应,中间的停顿感基本消失。

更厉害的是它能「听懂」你的语气。测试中我说「这个功能挺好的」(带犹豫语气),它直接回复「听起来你好像不太确定,要不要我详细说说这个功能的限制?」——这在以前是需要多轮对话才能触发的能力。

抗干扰与主动交互

在有背景噪音的环境下(咖啡馆),SeedRealtime 依然能准确识别语音,不会被周围人的对话干扰。它还能主动发起交互——比如你沉默太久时它会问「还在吗?需要我继续说吗?」。

不足与期待

目前全双工模式主要在语音场景表现好,视频理解还比较基础——给它看一个画面让它实时描述,偶尔会有延迟和遗漏。另外长时间对话后偶尔会出现「答非所问」,可能需要后续优化。

全双工不是噱头,它真的改变了与 AI 对话的感觉——从「使用工具」变成了「和人聊天」。