全双工到底改变了什么
以前的语音助手大多是「半双工」——你说完,它处理,然后回复。中间那 2-3 秒的沉默很出戏。SeedRealtime 用统一架构原生融合音频、视频和文本,能在连续的多模态信息流上实时交互。
端到端人工评测显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半,单次对话完整顺畅交流的概率明显提升。说人话就是:更像真人打电话了。
实际体验维度
- 延迟:说完后几乎立刻有回应,没有明显的「思考中」空白
- 打断:支持随时打断,模型会停止当前回复听你说话
- 情绪感知:能根据语气判断情绪并调整回复方式
- 视频理解:可以同时看画面并描述你看到的内容
怎么用
不需要额外安装,把豆包 App 更新到最新版,在对话界面找到语音/视频通话入口即可。目前全量开放,免费使用。
适合什么场景
开车时做语音笔记、做饭时查菜谱、孩子写作业时答疑、远程沟通时实时看物——这些需要「解放双手」的场景,全双工的价值最大。它不是替代文字搜索,而是开辟了一种新的交互方式。
SeedRealtime 让豆包从「能听」变成了「能聊」,这是国产 AI 语音交互的一次质变。