它是什么

阿里通义发布 Qwen-Audio-3.1 系列,一次给出五款模型。三条主线是语音识别(ASR)、语音合成(TTS)与实时对话(Realtime);两款新成员是 Qwen-Audio-3.1-TTS-Next(音频创作)与 Qwen-Audio-3.1-ASR-Next(音频理解)。官方把这套组合概括为「理解 — 生成 — 交互 — 创作」全栈。

五款模型各解决什么

  • ASR:多语言与方言识别提升,会自动清理口头语与重复,输出更干净。
  • ASR-Next:支持多说话人区分并输出时间戳,能识别情绪、环境音与机器噪声,适合会议纪要与录音质检。
  • TTS:支持跨语言的自然音色迁移,可以用一句文字指令控制情绪、语速与风格。
  • TTS-Next:把语音语言模型与扩散模型组合,一次生成人声、音效与背景音,面向音频创作。
  • Realtime:边说边听、可被随时打断;检测到对方情绪低落时会放慢语速。

价格变了多少

官方口径是相对的:TTS 下调约 70%、Realtime 下调约 85%、ASR 最高下调 95%。绝对单价写在阿里云 Model Studio 的模型定价页上。

  • qwen-audio-3.1-realtime-plus:国际区文本输入 $0.8、音频输入 $6.4、文本输出 $6.4、音频输出 $24(每百万 tokens);中国(北京)区为 $0.688 / $5.501 / $5.501 / $20.628。
  • qwen-audio-3.1-asr-flash:中国(北京)区输入 $0.113、输出 $0.382;新加坡区输入 $0.15、输出 $0.47(同样按每百万 tokens,且为不含限时促销的原始价)。

中文一手报道只给了相对降幅、没有给绝对单价,所以实际计费请以各区域定价页为准;跨区部署的价差可能比模型选型本身更影响账单。

对你的产品意味着什么

语音功能长期被当成附加项,一个原因就是按分钟计费的成本压不下来。这一轮降价把成本门槛挪了一个量级,直接后果是那些原本为了省钱而做的降级设计可以撤掉一部分。另一半影响在数据结构上:ASR-Next 把「谁在什么时候说了什么」连同情绪与环境音一起输出,会议纪要与合规录音这类场景不必再自己拼时间轴。

「谁识别得准」已经不再是最稀缺的能力,能决定产品形态的是每百万 token 的价格与结构化输出。