一次吃四种模态,窗口给到 1M

阿里千问 9 月 18 日上线 Qwen3.8-Omni-Flash。它是一个原生全模态模型:同一次调用可以接受文本、图片、音频、视频输入,输出只有文本。上下文长度 1M token,官方文档给出更细的边界——非思考模式最大输入 991,808 token,思考模式 983,616 token,最大输出 131,072 token。

「原生」在这里是关键限定:不是外挂一条转写通道再喂给文本模型,而是同一个模型内部理解四种模态。模型支持 113 种语言与方言的音频输入、空间音频与多通道音频(Chat Completions 通过 use_multichannel 开启),深度思考默认开启并支持调节思考强度。

涨幅集中在音视频与长程任务

官方称在 30 项评测上,Qwen3.8-Omni-Flash 的平均分比上一代 Qwen3.5-Omni-Plus 提升超过 26%,文本性能与同尺寸纯文本模型相当。增幅最大的是音视频 Agent 与长程任务:WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分,UniClawBench 拿到 69.6 分。

基础能力上,LongAudioSpan 提升 8.3 分,OmniVideoBench 提升 9.6 分;会议场景的说话人日志错误率与 cpWER 从 88.11 / 89.61 降到 3.35 / 17.18。在 Agentic 长音视频理解中,官方给出的 OmniVideoBench 准确率从 63.4 升到 67.8,同时 token 消耗从 145,736 降到 79,117,降幅约 45.7%。

价格:按小时计费的音频输入降了 98%

官方称音频能力整体超过 Gemini 3.8 Flash。价格侧的表述更直接:API 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%。IT 之家援引官方口径的标题是「百万 Token 图文音视频输入 0.8 元」。

需要留意价格口径并不单一:音视频按小时计费,文本与图片按 token 计费,国际站另有美元价目,比较成本时先统一口径再下结论。

落地三件套与官方承认的限制

模型发布同时给出一套交付物:API 与 Realtime API 同步上线;Qwen-MM-Plugins 是面向 Agent Harness 的多媒体插件套件,官方称已适配 Codex、Claude Code、Qwen Code、Gemini CLI、Qoder、CodeBuddy、OpenClaw 七家,目标是把图像、音频、视频与文档理解直接接进你已经在用的编码智能体;Qwen-Live Harness 面向实时、持续的全模态交互。

长音视频方向的场景包括按需描述、Agentic 主动取证、会议任务推进与视频深度研究报告,可控音视频 Caption 可指定描述对象、时间范围、信息粒度与输出格式。实时版 Qwen3.8-Omni-Flash-Realtime 可在音视频流输入的同时完成感知与响应,官方称它是首个支持「听声辨位」的全模态模型。

官方也写明了限制:模型在保留思考历史的模式下训练,如果 Agent 框架没有把历史思考内容回传给模型,生成质量会变得不稳定;同时它偏向长程任务,在指令模糊时可能替用户做出意外决定,需要更明确的系统提示约束。

音视频输入按小时降价 98%,比多 26% 的平均分更能改变产品清单——它把「做不到」变成了「要不要做」。