一晚双发:Flash 上线,Next 开源
8 月 26 日晚,阿里千问正式发布 Qwen3.8-Flash,并同步开源采用下一代架构的 Qwen3.8-Flash-Next。Qwen3.8-Flash 是多模态混合专家(MoE)模型:主模型 125B 参数,另配 51B N-gram 嵌入,每个 token 激活 6B 参数,原生支持 256K 上下文。
官方称,相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练与推理成本大幅下降,训练仅需约 1/9,且在编程与办公任务上表现更强。Flash-Next 被视为新一代 Qwen4 系列架构的早期预览:先公开注意力(Gated DeltaNet + Qwen Sparse Attention)、残差(Gated Residual)、嵌入(N-gram Embedding)与优化(Muon)四方面改动,供社区提前验证。
- Qwen3.8-Flash 当晚首发上线「千问办公」,开发者和企业可通过千问 AI 平台获取 API
- Flash-Next 开放权重在 Hugging Face 与 ModelScope 发布,支持 transformers、SGLang、vLLM、llama.cpp 等框架
- 据腾讯新闻等报道,其性能表现超越 Opus 4.6、接近 Opus 4.8
先放一个价格更低的 Flash 商用,再提前公开下一代架构草图,这套节奏比单纯卷参数更有信息量。