AI呀
早报 资讯 工具 素材 学习 排行 社区
店铺 登录
模型发布 阿里云通义千问 2026-09-30

阿里开源 Qwen3-Next-80B-A3B:总参数 800 亿只激活 30 亿,长上下文吞吐提升十倍

9 月 29 日通义千问放出 Qwen3-Next 系列,旗舰 Qwen3-Next-80B-A3B 总参数约 800 亿、单次推理只激活约 30 亿,结构上换成 Gated DeltaNet 与 Gated Attention 混合的稀疏方案。官方给出的效率数字是:只用了 Qwen3 那 36T 预训练语料里约 15T tokens 的均匀子集,消耗 GPU 小时比 Qwen3-30A-3B 低 20% 以上,仅为 Qwen3-32B 的 9.3%。推理侧,预填充阶段 4K 上下文吞吐接近 Qwen3-32B 的七倍,超过 32K 后提升到十倍以上;解码阶段 4K 下约四倍、长上下文仍保持十倍以上。Base 版只激活约十分之一的非嵌入参数,却在多项基准上超过参数更多的 Qwen3-32B-Base;Instruct 与 Thinking 版支持 256K 上下文,权重已在 Hugging Face 与魔搭开放。

Qwen3-Next开源稀疏架构长上下文通义千问MoE
查看原文 / 来源 · huggingface.co ↗
AI呀 · 聚合 AI 资讯与应用