8 月 26 日,阿里千问开源 Qwen3.8-Flash-Next。它采用下一代(Next)架构——Gated DeltaNet + Qwen Sparse Attention 的混合注意力、Gated Residual、N-gram Embedding 与 Muon 优化器,被视为 Qwen4 系列的架构预览。模型本体 125B 参数、单 token 激活 6B,另配 51B N-gram 嵌入,原生支持 256K 上下文。参数量不小,但激活参数低,配合量化版在消费级硬件上有得玩。
部署前先想清楚硬件
125B 主模型即使只激活 6B,全精度权重也要约 250GB 显存(125B × 2 字节)。实际部署普遍走多卡张量并行或量化。官方推荐的路线:显存充足(多张 80GB 卡)用 vLLM/SGLang;单卡想跑就找 GGUF 量化版配合 llama.cpp;只想快速验证用 transformers serve。
路线一:transformers serve 一条命令
pip install -U transformers
transformers serve Qwen/Qwen3.8-Flash-Next --port 8000 --continuous-batching
# OpenAI 兼容 API:http://localhost:8000/v1这是最快的一条路:模型定义与推理都在 transformers 内,启动后即获得 OpenAI 兼容接口。适合先验证功能、再决定上不上专用推理框架。
路线二:llama.cpp + GGUF 量化版
llama.cpp 官方支持 Qwen3.8-Flash-Next 的文本与视觉输入。去 Hugging Face 搜以 GGUF 结尾的量化版本(如 Unsloth 发布的量化包),下载后直接用 llama-cli 跑:
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-Flash-Next-GGUF --local-dir ./Qwen3.8-Flash-Next-GGUF
# 量化文件名以仓库实际发布为准
llama-cli -m ./Qwen3.8-Flash-Next-GGUF/<量化文件>.gguf -c 32768GGUF 量化版把权重压到十几 GB 到几十 GB 不等,配合 6B 激活的稀疏计算,单张消费级显卡有实际跑起来的可能;具体能装多大上下文,取决于显存与量化档位。
路线三:vLLM / SGLang 多卡推理
官方示例用 4 卡张量并行 + 256K 上下文。两个框架都支持 tool calling 与 reasoning parser,适合做服务化部署:
# vLLM
vllm serve Qwen/Qwen3.8-Flash-Next --port 8000 --tensor-parallel-size 4 \
--max-model-len 262144 --reasoning-parser qwen3 \
--enable-auto-tool-choice --tool-call-parser qwen3_coder
# SGLang
sglang serve --model-path Qwen/Qwen3.8-Flash-Next --port 8000 --tp-size 4 \
--context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder国内下载:ModelScope
访问不了 Hugging Face 时可以走 ModelScope。对支持的框架设置环境变量即可自动从魔搭拉模型:
export SGLANG_USE_MODELSCOPE=true # SGLang 从 ModelScope 拉模型
export VLLM_USE_MODELSCOPE=true # vLLM 从 ModelScope 拉模型验证与使用
服务起来后,用任意 OpenAI 兼容客户端调用 http://localhost:8000/v1,模型名填 Qwen/Qwen3.8-Flash-Next。想确认多模态能力,可以传一张图片让模型描述;想验证工具调用,发一个带 function calling 的请求。
6B 激活的 MoE 把门槛压得很低,但 125B 的权重还是要认真对待显存预算——先量化、再并行,别一上来就全精度硬跑。