96GB 单卡跑 170K 上下文
有用户把 Qwen3.8-Flash-Next 部署到单张 96GB 显卡:量化的 n-gram(INT4,约 32GB,内存映射自磁盘)跑出约 110 tok/s,确认 150–160K 上下文流畅可用,还有余量推到 170K 以上。
更具说服力的是使用体验:它在无图形界面的 Ubuntu 上给自己写了几款 HTML 小游戏,还能不依赖浏览器自己学会游玩并不断改进。
评论区补充的数据
- SGLang 在 192K 上下文、真实深度下可达 150–160 tok/s 叙事、200–215 tok/s 代码
- MTP 投机头仅占 0.51GB 显存,几乎零成本
- 30 万参数的 n-gram 表压成 INT4 后内存映射,让长上下文本地推理“既大又便宜”
关键不在单点跑分,而在整套“量化 + 投机解码 + 内存映射”组合,让长上下文本地推理第一次变得便宜。