把 Qwen3.8-27B 压到平均 3.21 位:54GB 变 12.3GB,单张 16GB 显卡就能跑
OrcaRouter 发布开源权重 OrcaSAQ-2 27B:用自研的「敏感度感知混合精度量化」(SAQ)把阿里 Qwen3.8-27B 的 54GB BF16 检查点压到 12.3GB,平均 3.21 位、体积缩小 77.2%,量化依据是逐层敏感度而不是一刀切。官方给的对齐指标是:WikiText-2 困惑度 5.6482 对 BF16 的 5.6468(约 +0.02%)、token 级 Top-1 一致率 93.2%、平均 KL 散度 0.031;保留 262K 上下文与思考模式,支持工具调用与 MTP 投机解码,可用 vLLM 以 OpenAI 兼容接口提供服务。代价是丢掉了视觉塔,所以它是纯文本模型;在 16GB 单卡上单路约 65 tok/s,8-16 路并发可到 330+ tok/s。以上数字均来自厂商自测。