AI呀
早报 资讯 工具 素材 学习 排行 社区
店铺 登录
开源生态 JustVugg / 开源 2026-09-28

Colibrì 开源:把 744B 的 GLM-5.2 塞进 25GB 内存的笔记本,专家权重留在 SSD 上按需读

Colibrì 是一个纯 C 实现、零引擎依赖的开源推理框架(Apache-2.0),用分层存储加按需取专家的办法,让普通电脑跑前沿 MoE 模型。它把每个 token 都要用的稠密部分(GLM-5.2 约 17B 参数,int4 后约 9.9GB)常驻内存,19456 个路由专家全部放在 NVMe SSD 上,由 Router 点名后再读;VRAM / RAM / SSD 组成分层缓存,最近用过的专家留在内存,并依据相邻层路由的相关性提前预取下一层。作者最早在 12 核 CPU + 25GB 内存的开发机上验证,冷缓存约 0.05–0.1 token/s;128GB 内存的纯 CPU 桌面机约 1.8 token/s;6 张 RTX 5090 让专家常驻高速层后约 5.8–6.8 token/s。目前已覆盖 9 个模型家族,从 Qwen3.6、OLMoE 到 744B 的 GLM-5.2/5.3、975B 的 Inkling,以及需要约 1.6TB 硬盘但 32GB 内存可起跑的 Kimi K3。

MoE本地推理SSD开源GLM-5.2
查看原文 / 来源 · github.com ↗
AI呀 · 聚合 AI 资讯与应用