这是什么
Meta Superintelligence Labs 8月10日开源了Muse Glimmer——一个300亿参数的因果语言模型,带视觉编码器(ViT-G/14),专为本地运行的Agent工作流设计。它不是在云端跑的大模型,而是能在你桌上那张RTX 5090或者MacBook上直接跑的模型。4bit量化后从55GB压缩到18-20GB,24GB显存就够用,还留有余量跑KV缓存和推测解码。
速度表现:DFlash推测解码
Meta给Glimmer配了DFlash——一种轻量级块扩散推测解码器。实际测试:RTX 5090上解码速度3.1倍加速,M5 Max上1.8倍,M4 Max上1.5倍。用NVFP4权重+DFlash开启时,LMSYS测得RTX 5090上约230 tokens/s,足够流畅的Agent交互。要注意的是:Meta官方推荐的采样参数是temperature=1.0, top_p=0.95,压到0.2反而会让Agent行为变差——因为这模型训练时就用的高温度。
性能对比:Agent场景全面领先同尺寸
跟同尺寸竞品比:MCP-Atlas(工具调用)75.5 vs Gemma4-31B的54.2和Qwen3.6-27B的62.5;DeepSearch QA 74.6,对手都在50多分;SWE-Bench Verified 76.0,SWE-Bench Pro 51.2,AIME 2026 94.7。唯一致命短板是Terminal-Bench(终端/计算机操作)仅51.7,大幅落后Qwen3.6-27B的60.7——Glimmer的强项是工具编排和推理,不是模拟人类操作桌面。
- Apache 2.0许可:允许商用、修改、再分发、微调,只需保留许可声明——这是Meta首次对Agent模型用完全宽松协议。
- Day-0生态:transformers、llama.cpp、vLLM、MLX、ExecuTorch首批支持,Ollama 0.32.7和LM Studio同日跟进。
- 扎克伯格同日发6500字长文,主张超级智能应该分布化而非集中化,批评美国对开源AI的监管壁垒比中国更严。
为什么Apache 2.0是最大的新闻
Meta之前的开源模型用社区许可(Community License),有可接受使用条款,大部署方需要申请许可。这让任何一个想商用的人在原型阶段就要走法务审核。Apache 2.0把这个摩擦去掉了。把这事放在中国开源模型(DeepSeek、Qwen)过去一年用宽松协议抢占开发者心智的背景下看,Meta的策略很直白:用同样的招数打回来。而且Meta还预告,Muse Spark 1.2旗舰模型的权重也将在几周内开源。
对开发者的实际意义
一个能做多步工具调用、失败后能自动恢复、能读截图的模型,跑在你已有的消费级GPU上——没有按Token计费、没有数据离开你的机器。对于做敏感数据处理的团队、有数据驻留要求的组织、预算有限的中小团队,这是完全不同的成本模型。如果你已经在本地跑Qwen或Llama做自动化,值得在你自己任务集上benchmark一下Glimmer(别只看通用榜单)。如果是16GB显存的卡,3bit量化版可以用但要实测——Agent可靠性的退化比文本质量退化更难发现,代价也大得多。
Agent模型终于能跑在消费级GPU上了——Apache 2.0意味着这不是玩具,是可以直接集成进产品的零件。