Reflection 放出 Beam:501B 总参数、23B 激活的开源权重,把重点放在推理成本而不是榜单第一
十月五日,Reflection 公布了它的第一个开源权重模型 Beam:稀疏 MoE 结构,总参数 501B、激活 23B,面向编程、推理与 agent 类任务。官方说预训练用了 23.8 万亿 token,来自网页与授权数据集;强化学习那一段在高算力下跑了四周,完成超过 1 亿次 rollout,用了 10500 块 GB300。官方给出的定位很直白:在编程与 agent 任务上,它跟更大的开源模型(如 GLM 5.2)打平或接近 Qwen 3.8-Max,但真正占优的是推理时的效率;纯能力上,像 Kimi K3 这类前沿开源模型仍在前头。Beam 还在做最后一轮红队测试与评测,权重、技术报告、模型卡与开发工具会在本月稍晚以 Apache 2.0 放出,现在只开放早期访问的候补名单。