自我改进循环训练
8 月 19 日,DeepReinforce 宣布推出 Ornith-1.5 系列开源模型。官方博文介绍,训练过程中引入了「自我改进循环」:模型在学习中会不断给自己提出更难的任务,形成自主性能提升的闭环。系列共包含四个规模。
- Ornith-1.5-397B:MoE 架构,总参数 3970 亿,性能媲美 Claude Opus 4.8,并在部分测试中超过后者
- Ornith-1.5-35B-A3B:MoE 架构,总参数 350 亿,性能优于稠密模型 Muse-Glimmer-30B 和 Gemma-4-31B
- Ornith-1.5-9B:稠密模型,多数测试中性能优于参数更多的 Gemma-4-31B
- Ornith-1.5-9B-Mobile:9B 的量化版本,可在安卓手机、iPhone 17 等机型上运行
「自我改进循环」这类训练机制今年已多次出现在开源模型的发布口径里,但 9B 量化版能直接跑在手机上,仍然把它和只能在服务器上演示的同类区分开来。截至发稿,Ornith-1.5 的权重与评测细节尚未全部公开,第三方复现还需要时间。
把最大模型的竞争力做出来,再让最小模型跑进手机,开源模型的发布策略越来越像同一枚硬币的两面。