Ornith-1.5 是 DeepReinforce 8 月 19 日发布的开源模型系列,一共四个规模:397B MoE、35B-A3B、9B 稠密版和 9B-Mobile 量化版。官方口径里,最大模型的性能媲美 Claude Opus 4.8,并在部分测试中超过后者;最小版本则直接瞄准手机端。发布节奏和上一轮开源潮明显不同——不是只给一个「服务器级旗舰」,而是同时把「能跑进手机」做成了卖点。
最值得关注的是「自我改进循环」
官方博文介绍,训练过程中模型会不断给自己提出更难的任务,形成自主性能提升的闭环。这种机制今年已经多次出现在开源模型的发布口径里,但把它和「全系开源、最小版跑手机」放在一起卖,还是第一次。它解决的是训练数据瓶颈的问题——与其等人来喂数据,不如让模型自己造任务。
四个规模怎么选
- 397B MoE:旗舰档,适合集群上的复杂推理、长链路 Agent 任务
- 35B-A3B:单卡可跑的 MoE,适合本地开发与私有化部署
- 9B:稠密小模型,多数测试优于参数更多的 Gemma-4-31B
- 9B-Mobile:9B 的量化版本,可直接运行在安卓手机与 iPhone 17 上
短板与不确定性
- 基准数据是厂商自报:发布两天内还没有第三方复现,Swiss 一些跑分要等社区验证
- 权重与评测细节尚未全部公开,能不能落地要看实际下载与部署体验
- 手机版「能跑」不等于「好用」:帧率、上下文长度、发热控制都需要实测
- 生态还年轻:微调脚本、量化工具、部署框架的社区积累需要时间
如果你在找「开源旗舰 + 端侧小模型」的组合,Ornith-1.5 值得盯一段时间;但现阶段更适合先看社区复现,而不是直接拿它做生产依赖。和 Qwen3.8-27B 这类已经有完整工具链的模型相比,Ornith-1.5 的短板不在参数,而在生态。
把最大模型的竞争力做出来,再让最小模型跑进手机——开源模型的发布策略,越来越像同一枚硬币的两面。