这个工具是做什么的
让智能体从真实交互里持续变强,通常要自己把三样东西焊起来:推理服务、反馈采集、和训练完之后的版本切换,中间还夹着「更新时不能断服」这个没人愿意写的部分。Reef 把这套做成开源基础设施。它给自己的定位是补上推理引擎与 RL 训练框架之间的空缺:vLLM、SGLang 这类引擎能服务线上流量但不能训练权重,Slime、veRL、AReaL 这类框架能训练但不能服务,也不管版本;Reef 三件事都做,并且能改进权重之外的东西——提示词、规则、技能这些 harness 层面的配置同样在学习范围内。它的学习循环是四步:服务请求并记录交互、采集反馈、产出更新、把通过验收的更新提交进版本历史,切换版本时服务不停。使用时按目标分三条路:想要一个为自己场景训练出来的模型权重,需要可训练模型加支持的 GPU 栈;只想让 harness 自改进,只需要一个模型 endpoint、一批有代表性的任务和一个评估器,本地不需要训练卡;做研究性质的测试时训练,则需要执行环境、正确性检查器和可度量目标。PyPI 包名为 reef-infra,要求 Python 3.12+,仓库 2026 年 8 月底建,两周多拿到 2.5k 星,提供中英文文档。
基本信息
- 分类:AI Agent
- 厂商 / 团队:Human-Agent-Society(开源,Apache 2.0)
- 价格:免费(开源,Apache 2.0)
- 收录日期:2026-09-17
- 官网:github.com
适用场景
持续学习 · 自改进 · 强化学习 · SGLang · 版本管理 · 开源