论文说了什么
《Grow the Harness, Not the Context》提出一个和主流相反的做法:与其不断往上下文里堆策略提示和检索结果,不如从一个几乎没有策略的脚手架出发,让 agent 在反复失败中把「怎么做事」沉淀成可复用的代码——让承载流程的骨架(harness)自己生长,把 LLM 调用只留给真正需要语义判断的环节。
实验结果
- 基准:BrowseComp-Plus 与 WebArena-Verified;模型覆盖 4B 到 120B 的可部署规模。
- 六个「基准 × 模型」组合里有五个平均成功率最高,剩下一个落后最优 0.7 个百分点。
- 相对常规工具调用型 agent,LLM 调用次数减少 76.0%–91.8%,部署推理成本降低 74.4%–98.6%。
- WebArena-Verified 上成功率稳定在 44.7%–45.3%;工具调用型方案在 4B 小模型上掉到 6.7%。
为什么小模型受益最大
把「怎么做」写进提示词和上下文,等于要求模型每一次都现学一遍流程;流程变成代码之后,模型只需要做那一小步判断。这解释了一个常见现象:同一个 agent 方案换到小模型上就崩,往往不是模型理解不了任务,而是它被要求同时记住流程和推理。
落地时要注意什么
收益最大的场景是「步骤顺序会变、但步骤本身固定」的任务,对本来就一步到位的问题没有帮助。另外它换来的是工程代码量与维护成本——消融实验显示,轨迹内的局部编辑、失败后的联合修复、基于门控的回滚三件事各自都有贡献,也就是说这套骨架需要有人持续维护,否则代码会先于模型腐化。
把流程从提示词搬进代码,往往比换一个更大的模型更省钱。