问题:harness 靠手写

长时程 LLM 智能体越来越依赖外部执行环境(harness)来维护状态、跟踪进度、调用工具、验证结果。但 harness 的用法通常靠提示词、启发式或领域惯例手工设计,难以针对具体任务调优。

Meta AI 与伊利诺伊大学香槟分校提出 EvoHarness-RL(arXiv:2608.05446),把 Belief、Progress、Experience 三类状态作为可供策略学习的 harness 状态,先用监督微调教会基座模型 harness 动作空间,再用考虑成本的 GRPO 探索读写与合并外部状态的协调策略。论文已被 LLA@COLM 2026 接收。

结果

  • Qwen3-8B 在 ALFWorld 上成功率 96.9%,比 ReAct 基线提升 49 个百分点
  • 对比 Claude Opus 4.5 的 96.4%,8B 级模型在多步任务上追平前沿模型
  • harness annealing 让模型对熟练流程停止外部查询,降低延迟与成本

作者也标注了适用边界:对短而稳定的任务,ReAct 或标准 RAG 已经足够,不必引入这套框架。

能力差距正在从参数规模转移到执行框架,8B 级模型也能扛下原本要外送的长时程工作流。