把“成功的轨迹”再筛一遍
8 月 27 日提交到 arXiv 的论文 SWE-Prime(arXiv:2608.27449)讨论一个问题:提升大模型解决真实软件问题的能力时,业界普遍的做法是构建大规模 Agent 轨迹数据集,并对成功轨迹做监督微调(SFT)。但论文指出,任务成功并不保证监督质量——成功轨迹里仍可能夹带低效、冗余甚至危险的步骤,直接拿来微调会引入噪声监督,让模型模仿不良的解题行为。
SWE-Prime 因此提出一种多粒度、两阶段的 SFT 数据选择方法:第一阶段在轨迹层面,按过程质量、结果质量与数据代表性做筛选,挑出高质量且有代表性的成功轨迹子集;第二阶段在段级,把连续步骤按语义聚成分段,评估每一段对最终解的贡献、可学习性与潜在风险。微调时所有分段仍保留在序列中以维持上下文,只对筛选出的部分做梯度更新。
- 轨迹级筛选:过程质量、结果质量、数据代表性
- 段级筛选:对最终解的贡献、可学习性、潜在风险
- 训练时保留全部分段以维持上下文,仅对选中部分更新
“数据多不如数据干净”,SWE-Prime 把这个思路从结果导向推进到过程导向:不只筛掉失败的轨迹,还筛掉成功轨迹里那些不该被模仿的步骤。