这个提示词用来做什么
agent 在真实任务里翻车了,你手上只有一句「它没做对」,下次改完提示词也不知道是不是真的修好了
提示词全文
我们有一个 agent 任务跑失败了,请把这次失败整理成一条可以反复运行的用例,而不是一段事后描述。不要替我编造日志里没有的内容,缺什么就列出来让我补。
## 输入
任务目标:{这个 agent 被要求做什么,成功的样子是什么}
失败表现:{它最后交出了什么;哪一步开始不对;有没有报错或超时}
当时的输入:{用户给的原话、附带的文件或数据、可用的工具与权限}
已知的环境差异:{模型版本、提示词版本、工具版本、外部接口有没有变}
出现频率:{每次都错 / 偶尔错 / 只见过一次}
## 输出
1)最小复现:把这次失败压到「一次运行的完整输入」,写清需要固定哪些变量(模型版本、温度、种子、数据快照)。判断标准是别人照着跑能得到同样的错。
2)失败点定位:指出从第几步开始偏离预期,并说明判断依据是轨迹里的哪一句或哪一次工具调用,而不是你的推测。如果日志不足以定位,明确写「需要补哪一个日志字段」。
3)期望行为:写成可断言的形式——给出「输出必须包含什么、不能包含什么、工具调用必须满足什么」,不要写「表现得更聪明」这类无法判定的描述。
4)防回归:给出这条用例在 CI 或日常回归里的运行方式(多久跑一次、失败时谁看、跑一次大概多少成本)。
5)同类风险:这次失败还暴露了哪些「同一类但还没发生」的问题,按发生概率排序,说明为什么。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
一次「agent 整理客户名单」的失败会这样收敛:最小复现固定了模型版本与那 40 行输入表格;失败点定位在第 3 步——它把「备注」列的内容当成了负责人姓名,依据是轨迹里那次工具调用的参数;期望行为写成「输出的负责人字段只能取『联系人』列的值」;防回归建议放进每日任务,用 3 个历史样本断言;同类风险里排第一的是「合并单元格导致列错位」,因为这次输入里正好有合并单元格,只是没触发。
基本信息
- 分类:工程
- 标签:Agent · 回归测试 · 失败复现 · 评测
- 收录日期:2026-09-29
同类提示词
- 故障复盘(Postmortem):时间线、根因与行动项
- 代码评审:先对齐意图,再挑毛病
- 上线前变更自查:兼容性、回滚与可观测性过一遍
- 提示词回归测试:用 12 个边界用例验证改动没有把别处改坏
- AI 编程会话归档:导出、脱敏、编目三件事一次做完
- 智能体资产盘点:把扫描/清单变成权限最小化清单
- 给端侧场景做一张模型选型约束表,而不是对着排行榜挑
- 让智能体写「交接单」而不是「总结」:给下一个会话一份可审计的上下文
- 算力集群采购前的技术尽调:把峰值与利用率指标问成可复现的口径
- 把一次线上事故录制成能进 CI 的回归用例(Agent 录制与选择性回放)
- 把智能体里其实只是 if-then 的调用挑出来,换成窄判定器
- 模型安全评测前的环境体检:让测试沙箱真的离线