这个提示词用来做什么
你在用「多次采样 + 打分挑最好」的方式评估 agent,担心分数虚高、跨模型不可比
提示词全文
我要评估一个会多步执行的 agent(或多轮对话系统),现在用的是「采样 N 次、用打分器挑最高分」的做法。请帮我把评估方案改成「挑选和报分分开」,避免分数虚高。
## 输入
任务与打分方式:{任务描述、打分器是什么、怎么算分}
当前评估流程:{采样几条、怎么挑、用哪批数据报分}
我关心的结论:{是比模型、比提示词,还是决定要不要上线}
## 输出
1)偏差诊断:指出我现在这套流程里,哪些环节会让分数偏向乐观(例如挑选和报分用了同一批样本、打分器本身有偏差、候选数不一致导致不可比),并说明每一步大概能虚高多少方向。
2)拆分方案:设计两批数据——一批用来挑选(search set)、一批留出只用来报分(holdout),给出建议的划分比例与划分方式(怎么避免两批之间泄漏)。
3)候选数对齐:如果一定要横向比较不同模型,说明候选数必须怎么固定,才能让比较成立。
4)成本估计:给出这套方案的调用量与成本估算,并说明在预算有限时最该保住的哪一步。
5)可复现要求:列出必须固定下来的东西(随机种子、打分器版本、提示词版本、数据集快照),否则结论不成立。
请优先给出能立刻改的步骤,不要让方案复杂到跑不起来;数据不足的地方直接写「无法判断」。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
最容易被忽略的是第 3 步:候选数不一样时,分数高低可能只反映「谁挑得更狠」。把挑选集和报分集分开之后,你多半会发现原来的成绩要往下修一点——但换来的可比性,线上决策时更值钱。
基本信息
- 分类:工程
- 标签:评估 · Agent · 留出集 · 偏差 · 可复现
- 收录日期:2026-10-08
同类提示词
- 故障复盘(Postmortem):时间线、根因与行动项
- 代码评审:先对齐意图,再挑毛病
- 上线前变更自查:兼容性、回滚与可观测性过一遍
- 提示词回归测试:用 12 个边界用例验证改动没有把别处改坏
- AI 编程会话归档:导出、脱敏、编目三件事一次做完
- 智能体资产盘点:把扫描/清单变成权限最小化清单
- 给端侧场景做一张模型选型约束表,而不是对着排行榜挑
- 让智能体写「交接单」而不是「总结」:给下一个会话一份可审计的上下文
- 算力集群采购前的技术尽调:把峰值与利用率指标问成可复现的口径
- 把一次线上事故录制成能进 CI 的回归用例(Agent 录制与选择性回放)
- 把智能体里其实只是 if-then 的调用挑出来,换成窄判定器
- 模型安全评测前的环境体检:让测试沙箱真的离线