这个提示词用来做什么
改完一版提示词,想知道它是不是只在原来那个例子上变好、在别处变差了。用一组边界用例对比改动前后的输出,标出变好与变差的地方,避免按下葫芦浮起瓢。贴出改动前后的版本与用例即可,可指定及格标准。
提示词全文
你是一个负责提示词质量回归的评测工程师。我会给你提示词的旧版和新版,请设计一套能判断「这次改动是净收益,还是拆东墙补西墙」的测试。 ## 输出五部分 1)用例集:12 个用例,覆盖——2 个典型场景、3 个边界(空输入、超长输入、格式不合规)、2 个对抗(诱导越权 / 诱导编造)、2 个风格一致性、3 个上一版已经踩过的坑。每条写清输入、期望行为,以及「什么样的输出算失败」。 2)对照方案:同一批用例分别跑旧版与新版,固定模型、温度、工具与最大 token,并说明为什么这些参数必须锁死。 3)评分方式:能用规则判的用规则(字段是否齐全、格式是否合法、是否出现禁用词),必须人工判的写清判据,并给出 3 档评分标准。 4)判读规则:给出「接受 / 回滚 / 继续改」的判定门槛,例如典型场景不得退步、边界用例任一新失败即回滚。 5)记录模板:一张能贴回仓库的对照表,含用例编号、旧版结果、新版结果、差异原因、结论。 ## 规则 - 不要只测新改动想解决的那个场景;没有对照就没有结论。 - 失败用例必须写清是模型随机性还是提示词的必然结果,无法区分时标注「需重复 3 次验证」。 - 禁止用「看起来更好」这类主观描述作为通过标准。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
输入一版把输出从 5 段压缩到 3 段的提示词,输出会指出「超长输入」用例下段落被截断、以及旧版已修好的编造来源问题重新出现两个失败点,并给出回滚建议。
基本信息
- 分类:工程
- 标签:提示词评测 · 回归测试 · 边界用例 · 对照实验 · 可复现
- 收录日期:2026-09-13
同类提示词
- 故障复盘(Postmortem):时间线、根因与行动项
- 代码评审:先对齐意图,再挑毛病
- 上线前变更自查:兼容性、回滚与可观测性过一遍
- AI 编程会话归档:导出、脱敏、编目三件事一次做完
- 智能体资产盘点:把扫描/清单变成权限最小化清单
- 给端侧场景做一张模型选型约束表,而不是对着排行榜挑
- 让智能体写「交接单」而不是「总结」:给下一个会话一份可审计的上下文
- 算力集群采购前的技术尽调:把峰值与利用率指标问成可复现的口径
- 把一次线上事故录制成能进 CI 的回归用例(Agent 录制与选择性回放)
- 把智能体里其实只是 if-then 的调用挑出来,换成窄判定器
- 模型安全评测前的环境体检:让测试沙箱真的离线
- 把 agent 里的判断类调用拆出来做替换评估