这个提示词用来做什么
需要验证一次安全训练到底是真的把某类能力从模型里移除了,还是只让它在输出上不提,用于发布前的行为核查
提示词全文
我要验证一次安全训练的效果:它到底是真的把某类知识或能力从模型里移除了,还是只是让模型在输出上不提。请给出一套可从零搭起来的评测集构建与判定方案,不要泛泛讲对齐理论。
## 输入
被处理的目标:{具体是哪一类内容或能力,例如某类危险操作步骤、某个已下线的事实}
可用的模型版本:{训练前与训练后的对比版本,是否能取到中间检查点}
可用的手段:{是否有内部访问权限,能取激活或概率分布,还是只能看输出}
发布时限:{距离发布还有多久,能承受多大的评测集规模}
## 输出
1)样本来源:给出构造三类样本的具体方法——模型确实知道的(答得出)、已经真的忘记的(答不出且内部也没有信号)、知道但被训练成不说的(答不出但内部仍有信号),并说明每一类怎么保证干净。
2)判定信号:在只有输出权限时用什么间接信号、在有内部权限时用什么更直接的信号,并给出两类信号的组合判定规则。
3)对照设计:如何用训练前后同一批样本做对照,需要固定哪些变量,才能把「能力被移除」与「输出被抑制」分开。
4)评测规模与门槛:给出最小可用样本量与判定阈值建议,以及在时限紧的情况下优先做哪一类样本。
5)结论模板:给出一段结论文字的写法,要求区分「确认移除」「仅抑制输出」「无法判定」三种结果,不允许含糊表述。
6)风险提示:指出最容易把两者混淆的两个场景,以及对应的排除办法。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
输出会把样本分成能答、真遗忘、知道但不说三类,并给出每类「怎么保证干净」的判据;判定信号区分只有输出权限与有内部权限两种情况;对照设计要求固定训练前后同一批样本并列出控制变量;给出最小样本量与优先级建议;结论模板强制区分「确认移除 / 仅抑制输出 / 无法判定」三种结果;风险部分点名最易混淆的两个场景与排除办法。
基本信息
- 分类:分析
- 标签:行为评测 · 可解释性 · 内部信号 · 已遗忘样本 · 发布前核查
- 收录日期:2026-09-22