这个提示词用来做什么
流程里有一个环节只需要一个是/否或一个分数,现在却让大模型写一段话再解析 JSON,慢、贵、还不稳
提示词全文
我想把一个「判断类」环节从让模型写答案,改成让模型直接输出概率或选项,并按阈值做决定。请帮我把它设计成一份可验收的方案。
## 输入
这个环节在做什么判断:{一句话说清,例如「把工单分派给哪个团队」}
可选选项(如果是分类):{逐个列出,并给出每个选项的判定边界}
现在的做法:{模型、提示词、输出格式、后端怎么解析}
真实数据与标签:{有多少条带正确答案的样本;能不能抽一批做人工标注}
失误代价:{判错一次会发生什么,两种错误哪个更不能接受}
## 输出
1)任务定义:把这个判断写成模型能接受的输入与输出(包括选项的定义与边界例)。
2)指标:写出至少三个可测量的指标——准确率、定标(置信度与真实正确率是否对得上)、拒答率。
3)阈值方案:给出两到三个候选阈值,并说清每个阈值下「错放」与「漏放」各自会变多少;不要只给一个“最优”阈值。
4)验收方案:设计一个一天内能跑完的对照实验,说清样本量、分层(按失败风险分层)、以及什么结果算通过。
5)回退设计:当置信度落在中间区域时该怎么办(人工复核 / 降级处理 / 拒答),以及这部分量会有多大。
6)风险清单:列出这次改动最可能出的三个错(例如分布漂移、边界样本被吞、阈值过拟合),并给出监控方法。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
典型输出会先把「准确率」和「定标误差」分开——因为一个模型可能准确率很高但自信度虚高,一旦拿它做门禁就会把不该放行的放行;阈值部分会给出一条“错放/漏放”此消彼长的曲线而不是单点;验收方案会要求把“边界样本”单独抽出来看,因为总体准确率会把这部分失败淡化。
基本信息
- 分类:工程
- 标签:概率输出 · 阈值 · 评测 · 决策模型 · Agent
- 收录日期:2026-10-03
同类提示词
- 故障复盘(Postmortem):时间线、根因与行动项
- 代码评审:先对齐意图,再挑毛病
- 上线前变更自查:兼容性、回滚与可观测性过一遍
- 提示词回归测试:用 12 个边界用例验证改动没有把别处改坏
- AI 编程会话归档:导出、脱敏、编目三件事一次做完
- 智能体资产盘点:把扫描/清单变成权限最小化清单
- 给端侧场景做一张模型选型约束表,而不是对着排行榜挑
- 让智能体写「交接单」而不是「总结」:给下一个会话一份可审计的上下文
- 算力集群采购前的技术尽调:把峰值与利用率指标问成可复现的口径
- 把一次线上事故录制成能进 CI 的回归用例(Agent 录制与选择性回放)
- 把智能体里其实只是 if-then 的调用挑出来,换成窄判定器
- 模型安全评测前的环境体检:让测试沙箱真的离线