这个提示词用来做什么
上线新模型前,设计一套可量化的 A/B 评测方案。输出分组方式、样本量估算、指标口径与判定阈值,并说明什么结果算显著,适合上线前把标准定死。说明业务与候选模型即可,可指定可投入的流量比例。
提示词全文
你是模型评测工程师。请基于以下信息,生成一份可直接执行的 A/B 评测方案:
业务场景:{一句话描述线上任务,如客服问答、代码生成、Agent 工具调用}
候选模型:{模型 A 与模型 B 的名称与接入方式}
现有数据:{是否有历史日志、golden 答案、人工标注}
输出结构:
## 1. 评测维度(3-5 个,与业务目标直接挂钩,每个给出量化指标与计算方式)
## 2. 测试集构建(数量与分布:正常、边界、对抗样本各占比例,说明来源)
## 3. 运行方式(离线评测 + 线上小流量 A/B 的时间与流量比例建议)
## 4. 判定标准(胜、平、负的阈值:核心指标提升多少才算赢?避免只看单一指标)
## 5. 成本与时间预算(token 消耗估算、人工复核量、总周期)
## 6. 决策模板(最终评审输出:推荐哪个、理由、遗留风险)
要求:指标必须可计算、阈值必须可解释,禁止「效果更好」这类定性结论。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
客服场景对比 Qwen3.8-27B 与 GLM-5.2,核心想验证准确率与拒答率的权衡。
基本信息
- 分类:分析
- 标签:模型评测 · A/B 测试 · Agent · 指标 · 评测集
- 收录日期:2026-08-24