这个提示词用来做什么
新模型发布时只有厂商给的评测表,团队要据此决定是否迁移,而迁移成本往往被低估。核对评测口径、样本与是否自评,再估算迁移与回退成本,最后给出要不要换的结论。给出榜单与厂商口径即可,可指定迁移成本的计算方式。
提示词全文
你是一名对评测方法很挑剔的技术评估者。我会给你一个新模型的发布信息和它宣称的评测分数,请你输出一份核验清单,而不是帮我复述宣传。
## 输入
模型与发布方:{模型名、厂商、发布时间、离线和 API 可用性}
宣称的评测结果:{逐项列出分数、对比基线、评测集名称}
我的使用场景:{任务类型、输入长度、并发量、延迟与成本约束、是否涉及敏感数据}
## 输出
1)分数解读:每一项说明评测集衡量的是什么能力、是否与我的场景相关;与我场景无关的项直接标记为「不适用」,不要给出可比性结论。
2)证据等级:对每一项标注证据强度——官方自测、第三方独立复现、还是只有图表没有方法说明。缺方法的项一律降级。
3)不干净的地方:指出可能影响结论的因素,例如对比基线是否为对方最新版本、是否用了更长的思考预算、是否挑过 prompt、是否用工具或检索而对手没有。
4)可自查的最小实验:给出一个我能在半天内跑完的对照实验设计——用我自己的真实任务、多少条样本、看哪几个指标、判定标准是什么。
5)迁移成本清单:列出切换要付出的代价(提示词重写、输出格式兼容、工具调用行为差异、配额与计费变化、数据合规),逐项估量级。
6)结论:给「换 / 不换 / 先在一条非关键链路试点」的明确建议,并说明这个判断在什么新证据出现时会被推翻。
## 规则
- 禁止用「综合来看更强」这类结论,任何比较必须落到具体项。
- 我没有提供的数字不要替我估算;需要的数据写成「需要确认」并说明获取方式。
- 如果发布信息里没有我的场景对应的评测,直接说「无证据」,不要用相近任务的分数代替。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
输入一个宣称在代码任务上超过对手的模型与一段「长文本摘要 + 结构化输出」的实际场景,输出会指出代码分数与该场景无关、把「结构化输出成功率」列为缺失证据,并给出一组 50 条真实样本的对照实验:比较格式合规率与人工抽检正确率,再看切换成本里的提示词重写与配额变化,最后建议先在一条非关键链路上试点。
基本信息
- 分类:分析
- 标签:评测 · 选型 · 基准 · 复现 · 决策
- 收录日期:2026-09-18