这个提示词用来做什么
有人拿一份模型或 agent 的跑分来推动选型或立项。会逐条核对统计口径、测试环境与可复现性,判断它够不够格当依据,给出来源与结论即可,可指定这项决策的重要程度。
提示词全文
有人给了我一份模型或 agent 的评测分数,我想判断它能不能作为选型或立项的依据。请你按下面的清单帮我逐条核对,不要复述宣传口径。
## 输入
分数来源:{厂商博客 / 第三方榜单 / 内部测试}
被测对象:{模型或 agent,版本号}
分数内容:{具体数字与它对应的基准}
## 输出
1)口径核对:这个分数测的是哪套任务、判定标准由谁定、允许多少人工干预;把「统一标准环境」与「厂商自定义运行环境」分开标注,凡是没有第三方可复现路径的,一律归为厂商口径。
2)公平性核对:同榜单里其他参与者的分数是否用同一口径得到;如果有参与者用了不同环境,指出差额有多大。
3)可复现性:要复现这个分数,需要什么条件(算力、数据、私有适配器、固定随机种子),其中哪些是外部拿不到的。
4)自测建议:给出一套 3-5 个任务的自测方案,直接用我们自己的数据,写清通过标准与对照基线;优先选「做错了会很明显」的任务,而不是分数好看的。
5)结论:给出「可作为依据 / 只能作为参考 / 不足以作为依据」三选一,并写清理由和还缺什么证据。
请把不确定的地方明确标出来,不要替我补全没写明的假设。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
它会把「同一模型两个分数」这类情况直接摊开:换一套运行环境就能多出几十分,那这个数字反映的是环境而不是能力。第 4 步的自测方案通常才是真正能拍板的东西——用自己的数据跑一遍,比争论榜单可信得多。
基本信息
- 分类:技术选型
- 标签:评测 · 口径 · 可复现 · 基准 · 选型
- 收录日期:2026-10-05