这个提示词用来做什么

两个模型都在官方页面公布了一堆评测分数,需要判断该不该为自家业务换模型。筛出与自己业务相关的评测项,按真实负载加权,并算出换模型的盈亏平衡点。给出评测表与业务负载即可,可指定对成本的敏感度。

提示词全文

我在两个模型之间选一个,两边都公布了很多跑分。请帮我把它变成「在我的场景里该不该换」的结论,不要直接比较官方数字。

## 输入
官方数据:{两边公布的评测项与分数,注明是官方自测还是第三方复测}
我的场景:{任务类型、输入输出长度分布、对延迟与成本的要求}
我的评测集:{现有样本量、有没有参考答案、能不能自动打分}
迁移成本:{要改的调用方式、提示词、函数调用定义等}

## 输出
1)可比性筛查:逐条判断官方分数能不能横向比(评测版本是否一致、是否开工具、是否取多次采样最优、是否只报高分档位),不能比的直接剔除并写明原因。
2)自建对照:给出用我的评测集做对照的实验设计——样本量、打分方式、如何控制输入分布与温度、如何避免因为我知道答案而带进偏向。
3)分场景结论:按我的主要任务分别给出「换 / 不换 / 平手」,并写明每个判断依赖的关键指标。
4)盈亏平衡:把迁移成本折算成时间或人力,算出需要多大收益才能回本(例如单价降幅、单任务耗时下降多少)。
5)决策建议:给出最终建议与触发条件(例如「除非编程任务通过率提升超过 X 个百分点,否则不换」),并指出这个结论最容易被哪类样本推翻。

怎么用

  1. 把上面的提示词全文复制到对话窗口或工作流里。
  2. 把花括号占位符(如 {任务描述})替换成你自己的内容。
  3. 条目越具体,产出越稳定;不需要的条目可以直接删掉。

输出示例

输出先逐条筛查官方分数的可比性并剔除不可比项;给出用自有评测集做对照的实验设计,含样本量、打分方式与温度、输入分布的控制办法;按主要任务分别给出换 / 不换 / 平手的判断及其依赖指标;把迁移成本折算成回本所需的收益门槛;给出带触发条件的最终建议,并点名最容易推翻结论的那类样本。

基本信息

  • 分类:分析
  • 标签:评测分数 · 可比性 · 换模型 · 对照实验 · 盈亏平衡
  • 收录日期:2026-09-23

同类提示词