这个提示词用来做什么
你拿到一批采集或合成数据准备用于训练或微调,但不确定它干不干净、会不会把评测集混进去
提示词全文
我准备把一批新数据用于训练或微调,请在开跑之前帮我做一次质检,并输出一份可执行的清单。
## 输入
数据来源与规模:{采集还是合成、多少条、什么格式}
用途:{预训练 / 微调 / 评测,目标是什么能力}
已有评测集:{是否包含本次会用到的评测数据,是哪些}
## 输出
1)污染检查:说明怎么确认这批数据里没有混入评测集或它的问题答案(用哪些字段、做哪种匹配、阈值定多少),并列出最容易漏掉的情形(同义改写、翻译版本、题目里的解析文本)。
2)去重方案:给出跨批与批内去重的口径(完全重复、近似重复怎么判),以及去重后应保留哪一条的规则。
3)质量体检项:列一组能自动跑的检查——空值、超长、编码异常、语言混杂、模板化比例过高、答案与问题不匹配等,每项写清判定条件与阈值。
4)退化风险:指出这批数据可能让模型学到的「捷径」(例如只照抄格式、只复述问题、靠关键词命中),以及能在训练前就看出来的信号。
5)放行判断:给出「可直接用 / 清洗后再用 / 不建议用」的结论与理由,并列出必须先修掉的问题。
每项检查都要给出「怎么算通过」,不要写「人工抽查」当作方案;数据不足时明确说缺什么。
怎么用
- 把上面的提示词全文复制到对话窗口或工作流里。
- 把花括号占位符(如 {任务描述})替换成你自己的内容。
- 条目越具体,产出越稳定;不需要的条目可以直接删掉。
输出示例
第 1 步里的「解析文本」最常被漏——题目正文没混进来,但答案里的解题过程把答案抄了一遍,等于提前泄题。第 4 步的捷径信号建议做成固定报表,每次换数据都跑一遍,比事后发现模型变笨便宜得多。
基本信息
- 分类:分析
- 标签:数据质量 · 去污染 · 去重 · 训练数据 · 清单
- 收录日期:2026-10-08