训练模型这件事,卡点正在从「算法」往两头挪:一头是算力,另一头是数据。
公开可爬的互联网文本这几年基本被各家扫过一遍了,于是出现了一个新的中间层——专门做数据整理和供给的角色。海外市场上,这条线已经跑出了一些稳定的规矩,值得记下来。
为什么数据突然变得紧缺
一句话:能用的公开数据快用完了。
早期训练一个大模型,靠抓取公开网页就够。现在的问题不是「有没有数据」,而是:
- **高质量的中文语料稀缺**。公开语料里噪声多,而模型对语料的信噪比极其敏感
- **垂直领域的数据是孤岛**。医疗、法律、金融的专业文本大多躺在内部系统里,不在公开网上
- **多模态需要配对数据**。图文对、视频配字幕这类成对样本,比纯文本难获得得多
- **人工反馈需要专人参与**。模型对齐阶段要的是经过审核的判断数据,这活没法纯爬
需求在,供给跟不上,中间就有了生意。
规矩一:授权链要干净
这是最容易踩、后果也最严重的一条。
数据的来源必须能追溯:这份文本是谁的、以什么方式取得的、允许用来做什么。只要其中一环说不清,后面做得再好也是白搭。
实际的做法有两个方向。一个是使用明确授权的数据——公开许可的开源代码、有明确授权的行业文档、自己生产的内容。另一个是用合成数据补量:让现有模型改写、扩写、生成问答对,人工再筛一遍。
第二条近几年比重越来越高,因为它绕开了授权问题。但它有个前提:合成数据不能自己循环自己,拿模型的输出反复训练模型,质量会逐代退化。
规矩二:脱敏不是可选项
只要数据里可能出现个人信息,脱敏就是必须做的事,不是加分项。
具体包括:姓名、电话、地址、账号、证件号、地理位置这类可以直接识别到个人的字段,以及能通过组合间接识别到个人的信息。
这件事的难点不在技术,在流程的完整性。清洗管线跑完一遍,必须有人抽查样本,确认该去掉的确实去掉了。我见过的问题几乎都不是「不知道要去」,而是「以为已经去干净了」。
规矩三:质量比规模更值钱
这是这条线上最反直觉的一条。
过去比的是谁的数据多,现在比的是谁的信噪比高。同样一个 G 的文本,清洗得干净的,对模型训练的价值可能高出好几倍。
衡量质量通常看这几个维度:
- **去重程度**。重复内容会让模型在少数样本上过拟合
- **格式规范**。统一的字段结构,下游能直接用
- **领域纯度**。一个垂直数据集里混进大量通用文本,价值会被稀释
- **可追溯**。每条数据能追到来源,出问题能回溯
所以这条线上真正值钱的能力,其实是清洗和标注,而不是采集。采集谁都会做,把脏数据变成能直接喂给模型的数据,才是门槛。
摆在面前的几个风险
- **来源不明的数据**。价格低得离谱的语料包,来源往往有问题
- **批量抓取的边界**。抓公开页面和绕过限制抓取,性质完全不同
- **个人信息残留**。尤其是来自论坛、评论区的文本
- **授权范围被扩大解释**。允许「研究使用」不等于允许「商用」
这四条里,任何一条出问题,代价都可能远超数据本身的成本。
说点实在的
数据这条线,看起来是技术活,实际上更接近流程活:能不能把来源说清楚、能不能把脏东西洗干净、能不能把责任留痕。
如果要从这个方向切入,我的建议是选一个足够窄的垂直领域,把清洗管线做扎实,先交付一个小而干净的数据集,而不是一上来就追求规模。
本文不构成任何经营建议,涉及数据合规请咨询专业人士。