训练模型这件事,卡点正在从「算法」往两头挪:一头是算力,另一头是数据。

公开可爬的互联网文本这几年基本被各家扫过一遍了,于是出现了一个新的中间层——专门做数据整理和供给的角色。海外市场上,这条线已经跑出了一些稳定的规矩,值得记下来。

为什么数据突然变得紧缺

一句话:能用的公开数据快用完了。

早期训练一个大模型,靠抓取公开网页就够。现在的问题不是「有没有数据」,而是:

  • **高质量的中文语料稀缺**。公开语料里噪声多,而模型对语料的信噪比极其敏感
  • **垂直领域的数据是孤岛**。医疗、法律、金融的专业文本大多躺在内部系统里,不在公开网上
  • **多模态需要配对数据**。图文对、视频配字幕这类成对样本,比纯文本难获得得多
  • **人工反馈需要专人参与**。模型对齐阶段要的是经过审核的判断数据,这活没法纯爬

需求在,供给跟不上,中间就有了生意。

规矩一:授权链要干净

这是最容易踩、后果也最严重的一条。

数据的来源必须能追溯:这份文本是谁的、以什么方式取得的、允许用来做什么。只要其中一环说不清,后面做得再好也是白搭。

实际的做法有两个方向。一个是使用明确授权的数据——公开许可的开源代码、有明确授权的行业文档、自己生产的内容。另一个是用合成数据补量:让现有模型改写、扩写、生成问答对,人工再筛一遍。

第二条近几年比重越来越高,因为它绕开了授权问题。但它有个前提:合成数据不能自己循环自己,拿模型的输出反复训练模型,质量会逐代退化。

规矩二:脱敏不是可选项

只要数据里可能出现个人信息,脱敏就是必须做的事,不是加分项。

具体包括:姓名、电话、地址、账号、证件号、地理位置这类可以直接识别到个人的字段,以及能通过组合间接识别到个人的信息。

这件事的难点不在技术,在流程的完整性。清洗管线跑完一遍,必须有人抽查样本,确认该去掉的确实去掉了。我见过的问题几乎都不是「不知道要去」,而是「以为已经去干净了」。

规矩三:质量比规模更值钱

这是这条线上最反直觉的一条。

过去比的是谁的数据多,现在比的是谁的信噪比高。同样一个 G 的文本,清洗得干净的,对模型训练的价值可能高出好几倍。

衡量质量通常看这几个维度:

  • **去重程度**。重复内容会让模型在少数样本上过拟合
  • **格式规范**。统一的字段结构,下游能直接用
  • **领域纯度**。一个垂直数据集里混进大量通用文本,价值会被稀释
  • **可追溯**。每条数据能追到来源,出问题能回溯

所以这条线上真正值钱的能力,其实是清洗和标注,而不是采集。采集谁都会做,把脏数据变成能直接喂给模型的数据,才是门槛。

摆在面前的几个风险

  • **来源不明的数据**。价格低得离谱的语料包,来源往往有问题
  • **批量抓取的边界**。抓公开页面和绕过限制抓取,性质完全不同
  • **个人信息残留**。尤其是来自论坛、评论区的文本
  • **授权范围被扩大解释**。允许「研究使用」不等于允许「商用」

这四条里,任何一条出问题,代价都可能远超数据本身的成本。

说点实在的

数据这条线,看起来是技术活,实际上更接近流程活:能不能把来源说清楚、能不能把脏东西洗干净、能不能把责任留痕。

如果要从这个方向切入,我的建议是选一个足够窄的垂直领域,把清洗管线做扎实,先交付一个小而干净的数据集,而不是一上来就追求规模。

本文不构成任何经营建议,涉及数据合规请咨询专业人士。