据雷峰网9月24日报道,最近大半年,国内一批AI模型厂商密集启动预训练返工,多位受访者将原因指向同一处:训练数据质量不足。有厂商此前花一年时间死磕万亿参数模型,落地表现却被规模仅其1%的小模型倒挂,排查后发现问题出在脏数据上。
雷峰网采访的数据专家赵翔(化名)回忆,预训练早期行业的主流观点是“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性”,于是粗放式堆数据,抓取大量网页垃圾和脏语料,甚至混入来源不明的清洗包,标注与筛选也未处理好,训练出的第一版模型效果较差,卡在60、70分。某模型厂商前高管、现AI创业者王斌(化名)对雷峰网称,底层脏数据的危害远比想象中大,会让投入的卡、钱、人力都浪费掉,还会耽误时间窗口。
王斌向雷峰网描述过一个案例:一家中部基模公司把爬来的技术博客整批灌进预训练语料,跑到训练中期才发现其中相当部分是采集站的机器生成页,同一个段落被重复了几万次,模型在评测集上开始莫名其妙地复读,等团队定位到问题,几万卡时已经烧掉,那一版只能作废重来。
对数据团队的考核不当,是不少厂商踩过的另一个坑。基元律动创始人王云鹤在接受媒体采访时提到,数据是地基,数据不达标什么算法都不行;数据团队要对预训练团队有一定话语权,独立考核会很乱。雷峰网在报道中称,有媒体曾描述腾讯混元团队出现标注规则定义不清、验收线设定过高,团队为交差生产出大批无法使用的数据,加上打榜数据、冗余数据污染,最后不得不推倒重来,重拉团队从头清洗数据。赵翔称,数据团队考核只看数据量会很荒谬,几百T脏数据灌进去,模型反而会变笨,甚至训练崩溃。
互联网时代攒下的场景数据在AI时代作用有限。一位基模公司的算法负责人徐栋(化名)对雷峰网表示,Google各类场景数据最多,但做得最好的显然并不是它,Anthropic、OpenAI这类此前在数据上零积累的厂商反而冲得更猛,国内亦然。在他看来,各家已站到同一起跑线,能拉开差距的是卡够不够、数据拿得快不快、质量够不够高,以及有没有一条把数据稳定转化成模型能力的管线。
赵翔对雷峰网坦言,数据优化的技巧秘方不多,更偏苦活累活,重要的是持续投入人力和定力,把原来60分的数据逐步优化到90分,每次优化争取拿到一点正反馈。他还提到要算两本账,一是优化成本,二是训练周期,网上数据不可能每条都校验,训练又有周期,不能等数据全部优化完再开训,要先挑重要的做、分期做、小步快跑。数据的难题并不只出在预训练,后训练要的专家数据、Agent长程轨迹数据,获取难度和成本也都不低。
多位AI数据从业者告诉雷峰网,眼下卡住各家数据工作的是钱和产能。某AI数据供应商业务负责人周骏(化名)称,业内流传的粗略拆解是:每投100块钱在AI训练上,40块花在算力上,30块花在人才上,20块花在打广告上,剩下10块钱花在数据上。以专家数据为例,几家大厂的预算口径基本都是几个亿,但真到付款时比较抠搜,同样的专家数据,美国HLE调研一条起价一两万美金,国内基本只给开一两千人民币。
产能方面,高质量数据本就稀缺,正规渠道供不够,各家开始自找门路。周骏告诉雷峰网,某些模型厂商会隐蔽地做中转站生意、做Token转发,一方面有收益,更重要的是借此收集大量用户行为数据,用户调用先进模型时,请求和结果都要从转发层走一遍,真实任务数据就留在了平台上。眼下还有一批做模型路由的创业公司盯着这块资产,各家大厂也有类似路由平台,但优先接自家模型,很难沉淀其他先进模型的轨迹数据,平台用户量也有限。周骏说,这些门路能让一家公司领先多久,并不好说。
业内有人认为大模型的护城河在于“数据飞轮”:模型越强,越多用户拿它处理高难度任务,回流的高质量数据越多,模型再强出一截。但据雷峰网报道,真正把飞轮转起来的没几家。除预算受限、外部高质量数据获取难,公司内部也有堵点:组织调整仍在持续,部门之间数据墙的破除还在艰难推进;数据清洗、数据管道搭建、数据工程、数据研究等岗位人才匮乏,这些岗位过去被划在辅助工种里,行情真正起来是最近的事。长程轨迹数据主要出自AI Coding和AI办公两个场景,前者市场份额的一大块被海外模型Claude、Codex占去,后者的产品能力目前处于初级阶段,能覆盖的工作场景与复杂度有限,沉淀下来的轨迹数据较为单薄。
多位业内人士对雷峰网称,未来一两年内,行业很可能还会看到更多推倒重来的案例,这不是某一家的问题,而是整个行业都在补课。真正的分野,大概要等到这轮数据基建基本完成后才能看得更清楚。