万亿参数模型,竟惨遭 1% 规模的小模型倒挂? ”             

最近大半年,国内一批 AI 模型厂商密集启动“预训练返工”,起因都指向同一件事:数据不行。

它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。

有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。

还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。

与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。

数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。

“AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。

01 数据上的“粗放式弯路”

预训练返工,本质上是在补数据的课。

“多就行了”的误区

一位头部基模公司的数据专家赵翔向雷峰网回忆,前些年刚开始做预训练的时候,大家的主流观点是“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性。”

于是开始一味地粗放式堆数据,只求规模不讲质量。

再加上,当时行业普遍缺乏成熟的大规模数据治理体系,大家为了凑齐数千亿甚至上万亿 token 的语料库,抓取了大量网页垃圾、脏语料,甚至混入了各种来源不明的清洗包。

很多数据的标注和筛选也没有处理好,导致训练出来的第 一版模型效果较差。

然后大家才发现,不注重数据质量,会让模型卡在 60、70 分上不去,“眼看海外的模型都跑到 90 分了,就是追不上。”于是不得不回过头来重做数据优化。

脏数据的代价

“底层脏数据的危害远比想象的大。它会让你投入的卡、钱、人力都浪费掉,而且还会耽误你的时间窗口。”某模型厂商前高管、现 AI 创业者王斌告诉雷峰网。

他向雷峰网描述过一个典型案例。一家中部基模公司,把爬来的技术博客整批灌进预训练语料,跑到训练中期才发现,其中相当部分是采集站的机器生成页,同一个段落被重复了几万次。

模型在评测集上开始莫名其妙地复读,等团队定位到问题,几万卡时已经烧掉了,那一版只能作废重来。

事实上,这样的翻车在行业里远不止一例。不少团队都是训练效果出了问题后,才回过头来补数据治理的课。

不当的数据 KPI

基元律动创始人王云鹤也曾在接受媒体采访时提到过,AI 没有什么新鲜事,数据是地基,数据不行,不要怪算力;数据不达标,什么算法都不行,因为这违背机器学习理论。

而且他还特别提到一点,数据团队要对预训练团队有一定话语权,预训练团队也要反向对数据提要求。独立考核会很乱。

其实,对数据团队的考核不当,是不少模型厂商都踩过的一个坑。

比如,有媒体曾描述过,腾讯混元团队曾在数据治理上,出现过“标注规则定义不清,但验收线设定过高,团队为了交差,生产出大批无法使用的数据”的情况;再加上一些打榜数据、冗余数据的污染,以至于最后不得不推倒重来,专门重拉团队从头清洗数据。

“数据团队的考核只看数据量的话,会很荒谬。”前述数据专家赵翔补充道。

因为大模型拼的是数据的信息密度和干净程度,而非绝 对体积。考核只盯数量,等于在鼓励团队拿垃圾凑数。几百 T 的脏数据灌进去,训出来的模型反而会变笨,甚至训练崩溃。

02 数据背后的“苦活”与“花活”

地基要重打,可好数据并不是说有就有的。

互联网时代攒的家底,不顶用了

本地生活、社交、游戏、电商与搜索,这些在互联网时代被各家大厂视作“壁垒”的场景数据,到了 AI 时代,不奏效了。

因为基模比的是通用能力,某一场景数据的优势,落到通用能力上,影响变得有限。各家虽然都在拿自己的场景数据训一些垂直小模型,但最终应用面没那么广。

“按理说 Google 各类场景数据最多,应该做得最 好,但显然并不是。Anthropic、OpenAI 这类此前在数据上零积累的厂商反而冲得更猛,国内亦然。”一位基模公司的算法负责人徐栋告诉雷峰网。

大家站到了同一起跑线。

这时候,能拉开差距的是:卡够不够,数据拿得快不快,质量够不够高,以及有没有一条能把数据稳定转化成模型能力的管线。

没有秘方,只有苦活

那么,数据优化到底有没有捷径?

前述数据专家赵翔向雷峰网坦言,技巧秘方其实不多。数据工作更偏苦活累活,重要的是持续做下去,投入足够的人力和定力,把原来 60 分的数据,逐步优化到 90 分,争取每次优化之后都能拿到一点正反馈。

这时候要算两本账:一是优化成本,二是训练周期。

“网上那么多数据,不可能每条都校验一遍。训练又有周期,不能等数据全部优化完再开训。所以要先挑重要的做,分期做,小步快跑,不断迭代。”赵翔补充道。

不过,需要说明的是,数据的难题并不只出在预训练。后训练要的专家数据、Agent 长程轨迹数据,获取难度和成本也都不低。

卡住数据优化的:钱与产能

多位 AI 数据从业者告诉雷峰网,眼下卡住各家数据工作的,主要有两个因素:钱和产能。

一个反直觉的地方在于:大厂看起来都不差钱,但预算拆开,分摊到数据上的其实并不多。

“数据在模型厂商的训练预算里占比并不大。业内流传的一个粗略拆解是:每投 100 块钱在 AI 训练上,其中 40 块花在算力上,30 块花在人才上,20 块花在打广告上,剩下 10 块钱花在数据上。”某 AI 数据供应商业务负责人周骏表示。

以专家数据为例,周骏告诉雷峰网,专家的长程任务数据需求量极大,几家大厂的预算口径基本都是几个亿,但真到付款时,就比较抠搜。

“同样的专家数据,美国 HLE 调研一条起价一两万美金,国内基本只给开一两千人民币。”

然而,比预算更卡人的,是产能。

高质量数据从来都是稀缺的。正规渠道供不够,各家就开始自找门路。

周骏告诉雷峰网,某些模型厂商会隐蔽地做中转站生意,做 Token 转发。一方面有收益,但更重要的是,可以借此收集大量用户行为数据。

用户调用各种先进模型时,请求和结果都要从这家厂商的转发层走一遍,于是真实的任务数据就被留在了平台上,这比公开爬来的语料更接近训练想要的有效样本。

眼下还有一批做 Routing(模型路由)的创业公司,也在盯着“数据”这块资产;而各家大厂也有类似的路由平台,但由于优先接自家模型,很难沉淀到其他先进模型的轨迹数据,而且由于模型接入不够全面,平台本身用户量也有限。

“这几年,各家在获取AI数据上可谓八仙过海,但这些门路能让一家公司领 先多久,并不好说。”周骏补充道。

03 飞轮还没转起来

业内有一种声音认为,大模型本身没有护城河,真正的护城河更多在于“数据飞轮”:模型越强,越多用户愿意拿它处理高难度任务,回流的高质量数据就越多,这些数据再喂回去,模型又强出一截。

这套逻辑听上去闭环。但到今天为止,真正把“数据飞轮”转起来的没几家。

除了前面提到的“预算受限”、“外部高质量数据获取难”外,还有一层原因在公司内部。

大厂自己的AI产品每天都在产生用户行为,可这些数据能不能规模化地回到训练环节,取决于中间那条通路有没有修好。

眼下这条通路有三处堵点。

一处是组织调整还在持续进行中,各部门之间数据墙的破除还在艰难推进中;另一处是数据类人才的匮乏。

多位 AI 猎头告诉雷峰网,目前市场上比较缺数据清洗、数据管道搭建、数据工程、数据研究等岗位。这些岗位过去被划在辅助工种里,行情真正起来,也是最近的事。

此外,更重要的是,国内模型厂商还面临内生数据匮乏的问题。

眼下,长程轨迹数据主要出自 AI Coding 和 AI 办公这两个场景:但前者市场份额的一大块被海外模型 Claude、Codex 占去;后者的产品能力目前处于初级阶段,所能覆盖的工作场景与复杂度有限,沉淀下来的轨迹数据还较为单薄。

04 没有捷径的长期战争

回到开头那句话:“AI 下半场的胜负手是数据”。

这话大体没错,但大家可能低估了这场仗的周期和复杂度。

预训练返工只是第 一波阵痛。数据治理、数据获取、数据飞轮,每一块都是硬骨头。算力可以买,人才可以挖,但高质量数据的积累没有捷径,它需要时间、定力和组织层面的系统性投入。

多位业内人士向雷峰网坦言,未来一两年内,行业很可能还会看到更多“推倒重来”的案例。这不是某一家的问题,而是整个行业都在补课。

真正的分野,大概要等到这轮数据基建基本完成后,才能看得更清楚。谁能先把那条从用户行为到模型训练的数据通路修通,谁就有机会在下一阶段跑出来。

但至少从目前看,这条路的终点还远得很。

雷峰网后续将持续推出 AI 数据相关的深度观察。对这一话题感兴趣、或想聊聊业内实况的朋友,欢迎添加下方作者交流、探讨。

* 文中受访者赵翔、王斌、徐栋、周骏均为化名。

最新快讯

2026年09月23日

16:48
我的一大业余爱好是看体育新闻,尤其是欧洲足球和NBA方面的新闻。如果条件允许,我当然也爱看球赛,可惜这些球赛经常安排在深夜或清早,不可能每场都看;再说,就算看了直播,也总想看看相关的新闻评论的。网易、头条、腾讯的体育板块,我经常都刷一刷,反正它们的信息来源大同小异,都是同一批体育媒体和自媒体,就连分发时间也差不多。刷的体育资讯越多,我就越感...
16:48
只要Meta有足够的耐心,总能贡献出一些新鲜事。这不,路透社9月22日的报道揭示,Meta正在内部测试一项名为“真人礼宾”的新功能。原本属于AI范畴的Muse应用,现在允许将部分电话请求转交给真人去处理。虽然目前这仅限于内部测试,尚未对外公开,但消息一出便引发了轩然大波。在巨大的舆论压力下,Meta不得不紧急叫停了该计划。毕竟,这从原本极具未来感的AI软件,...
16:48
最近,一个叫Jev的新模型突然火了。它来自TypeSafe AI。这支有OpenAI背景的团队没有继续卷生成和推理,而是换了个方向:让AI直接做判断。他们甚至把口号直接写成:Decisions, not strings(要决策,不要文本)。Jev的走红,也让“Decision”(决策)重新成为AI圈的热门词。但如果把时间线往前拨几个月,会发...
16:32
《科创板日报》9月23日讯 近日,马斯克接受专访时指出,未来15年全球人形机器人或达到100亿台;未来20年可能达到1000亿台。 在他看来,每个人都能拥有专属机器人,它们可以照料年迈的父母,看护孩童,还能担任孩子的一对一私教,承担各类工作。未来世界,一个人可以操控成百上千台,甚至上万台实体机器人和数字智能体。 这并非马斯克针对人形机器人首次“画饼”:就在本...
16:31
9月23日,A股市场迎来了一场久违的板块狂欢,科学仪器板块在“VNA矢量分析仪”这一新概念的驱动下全线爆发。优利德、普源精电双双录得20%涨停,电科思仪、创远信科涨幅超12%,东方中科、鼎阳科技、坤恒顺维、同惠电子等个股亦纷纷涨超9%。 推动这波行情的并非业绩利好,而是产业供需矛盾与券商研报的“共振”。据机构消息,高频高速矢量网络分析仪(VNA)目前面临供货...
16:31
近期,Meta已成为资本市场瞩目的焦点。随着旗下个人AI智能体Muse的横空出世,市场对于AI的叙事逻辑正在发生深刻转变,而“木头姐”凯茜·伍德也用真金白银投出了信任票。 在Meta股价飙升至阶段新高的节点,ARK果断出手。据方舟投资(ARK Invest)周一披露的交易记录显示,其旗下ARKK、ARKW及ARKF三只基金合计买入Meta股票51477股,交...
16:31
纳斯达克指数再次刷新历史高点。周二收盘报27244.28点,连续第二天创下收盘纪录。与此同时,布伦特原油和WTI原油已连续五个交易日下跌,虽然10年期美债收益率有所回落,但仍维持在4.959%附近。尽管宏观环境依然存在约束,但美股科技股依然强势。纳斯达克100指数连续四个交易日跑赢非AI板块,高盛将此轮行情定义为“FOMO(害怕踏空)行情”。(本文内容仅为客...
16:13
9月22日,浦东创投AI训练营(第二期)公开日暨结营仪式在张江人工智能创新小镇举行。20余个优质极早期AI项目顺利结营并全部获投,与浦东创投完成投资签约。这是浦东创投立足浦东新区原始创新策源使命,破解硬科技创业“最初一公里”难题的一次生动实践。本次活动由浦东创投主办,上海科创金融研究院承办,陆家嘴集团、上海天使会、农业银行浦东分行、浦东新区...
15:46
据鼓狮财经9月23日报道,摩根士丹利发布研报指出,阿里巴巴在2026云栖大会上释放的战略重点备受关注。该行预测,到2032年全球云端产能将突破20吉瓦,从而为约2400亿美元的云端收入奠定坚实基础。此外,通义千问的快速变现能力以及平头哥渗透率的提升,预计将有力推动产能扩张并提振利润率。基于此,摩根士丹利维持阿里巴巴美股“增持”评级,目标价设定为180美元,并...
15:46
鼓狮财经9月23日讯,当地时间周二披露的文件显示,特朗普名下账户在7月份完成了1156笔证券交易,交易总规模在7900万至2.7亿美元之间,买入额不低于4360万美元,卖出额不低于3560万美元,其投资组合迎来了大规模的调整。 7月20日,特朗普卖出了微软和亚马逊股票,金额分别为500万至2500万美元,这是当月最大的单笔交易。同日,他还卖出了100万至50...