“一个正常的训练管线,应该把蒸馏作为一种冷启动,让模型快速走到90分,然后再去解决剩下的那10分。”谈及蒸馏在当前LLM(大语言模型)训练中的作用,一位基模研究员这样说道。他所说的“冷启动”,是指让能力较弱的模型先学习更强模型已经跑通的答案和任务轨迹,从而尽快获得一个可继续训练的基础版本。对模型公司而言,“不蒸馏”意味着要放弃这段加速过程,从基础能力开始自行探索。虽然这样做的好处是可以拥有一套更独立的训练体系,但也需要付出更长的模型迭代时间。

《智能涌现》此前曾报道,字节跳动Seed成立之初便定下“不做蒸馏”的原则。一位字节人士解释,团队希望进入全球第一梯队,而这“通过蒸馏难以达到”。张一鸣在7月底一次Seed内部会议上也明确表示,即使暂时落后于国内同行,字节也不会把蒸馏当作提升模型能力的捷径。这一番关于“不蒸馏”的表态,不只是一个训练方法上的技术判断,而是对长期路线的选择。

另一方面,在张一鸣表态“不蒸馏”的前一周,英伟达CEO黄仁勋在接受采访时曾表达过完全相反的观点:“蒸馏,也就是向AI学习、向其他知识来源学习,是智能的基础。”在这场采访结束几天后,黄仁勋转发了一封由英伟达、Meta、微软和戴尔等公司支持的开放模型联名信。信中主张建立能够进入各行各业的开放模型生态,并将蒸馏列为模型改进、测试和验证中广泛使用的方法。

到底该不该蒸馏?不蒸馏的代价和回报分别是什么?《智能涌现》跟多位大模型研究员交流了相关问题。

**01、不蒸馏,要付出多少时间**

“数据不够、算力不够,也缺少相关的管线。”有研究员这样概括国内基模团队与海外头部厂商的对比情况。在他看来,国内预训练与北美前沿虽有差距,但已不像早期那样悬殊,而更大的差距发生在后训练和高质量数据层面。蒸馏技术,正是能够帮助基座厂商快速补齐上述“短板”的有效手段,进而压缩模型的迭代时间周期。

选择不蒸馏的字节,不需要面对这些问题吗?实际上并不是。7月底,字节的最新一代基模Seed-2.1 Pro在Code Arena WebDev总榜列第16,落后于Kimi K3和GLM-5.2。而在交流中,多位研究员都认为,“完全不蒸馏肯定会慢很多,短期内不借助蒸馏把Coding和Agentic能力做到行业前列,似乎并不现实。”

模型能力提升的时间压力来自数据飞轮。模型先达到可用水平,才会进入真实开发环境。能力带来使用,使用产生回流数据,回流数据又进入下一轮训练。此前,一名字节人士曾告诉《智能涌现》,其Coding模型此前难以突破的原因之一,正是业务使用意愿不足、缺少足够的数据回流。“如果冷启动第一步都做不了,后面的管线就转不起来。”一位受访研究员说。

他用“马太效应”形容这一过程:用户更倾向于选择能力最强的模型,更多使用又会带来更多真实任务和回流数据,进一步拉开模型之间的迭代差距。Agent任务进一步放大了这种时间差。当前Agent场景中,多轮工具调用需要模型连续规划、执行和纠错,前序步骤一旦偏离,错误可能沿着任务链不断累积。模型从头探索一条成功轨迹,通常比直接学习已经跑通的过程更慢。

但“不蒸馏”带来的压力,在所有能力线上并不相同。与Seed在LLM领域未能进入国内前列不同,字节在视频生成领域已经进入全球前沿。多位行业人士都将Seedance的成功概括为“一场数据的胜利”。一位接近字节的人士向《智能涌现》表示,Seedance的视频训练链路不使用外部模型蒸馏,连用于数据筛选、理解等环节的VLM,也不以其他模型的输出作为蒸馏来源。视频生成与语言模型不同:AI生成视频仍较容易呈现可辨认的“AI感”,外部模型产出的内容很难直接替代高质量真实视频数据,蒸馏带来的增益也相对有限。

在视频生成赛道,字节凭借数据、架构和产品积累,已经在不借助外部模型蒸馏的情况下进入前沿;在Coding和Agent赛道,它仍需尽快补齐能力差距,获得更多真实使用和回流数据。同一条“不蒸馏”原则,在不同能力线上要付出的时间成本并不相同。在LLM领域,当其他大模型公司借助蒸馏完成冷启动、提前进入真实场景时,坚持不蒸馏的字节要用更长的训练周期,验证这套自建数据体系能否转化为领先能力。这也解释了为什么字节要在近期成立一级部门“AI数据与安全”,为旗下大模型提供寻源采购、合成清洗和质量评测等服务——在模型和产品之外,字节必须把数据能力作为独立的组织支柱,以支撑自己的训练体系。

**02、蒸馏的回报和代价**

现代知识蒸馏的经典范式,可以追溯到图灵奖得主、深度学习先驱辛顿等人在2015年发表的《神经网络中的知识蒸馏》。论文提出,让较小的“学生模型”学习大型“教师模型”的输出分布,从而以更低成本承接其能力。例如,2019年发布的DistilBERT将BERT缩小40%,保留97%的语言理解能力,并把推理速度提高60%。当时,蒸馏主要解决模型太大、部署太贵的问题。

生成式AI兴起后,更强模型生成的答案、解释和任务轨迹,也开始被直接用于训练其他模型。2023年3月,斯坦福团队用OpenAI模型生成5.2万条指令数据,以不到500美元的数据成本训练Alpaca;同年,微软让130亿参数的Orca学习GPT-4给出的解释轨迹,在Big-Bench Hard复杂零样本推理上达到与ChatGPT相当的水平。严格来说,利用“教师”模型生成数据再做监督微调,并不等同于传统知识蒸馏。但在大模型行业的语境中,这类“用强模型输出训练另一个模型”的路线也被纳入广义蒸馏。

2024年发布Llama 3.1 405B时,Meta CEO扎克伯格就已将蒸馏小模型列为开放旗舰模型的重要用途;Meta同期还把合成数据生成写进了该模型的主要工作流。到2026年,蒸馏已经成熟应用在模型能力合并上。DeepSeek V4技术报告披露,团队先以监督微调和强化学习分别训练十多个数学、Coding和Agent等领域专家,再让通用模型在自己采样的轨迹上,学习各个专家的输出分布,以多教师在线策略蒸馏合并能力。Kimi K3也把蒸馏放进后训练主流程。其技术报告显示,团队围绕通用推理、Coding和Agent任务,以及low、high、max三档思考强度,形成9个教师模型,再通过多教师在线策略蒸馏整合到同一个模型中。

“归根结底,蒸馏是一种构造数据的方法。”一位研究员这样概括它的回报:与从零搭建合成数据管线、反复试错,或者为复杂任务组织专家标注相比,让更强模型生成答案和操作轨迹,通常能更快把模型送到可用的起点。这种回报在Agent训练中尤其直接。上周,韩国科学技术院研究团队提交的一项研究显示,从GPT-5-mini的成功轨迹中提取任务流程、子任务示例和工具调用经验,在三项工具使用基准中均提升了4B至8B模型的任务准确率。

蒸馏也可以把更昂贵的强化学习留给难题。“稍微简单一点的问题,直接蒸馏就好了,没必要再让模型用强化学习探索,会浪费很多资源。”一位研究员说。苹果研究团队2025年发表的“蒸馏缩放定律”则给这笔成本算了一笔账:当教师模型已经存在,或需要反复训练多个学生模型时,蒸馏通常更省算力;如果只训练一个学生,还要为此从头训练教师,直接训练往往更划算。

蒸馏节省了寻找答案的时间,却不能替模型公司决定应该解决什么问题。“蒸馏说白了并不复杂,一道题让更强的模型跑一遍,再把轨迹拿出来改成训练格式。”一位研究员说,相比之下,“难度反而落在造题上”:题目可以来自网络抓取、专家提供,也可以由团队自行构造。蒸馏的回报是时间和算力,但这种效率也有代价。

不少研究员向《智能涌现》表示,蒸馏通常用于把模型尽快推过可用门槛;等多家模型来到相近起点,继续提升未必还要依赖蒸馏。“到了边际收益递减的时候,大家就会慢慢把这个东西换掉。”“但真正有能力把蒸馏、强化学习和正向研发同时推进的团队不是特别多。”上述研究员坦言。此外,蒸馏也会改变一家公司的资源分配。有研究员提到,蒸馏能让模型短期拿到一个“还可以的成绩”,但见效太快,也可能让团队“比较贪恋这种方式”。如果要进入最顶尖的竞争,“光蒸馏是不够的,还是要回到算法和正向研发上去做突破”。

几周前,在Kimi K3发布后,劳德研究所研究者、Snorkel AI联合创始人布雷登·汉考克表示,仅靠蒸馏,不可能在如此短的时间里训练出这种强度的模型。艾伦人工智能研究所研究员内森·兰伯特也指出,如果蒸馏足以复制前沿能力,其他团队本应很容易追上GLM或Kimi,但现实并非如此。

有研究员选择把答案留给接下来的模型迭代。在他看来,不蒸馏路线最大的阻碍,在于能否承受一段时间内没有“拿得出手的产出”。围绕蒸馏,这场长期主义和时间成本的博弈还在继续,在资源和团队技术路线的比拼之外,也考验着行业等待结果的耐心。

最新快讯

2026年08月13日

19:35
鼓狮财经8月13日电,航锦科技(000818.SZ)发布2026年半年度报告,实现营业收入14.47亿元,同比下降34.68%;归属于上市公司股东的净利润4986.3万元,同比增长263.32%。公司计划半年度不派发现金红利,不送红股,不以公积金转增股本。小财注:公司Q2净利润0.34亿,Q1净利润0.16亿,据此计算,Q2净利润环比增长108%。
19:35
鼓狮财经8月13日电,建元信托(600816.SH)公告称,公司发布2026年半年度报告,实现营业总收入1.12亿元,同比下降25.45%;归属于上市公司股东的净利润10.71亿元,同比增长2559.08%。业绩增长主要系公司对参股上海农商银行会计核算方法转换为长期股权投资并采用权益法核算所致,考虑所得税影响因素后对净利润影响金额约为9.86亿元。小财注:公...
19:35
鼓狮财经8月13日电,京投发展(600683.SH)发布异动公告,此前披露,公司正在筹划通过现金方式收购西安奇芯光电科技有限公司股权。该资产收购事项尚处于筹划阶段,能否达成仍需进一步论证和沟通协商,尚需履行必要的内外部相关决策、审批程序。公司拟收购的标的公司2025年度净利润为-6,110.46万元(未经审计),2026年第一季度净利润为-2,179.40万...
19:35
鼓狮财经8月13日电,昀冢科技(688260.SH)公告称,公司发布2026年半年度报告,实现营业收入3.78亿元,同比增长53.68%;归属于上市公司股东的净利润为亏损9126.49万元。小财注:公司Q2净利润亏损0.38亿,Q1净利润-0.53亿,据此计算,Q2净利润环比持续亏损。
19:35
鼓狮财经8月13日电,亚虹医药(688176.SH)公告称,公司控股子公司Baylink Biosciences Inc收到美国FDA关于同意开展公司自主研发的APL-2501(化合物名称BLB101)用于治疗晚期实体瘤临床试验的函告。APL-2501是公司自主研发的搭载专有亲水性连接子、基于拓扑异构酶抑制剂的抗CLDN6/9抗体药物偶联物(ADC),可用于...
19:35
鼓狮财经8月13日电,融捷健康(300247.SZ)公告称,根据美国最高法院裁定,美国政府相关关税措施自始无效,美国海关与边境保护局于2026年4月20日正式启动退税工作。公司下属控股子公司GoldenDesignsINC.(N.A.)近期陆续收到美国关税退回款项,累计收到725.2万美元(其中退税款697.87万美元,利息27.33万美元)。上述退回款项拟...
19:35
鼓狮财经8月13日电,捷豹路虎发布2026/27财年第一季度(2026年4月至6月)业绩表现:公司本财季营收达60亿英镑,税前利润为1.09亿英镑,调整后息税前利润率为2.8%。以揽胜、揽胜运动及路虎卫士为代表的高价值核心车型持续彰显品牌吸引力,销量占比相较上一财季进一步提升至80.8%,巩固公司在全球豪华汽车市场的业务基础。本财季,捷豹路虎在中国市场的零售...
19:35
《科创板日报》8月13日讯(记者 郭辉)中芯国际发布2026年第二季度财报。 财报显示,今年二季度,中芯国际整体实现销售收入30亿美元,环比增长20%。 利润方面,中芯国际2026年第二季毛利为7.6亿美元,2026年第一季毛利为5.04亿美元,2025年第二季毛利为4.5亿美元。 由于平均售价上升及产品组合变动,第二季度毛利率为25.3%,环比增加5.2个...
19:30
从上世纪80年代占全球半导体半壁江山,到后来被美韩台打落神坛只剩10%左右的份额,日本芯片业曾失落了长达三十年。谁能想到,还有反转的一天。据《日本经济新闻》的最新统计,自2021年日本政府打出“芯片复兴”大旗以来,外资半导体企业对日本的投资总量已高达6万亿日元。且这个数字,还在不断扩大。仅近期,台积电与索尼在熊本县建一厂、二厂(总投资超200亿美元)后,又被...
19:30
AI基建领域的两大新云——CoreWeave(CRWV)与Nebius(NBIS)——在26Q2都交出了不错的成绩单。两家公司的单季营收同比增速分别达到了惊人的112% 和 454%。但在绚丽的增长曲线背后,资本市场正在目睹一场前所未有的商业博弈:极端杠杆下的产能对赌、时间错配引发的利润阵痛,以及从“算力房东”向“资产定价权”的终局进化。在这两份信息量爆棚的...
19:30
本文作者 | 弗雷迪数据支持 | 鼓狮大数据(www.gushiio.com)8月,MLCC涨价潮再起,AI服务器对高容MLCC的需求,使这轮涨价与2021年那轮呈现不同的逻辑。港股今年刚上市的三环集团是这轮行情中受关注度最高的国产标的,市场已先行定价。公司年内涨幅187%,按照周四(8/13)收盘市值(2563.8亿元),约为去年同期的3倍。然而...