2012 年,AlexNet 的一战成名宣告了一个时代的终结。在此之前,图像识别依赖人工设计特征。AlexNet 证明了一个被反复验证的真理:将任务端到端交给模型自主学习,往往胜过人类精心设计的分阶段流水线。无论是图像分类、目标检测还是图像分割,深度学习的每一次跃迁都印证了这一点。然而,生成模型却是一个长期的例外。
目前最强的生成模型,无论是自回归还是扩散模型,都不是端到端的。它们训练时只预测“一小步”,推理时却需要像循环网络那样反复展开几百上千次。这种训练与推理采样方式的不一致,导致每一步的误差层层累积,输入逐渐偏离训练分布,学术上称之为“暴露偏差”。简而言之,端到端更好这条核心经验,至今未能真正应用于生成模型。
近期,来自 UIUC 与哈佛大学的一篇论文试图补上这块拼图。他们提出了名为 Explorative Modeling(探索式建模,简称 XM)的新范式。其核心思想朴素而大胆:生成模型除了参数和数据,其实还有第三根可以放大的轴。
要理解这篇论文,需先明白生成难在哪。监督学习(如分类)通常只有一个正确答案,而生成任务正确答案无穷多,对应数据分布中的多个模式。主流生成模型使用重构损失训练时,面对多个合法目标,最优解往往是这些目标的平均值,而非真实数据。这导致模型生成的图像模糊不清,文本重复,即“模式模糊”。
现有模型通过拆分生成过程来规避此问题,例如自回归一次预测一个元素,扩散一次去噪一点。这使得每一步的目标被限制在单一模式,避免了取平均。但这同时也牺牲了端到端的能力。
作者由此提出一个关键追问:既然拆分生成会破坏端到端,那就拆分训练。XM 的核心机制是在每个训练步生成 K 个候选样本,只挑选其中离真实数据最近的一个进行训练和反向传播。这一过程可以用几行代码实现,简单到令人怀疑。
为什么这么做就能解决模式模糊?这好比猜飞镖落点。只猜一次时,最优策略是猜所有落点的平均值,往往偏离靶心。但如果允许猜 K 次并只按最近的一次算分,策略就会改变:模型会散开猜测,让每次猜测覆盖不同的区域。XM 也是同理,当它被允许探索 K 个候选,不同的输入噪声就会各自“认领”一个不同的模式,而不是全都挤到中间去取平均。作者将这种能力定义为“生成表达力”,并指出它由训练目标决定,而非单纯依赖参数规模。
这也解释了为什么当前最好的模型都依赖“引导”技术——引导本质上是在把模型推离模糊的平均值。如果模型自己不模糊,又何必去推它?论文还提出了 Forward 和 Reverse 两种探索方向:前者固定真实目标在生成中搜索最近样本,偏向“查全”;后者固定生成样本在数据中搜索最近样本,偏向“查准”,且几乎不增加算力。
XM 将“探索”验证为一根真正的 Scaling 轴。在图像、视频、语言三种模态上,性能均随数据、模型规模和算力的增加而单调提升。实验显示,随着数据规模增长,增益从 7% 提升至 36%;模型增大增益从 13% 到 23%;算力翻三倍时,效率增益翻倍多。在 FLOP、样本和参数效率上均有显著提升。这表明,当参数和数据规模不再是限制时,生成表达力将成为瓶颈,而探索正是解决这一瓶颈的关键。考虑到当前基础模型训练算力已比论文实验高出四个数量级,XM 的收益可能远超报告的数值。
将探索推向极限,生成模型终于实现了端到端。在机器人控制任务中,XM 展现出惊人的效率。在行为克隆中,Explorative Policy 仅需一次前向传播就追平甚至超越了需要 100 次前向的 Diffusion Policy;在目标导向的世界建模中,XM 的推理算力仅为 Diffuser 的 1/16 到 1/256,且表现更好。这是因为 XM 在推理时省去了展开过程,将“处理多模式”的代价转移到了训练时的探索上。
第一作者 Alexi Gladstone 是业内的熟面孔。2025 年 7 月,他主导的 Energy-Based Transformers 曾引发热议,声称跑赢了标准 Transformer。Explorative Modeling 与他的思路一脉相承,都在探索模型如何通过搜索实现单次前向做不到的事。
作者坦诚,Best-of-K 的想法并不新鲜,他们的贡献在于阐明了该循环在不拆分生成过程的情况下直接放大了生成表达力。尽管自回归语言模型仍是难点,纯端到端 XM 在图像生成上仍较昂贵,但这篇论文提出了第三个旋钮:让模型多猜几次,只留最好的一次。随着规模膨胀,前两个旋钮终将拧到头,而第三个旋钮才刚刚开始转动。
参考链接:https://explorative-modeling.github.io
论文地址:https://arxiv.org/abs/2607.27372
代码仓库:https://github.com/alexiglad/XM
