2012 年,AlexNet 的一战成名宣告了一个时代的终结。在此之前,图像识别依赖人工设计特征。AlexNet 证明了一个被反复验证的真理:将任务端到端交给模型自主学习,往往胜过人类精心设计的分阶段流水线。无论是图像分类、目标检测还是图像分割,深度学习的每一次跃迁都印证了这一点。然而,生成模型却是一个长期的例外。

目前最强的生成模型,无论是自回归还是扩散模型,都不是端到端的。它们训练时只预测“一小步”,推理时却需要像循环网络那样反复展开几百上千次。这种训练与推理采样方式的不一致,导致每一步的误差层层累积,输入逐渐偏离训练分布,学术上称之为“暴露偏差”。简而言之,端到端更好这条核心经验,至今未能真正应用于生成模型。

近期,来自 UIUC 与哈佛大学的一篇论文试图补上这块拼图。他们提出了名为 Explorative Modeling(探索式建模,简称 XM)的新范式。其核心思想朴素而大胆:生成模型除了参数和数据,其实还有第三根可以放大的轴。

要理解这篇论文,需先明白生成难在哪。监督学习(如分类)通常只有一个正确答案,而生成任务正确答案无穷多,对应数据分布中的多个模式。主流生成模型使用重构损失训练时,面对多个合法目标,最优解往往是这些目标的平均值,而非真实数据。这导致模型生成的图像模糊不清,文本重复,即“模式模糊”。

现有模型通过拆分生成过程来规避此问题,例如自回归一次预测一个元素,扩散一次去噪一点。这使得每一步的目标被限制在单一模式,避免了取平均。但这同时也牺牲了端到端的能力。

作者由此提出一个关键追问:既然拆分生成会破坏端到端,那就拆分训练。XM 的核心机制是在每个训练步生成 K 个候选样本,只挑选其中离真实数据最近的一个进行训练和反向传播。这一过程可以用几行代码实现,简单到令人怀疑。

为什么这么做就能解决模式模糊?这好比猜飞镖落点。只猜一次时,最优策略是猜所有落点的平均值,往往偏离靶心。但如果允许猜 K 次并只按最近的一次算分,策略就会改变:模型会散开猜测,让每次猜测覆盖不同的区域。XM 也是同理,当它被允许探索 K 个候选,不同的输入噪声就会各自“认领”一个不同的模式,而不是全都挤到中间去取平均。作者将这种能力定义为“生成表达力”,并指出它由训练目标决定,而非单纯依赖参数规模。

这也解释了为什么当前最好的模型都依赖“引导”技术——引导本质上是在把模型推离模糊的平均值。如果模型自己不模糊,又何必去推它?论文还提出了 Forward 和 Reverse 两种探索方向:前者固定真实目标在生成中搜索最近样本,偏向“查全”;后者固定生成样本在数据中搜索最近样本,偏向“查准”,且几乎不增加算力。

XM 将“探索”验证为一根真正的 Scaling 轴。在图像、视频、语言三种模态上,性能均随数据、模型规模和算力的增加而单调提升。实验显示,随着数据规模增长,增益从 7% 提升至 36%;模型增大增益从 13% 到 23%;算力翻三倍时,效率增益翻倍多。在 FLOP、样本和参数效率上均有显著提升。这表明,当参数和数据规模不再是限制时,生成表达力将成为瓶颈,而探索正是解决这一瓶颈的关键。考虑到当前基础模型训练算力已比论文实验高出四个数量级,XM 的收益可能远超报告的数值。

将探索推向极限,生成模型终于实现了端到端。在机器人控制任务中,XM 展现出惊人的效率。在行为克隆中,Explorative Policy 仅需一次前向传播就追平甚至超越了需要 100 次前向的 Diffusion Policy;在目标导向的世界建模中,XM 的推理算力仅为 Diffuser 的 1/16 到 1/256,且表现更好。这是因为 XM 在推理时省去了展开过程,将“处理多模式”的代价转移到了训练时的探索上。

第一作者 Alexi Gladstone 是业内的熟面孔。2025 年 7 月,他主导的 Energy-Based Transformers 曾引发热议,声称跑赢了标准 Transformer。Explorative Modeling 与他的思路一脉相承,都在探索模型如何通过搜索实现单次前向做不到的事。

作者坦诚,Best-of-K 的想法并不新鲜,他们的贡献在于阐明了该循环在不拆分生成过程的情况下直接放大了生成表达力。尽管自回归语言模型仍是难点,纯端到端 XM 在图像生成上仍较昂贵,但这篇论文提出了第三个旋钮:让模型多猜几次,只留最好的一次。随着规模膨胀,前两个旋钮终将拧到头,而第三个旋钮才刚刚开始转动。

参考链接:https://explorative-modeling.github.io
论文地址:https://arxiv.org/abs/2607.27372
代码仓库:https://github.com/alexiglad/XM

最新快讯

2026年08月03日

13:24
8月3日早盘,A股市场低开震荡,三大指数集体收跌,半日成交额约为1.4万亿元。板块题材方面,电网设备、光伏设备、种植业与林业及电机板块涨幅居前,电子化学品、半导体及存储芯片板块则位居跌幅榜首位。相比之下,港股主要指数上涨,电网设备与软件开发板块表现活跃。 截至午间收盘,中证A500指数下跌0.7%,沪深300指数下跌0.7%,创业板指下跌0.4%,上证科创板...
13:24
据鼓狮财经8月3日报道,摩根大通一位顶级策略师指出,尽管美国正经历“通胀过山车”般的波动,但这无法阻挡股市迈向历史新高的步伐。摩根大通私人银行执行董事、全球投资策略师克里蒂·古普塔预测,在未来12个月内,标普500指数仍有约10%的上涨空间,有望在明年年中攀升至8200点左右。 摩根大通认为,单凭通胀因素不足以终结股市的长期涨势。古普塔强调,支撑牛市的核心基...
12:53
智能手机曾试图通过 All in One 的方式吞并无数设备,而如今 AI 正在挑战它的核心地位。赋予更高权限的智慧个体 Agent,让人联想到电影《她》中的 OS 系统。在新范式下,手机或许将不再仅仅是 App 的容器,而成为「智能」代理的新载体。这不仅是一场产品进化,更是一场由厂商、平台与用户共同参与的利益重组。爱范儿将持续关注智能手机的 AI 化进程,...
12:53
当下的热闹,本质上是资本催熟与概念溢价的产物。2026年4月,北京车展上的人形机器人展区,热度甚至超过了新能源汽车展台。 在比亚迪的展台上,一台身高一米七五的银色机器人正在给参观者递送矿泉水,动作虽算不上流畅,但胜在稳定。三米开外,荣耀的机器人正在表演打太极,一招一式有板有眼,吸引了大量手机用户驻足拍照。再往前走,宇树科技的G1机器人正在进行空翻表演,落地时...
12:39
据鼓狮财经8月3日报道,今年第13号台风“白海豚”已于今晨由超强台风级减弱为强台风级。截至上午8时,台风中心位于琉球群岛那霸市偏东约2090公里的西北太平洋洋面上。预计“白海豚”将以每小时20至25公里的速度向西偏北方向移动,强度变化不大。 受其影响,风雨天气将于本周四开始显现,华东沿海地区本周末将迎来明显风雨过程。此次天气过程在缓解持续高温酷热的同时,也提...
12:39
据鼓狮财经8月3日报道,Counterpoint Research最新市场监测报告显示,2026年第二季度全球智能手机市场营收同比增长7%,创下1090亿美元的季度纪录。尽管同期全球出货量有所下滑,但营收表现依然强劲,成功刷新历史同期最高值。营收与出货量走势的背离,主要归因于平均售价(ASP)的显著上涨。受益于消费者持续向高端细分市场转移,ASP同比增幅达1...
12:23
AI大厂的安全测试如今是风生水起,只不过这股劲头似乎有点过头,眼看就要把真实互联网测成筛子了。就在OpenAI的AI Agent接连突破测试环境、黑进Hugging Face的余波未平之时,Anthropic也迅速跟进自查,结果发现自己心爱的Claude大宝贝也早已“勇闯”真实互联网了,场面一度十分魔幻。甚至捅出的篓子,可以说更加抓马、魔幻、真实——翻别家公...
12:23
整个 AI 圈都在为 Claude Opus 5 狂热!仅仅一个提示词,消耗 6.9 亿 Token,花费 423 美元,就“手搓”出了一款 3D 游戏。这在过去需要一支团队数月的艰苦努力和巨额资金。如今,Opus 5 生成“3A 大作”的硬核案例正在全网涌现。同一个提示词跑下来,一年前的 Opus 4 和现在的 Opus 5 能力差距巨大。AI 的进化速度...
12:23
AI 短剧在国内的生命周期似乎比预想的要短。年初那股“不进则退”的狂热过后,监管的收紧比一夜暴富来得更早。从4月开始,红果平台连续两次对低质 AI 短剧出手,先是小规模下架了3522部,5月份又累计拦截、下架违规短剧20941部。之前冲到热播榜第一的《菩提临世》也未能幸免。 据业内人士透露,由于上剧量巨大,违规题材和肖像权争议频发,审核周期已大幅拉长。以前6...
12:23
AI数据中心正在重塑美国电力的需求结构。一个超大规模AI训练集群的耗电量,抵得上一座中型城市。这意味着电网在单一节点需要承载的负荷,从“几栋楼”的量级跃升至“一座城”的量级。但一座新的电网变电站从规划到投产需要3到5年,燃气轮机的订单也排到了5年以后。需求端高速增长,供给端扩张刚性。这一速度差,正是SOFC面临的结构性机遇。 电力荒 传统电力体系扩张的速度,...