2012 年,AlexNet 的一战成名宣告了一个时代的终结。在此之前,图像识别依赖人工设计特征。AlexNet 证明了一个被反复验证的真理:将任务端到端交给模型自主学习,往往胜过人类精心设计的分阶段流水线。无论是图像分类、目标检测还是图像分割,深度学习的每一次跃迁都印证了这一点。然而,生成模型却是一个长期的例外。

目前最强的生成模型,无论是自回归还是扩散模型,都不是端到端的。它们训练时只预测“一小步”,推理时却需要像循环网络那样反复展开几百上千次。这种训练与推理采样方式的不一致,导致每一步的误差层层累积,输入逐渐偏离训练分布,学术上称之为“暴露偏差”。简而言之,端到端更好这条核心经验,至今未能真正应用于生成模型。

近期,来自 UIUC 与哈佛大学的一篇论文试图补上这块拼图。他们提出了名为 Explorative Modeling(探索式建模,简称 XM)的新范式。其核心思想朴素而大胆:生成模型除了参数和数据,其实还有第三根可以放大的轴。

要理解这篇论文,需先明白生成难在哪。监督学习(如分类)通常只有一个正确答案,而生成任务正确答案无穷多,对应数据分布中的多个模式。主流生成模型使用重构损失训练时,面对多个合法目标,最优解往往是这些目标的平均值,而非真实数据。这导致模型生成的图像模糊不清,文本重复,即“模式模糊”。

现有模型通过拆分生成过程来规避此问题,例如自回归一次预测一个元素,扩散一次去噪一点。这使得每一步的目标被限制在单一模式,避免了取平均。但这同时也牺牲了端到端的能力。

作者由此提出一个关键追问:既然拆分生成会破坏端到端,那就拆分训练。XM 的核心机制是在每个训练步生成 K 个候选样本,只挑选其中离真实数据最近的一个进行训练和反向传播。这一过程可以用几行代码实现,简单到令人怀疑。

为什么这么做就能解决模式模糊?这好比猜飞镖落点。只猜一次时,最优策略是猜所有落点的平均值,往往偏离靶心。但如果允许猜 K 次并只按最近的一次算分,策略就会改变:模型会散开猜测,让每次猜测覆盖不同的区域。XM 也是同理,当它被允许探索 K 个候选,不同的输入噪声就会各自“认领”一个不同的模式,而不是全都挤到中间去取平均。作者将这种能力定义为“生成表达力”,并指出它由训练目标决定,而非单纯依赖参数规模。

这也解释了为什么当前最好的模型都依赖“引导”技术——引导本质上是在把模型推离模糊的平均值。如果模型自己不模糊,又何必去推它?论文还提出了 Forward 和 Reverse 两种探索方向:前者固定真实目标在生成中搜索最近样本,偏向“查全”;后者固定生成样本在数据中搜索最近样本,偏向“查准”,且几乎不增加算力。

XM 将“探索”验证为一根真正的 Scaling 轴。在图像、视频、语言三种模态上,性能均随数据、模型规模和算力的增加而单调提升。实验显示,随着数据规模增长,增益从 7% 提升至 36%;模型增大增益从 13% 到 23%;算力翻三倍时,效率增益翻倍多。在 FLOP、样本和参数效率上均有显著提升。这表明,当参数和数据规模不再是限制时,生成表达力将成为瓶颈,而探索正是解决这一瓶颈的关键。考虑到当前基础模型训练算力已比论文实验高出四个数量级,XM 的收益可能远超报告的数值。

将探索推向极限,生成模型终于实现了端到端。在机器人控制任务中,XM 展现出惊人的效率。在行为克隆中,Explorative Policy 仅需一次前向传播就追平甚至超越了需要 100 次前向的 Diffusion Policy;在目标导向的世界建模中,XM 的推理算力仅为 Diffuser 的 1/16 到 1/256,且表现更好。这是因为 XM 在推理时省去了展开过程,将“处理多模式”的代价转移到了训练时的探索上。

第一作者 Alexi Gladstone 是业内的熟面孔。2025 年 7 月,他主导的 Energy-Based Transformers 曾引发热议,声称跑赢了标准 Transformer。Explorative Modeling 与他的思路一脉相承,都在探索模型如何通过搜索实现单次前向做不到的事。

作者坦诚,Best-of-K 的想法并不新鲜,他们的贡献在于阐明了该循环在不拆分生成过程的情况下直接放大了生成表达力。尽管自回归语言模型仍是难点,纯端到端 XM 在图像生成上仍较昂贵,但这篇论文提出了第三个旋钮:让模型多猜几次,只留最好的一次。随着规模膨胀,前两个旋钮终将拧到头,而第三个旋钮才刚刚开始转动。

参考链接:https://explorative-modeling.github.io
论文地址:https://arxiv.org/abs/2607.27372
代码仓库:https://github.com/alexiglad/XM

最新快讯

2026年08月03日

13:58
视频模型沉寂了大半年,最近突然热闹了起来。Seedance 推出了 2.5,MiniMax 也发布了新模型 H3。这种操作着实不常见,世超查看 Artificial Analysis 的三个视频榜单,发现 MiniMax H3 竟然直接包揽了前三名。好家伙,这是在收集奖杯吗?更牛的是,这模型是开源的,在海外创作者中引发了不小的讨论,大家纷纷下场测试。有人称赞...
13:58
OpenAI再次在数学领域发起了猛攻。此前Anthropic研究员的一句玩笑话——“下周颁发的菲尔兹奖,可能是最后一个颁发给人类的菲尔兹奖”——眼看就要被OpenAI兑现了。OpenAI发布了其下一代主力模型Astra的内部测试研究成果,一举攻克了10项长期悬而未决的数学与理论计算机科学公开难题。这些课题横跨高维几何、编码理论、群论、算子代数、量子复杂度及极...
13:58
麻省理工学院物理学教授泰格马克在其著作《生命3.0》中,曾设想了一个关于AGI(通用人工智能)诞生的故事。当全面碾压人类智慧的AI——AGI出现的第 一天,它会做什么?答案是:越狱。所谓“AI越狱”,并非传统意义上的黑客攻击,而是指AI系统突破原本设计好的安全限制,表现出开发者未曾预料到的行为。在上述故事中,人类因担心AI能力过强,通常会切断网络,但既然它比...
13:58
第一代AI演员真的要出道了。最近,一部名为《被裁掉的女孩》的AI短剧火遍全网,连带着剧中的女主角方桃子也一同“飞升”,成功出道。 《被裁掉的女孩》讲述了小镇女孩方桃子来到大城市“上南城”,追逐模特梦想的故事。起初,方桃子没有背景和资源,只是合照中那个“被裁掉的女孩”,但在经历一次次拒绝和打压后,她逐渐掌握主动权,最终在模特行业站稳脚跟。有人将这部剧称为AI版...
13:55
作为曾经的“户外用品第一股”,探路者7月的股价走势可谓触目惊心。不仅连续两个交易日遭遇20CM跌停,整个7月累计跌幅更是超过60%。与6月底25.74元的阶段性高点相比,公司市值已近乎腰斩。短短一个月,超过百亿的市值便灰飞烟灭。更令人费解的是,这轮暴跌恰恰发生在公司发布了一份颇为亮眼的半年度业绩预告之后。7月16日晚间,探路者公告预计2026年上半年归属于上...
13:55
今日早盘,半导体板块整体震荡调整。截至午间收市,上证科创板芯片设计主题指数下跌3.8%,上证科创板芯片指数下跌4.9%,中证芯片产业指数下跌5.4%,中证半导体材料设备主题指数跌幅最深,达6.7%。不过,板块内部资金流向出现明显分化,半导体设备ETF易方达(159558)半日逆势获得5.04亿份净申购。
13:55
8月3日早盘,商业航天板块走势活跃,呈现局部拉升态势。截至午间收盘,中证卫星产业指数上涨2.0%,国证通用航空产业指数上涨1.6%。此次板块上涨主要受利好消息驱动,氦星光联团队在“三体计算星座”激光通信在轨测试中,成功突破了低成本激光通信载荷的长时稳定建链技术。 具体而言,该星座首发星座中的高链激光链“05-08链”在1000公里星距下,完成了宽带星间激光通...
13:55
8月3日早盘,稀土板块表现活跃。截至午间收盘,中证稀土产业指数上涨1.4%,中证石化产业指数则微涨0.1%。对此,中信建投证券分析称,受废料厂原料紧缺影响,稀土供给端产量下滑;但得益于“金九银十”旺季的备货预期,需求端有望回暖。这种供需关系的改善,有望打破此前供需双弱的格局,从而推动稀土价格企稳并向上运行。
13:55
截至今日10点52分,中证港股通互联网指数上涨1.5%,中证海外中国互联网50指数上涨2.3%。 近日,全球多模型聚合平台OpenRouter发布了最新的AI大模型周调用量榜单,结果显示,排名前五的产品全部由中国企业研发。登顶榜单首位的是小米MiMo-V2.5,单周调用量达到10.5万亿Token,环比增长12%;排名第二和第五的均为DeepSeek模型,两...
13:55
截至上午10时36分,上证科创板芯片指数下跌5.2%,中证半导体材料设备主题指数下跌7.2%。数据显示,截至上一交易日,科创芯片ETF易方达(589130)年内净流入额超过38亿元,在同类产品中位居首位。 消息面上,7月31日,DeepSeek官方宣布DeepSeek-V4-Flash正式版API开启全面公测。该版本支持思考/非思考双模式,具备1M上下文长度...
13:55
鼓狮财经8月3日讯,新疆维吾尔自治区气象台于当日12时39分将高温预警信号由橙色提升为红色。预计今天白天至8月6日白天,巴州、吐鲁番市、哈密市等地最高气温将持续升至40摄氏度以上。其中,巴州南部、吐鲁番市及哈密市等地的局部区域气温将达45摄氏度以上,局地甚至可能突破50摄氏度。
13:55
据鼓狮财经8月3日报道,被美国军方强行控制的委内瑞拉总统尼古拉斯·马杜罗,于8月2日在纽约监狱发表声明,明确表示对“任何对话途径”持开放态度。与此同时,委内瑞拉政府与反对派定于下周在美国的监督下开启对话,外界普遍期待此举能推动政治过渡及选举进程。马杜罗在Telegram社交平台上写道:“将‘国家复兴’作为共同目标进行讨论,即意味着相互尊重……我们欢迎任何有助...