JEPA世界模型的底层是Yann LeCun自2017年起持续倡导的自监督学习(Self-Supervised Learning, SSL)。

SSL 无需人工标注即可从海量数据中学习通用表征,但普遍面临一个核心难题——表征坍塌(representation collapse):模型倾向于把不同输入映射到相同或极少数几个向量上,看似完成了训练,实则未学到有判别力的表征。

为抑制坍塌,主流方法大多依赖一系列启发式技巧(EMA、教师-学生网络、停止梯度、冻结层等)。这些技巧使训练变得脆弱、难以调参,也削弱了方法的可解释性与可扩展性。

另一条路线是通过正则项直接约束表征分布。

LeCun团队提出的VICReg将学习目标拆为方差、不变性、协方差三项,用协方差约束各维度之间的相关性;但协方差仅刻画二阶统计量,无法区分「均值、方差相同,而分布形状迥异」的两种表征。

其后提出的SIGReg基于Cramér–Wold定理,用sketching技术将整个嵌入分布对齐到标准高斯,从而约束完整的分布形状。

然而SIGReg仍存在两个关键缺陷:

  • 坍塌时梯度消失:当表征开始坍塌时,SIGReg的梯度随之衰减——坍塌越严重、修正信号越弱,模型难以自行恢复;
  • 尺度与形状耦合:未将「幅度大小(尺度)」与「分布形态(形状)」两个独立属性分离,二者在优化中相互干扰,导致在长尾、低质量、低秩数据上适配性较差。

也就是说,在模型最需要梯度信号来逃离坍塌状态时,SIGReg的梯度恰恰趋近于消失。

这正是VISReg要解决的核心问题。

近日,自监督学习新工作VISReg(Variance-Invariance-Sketching Regularization)获图灵奖得主Yann LeCun连续转发并给予高度认可——他在转发时评价道「VICReg begat SIGReg which begat VISReg」(VICReg孕育了SIGReg,SIGReg又孕育了VISReg),一句话点明了这条正则化路线的技术传承。

能获得LeCun如此认可,VISReg究竟强在哪里?

答案在于:它精准命中了LeCun长期押注的JEPA世界模型的核心难题——表征坍塌(representation collapse)。

论文链接:https://arxiv.org/abs/2606.02572

代码 / 预训练权重:https://github.com/HaiyuWu/visreg

项目主页:https://haiyuwu.github.io/visreg/

VISReg将防止坍塌的正则项解耦为「尺度」与「形状」两个独立目标,在不依赖任何启发式训练技巧、也不依赖海量数据的前提下,于15个数据集上综合表现超过7种主流自监督学习方法;其中仅用约1/10的训练数据,即在分布外(OOD)基准上追平DINOv2。

图 2:不同正则方法在表征坍缩各阶段的梯度幅值‖∇ℒ‖模拟。VISReg在坍缩状态下仍能保持强梯度,而SIGReg的梯度几近消失。

核心方法

VISReg对VICReg与SIGReg取长补短:保留VICReg的方差项来控制尺度,同时用基于切片Wasserstein距离(Sliced Wasserstein Distance, SWD)的 sketching 目标替代协方差项来控制形状,并通过停止梯度将二者彻底解耦。整个正则目标由三部分组成。

1.尺度正则(Scale Regularization)

第一部分约束每一维的方差,防止幅值坍缩:

其关键性质在于:当模型坍缩时,该项的梯度趋近于一个常数,从而保证模型能够稳定地恢复——这恰好弥补了SIGReg梯度消失的缺陷。

2.形状正则(Shape Regularization)

第二部分先归一化以消除尺度影响,再单独约束形状。关键的一步是带「停止梯度」(stop-gradient, sg)的归一化:

这里对标准差 σσ 施加停止梯度,使得形状损失的优化不会反过来改变尺度——这正是「尺度」与「形状」两个目标真正解耦、互不干扰的机理所在。

归一化之后,再用切片Wasserstein距离将分布的几何形状对齐到各向同性高斯:

其中

为标准高斯分位数,

为随机投影方向(即「切片 / sketching」)。

其理论依据是Cramér–Wold定理(论文Lemma 3.1):两个分布相等,当且仅当它们沿单位球面上所有方向的一维投影都相等。因此,只要把高维表征沿足够多的随机一维方向切片后逐一对齐到高斯,就等价于在高维空间对齐了整个分布——这使得可以用廉价的一维排序操作刻画完整的分布形状,而非仅仅二阶统计量。

3.合并目标

第三部分是一个将 batch 均值μ拉向原点的中心化损失

三个正则项按权重组合:

预测损失沿用 JEPA / LeJEPA 的不变性目标——让各视角(global + local,共V个)的嵌入

都向全局视角的均值

对齐:

最后用单一超参λ在预测与正则之间平衡,得到完整目标:

与VICReg的对比:VICReg同样将正则解耦为方差 + 协方差,但协方差只刻画二阶统计量;VISReg用基于切片Wasserstein的sketching目标完整刻画了分布形状,同时保留方差项做尺度控制——既保留了VICReg的灵活性,又获得了分布层面的严格性。

仅需约15行PyTorch代码

该正则目标在实现上非常轻量,核心逻辑只需约15行:

计算复杂度与扩展性

在计算与扩展性上,VISReg同样具备优势。其正则部分的计算复杂度为

(N为batch、D为维度、K为切片数),对所有扩展因子都是线性的;相比之下,VICReg的协方差项为

,随维度平方增长

在同等batch规模下,VISReg 在单块 H100 GPU 上的运行速度与显存占用均优于 SIGReg。

更重要的是,K个随机切片可以分摊到多块GPU上:在 M块 GPU 上每块各生成 K/M个切片,效果等价于单卡生成全部K个。

实验中,当单卡切片数不足时,改用8卡、每卡128个切片(合计1024),即可把与「单卡 1024 切片」之间的精度差距从约2.4%缩小到0.22%。这意味着扩大训练规模时 KK 可保持常数,几乎不增加单卡负担。

图:在固定K与D时,增加GPU数量带来的线性探测精度变化。当K不足(K = ¼D)时,用8倍的GPU数量即可把精度补齐到K = 2D的水平——这使得在大规模训练中保持常数K成为可能。

实验结果

回到标题的问题——VISReg 到底强在哪里?研究团队在15个数据集(8个域内 + 6个分布外 + ADE20K稠密预测)上,将VISReg与MoCoV3、DINO、iBOT、I-JEPA、MAE、data2vec等7种主流自监督方法进行了对比,场景涵盖天文、医疗、遥感、纹理、花卉等。答案体现在从识别到分割、生成的多个维度上。

1.域内(In-Domain)线性探测

为保证比较公平,实验按是否使用启发式技巧分为两组。在不使用任何启发式技巧的一组中,VISReg领先:ViT-B/16的域内线性探测精度达75.7%,高于MAE(75.1%);ViT-L/14 进一步提升至77.0%,高于LeJEPA(75.6%)。与使用启发式技巧的iBOT、DINO 相比,VISReg 在常规数据集上仅略低,但在纹理数据集DTD上反超全部方法——这表明其跨域泛化能力源于方法本身,而非人工技巧的堆叠。

2.分布外(OOD)泛化:全面最优

分布外泛化是比域内精度更严格的检验:依赖启发式的方法常在 ImageNet 域内被充分调优,却未必能迁移到差异较大的新分布。研究团队在覆盖医疗(ChestXRay、RetinaMNIST、OrganAMNIST)、天文(Galaxy10)、遥感(AID)、纹理(DTD)的 6 个 OOD 数据集上评测,这些数据集与 ImageNet 训练域完全无关。结果显示,VISReg 在所有方法、所有骨干规模上都取得了最佳的平均 OOD 精度,甚至超过部分使用启发式技巧、且骨干更大的方法。

图4:平均 OOD 线性探测精度。VISReg 全面优于 iBOT、DINO、MoCoV3、I-JEPA、MAE、data2vec 等方法。

如图4所示,ViT-B/16 的 VISReg 平均 OOD 精度为 70.19%,ViT-L/14 为 70.63%,明显高于 MAE(67.85%),并优于 MoCoV3(69.46%)、DINO(69.56%)、I-JEPA(68.55%)等方法。

3.数据效率:以 1/10 数据比肩 DINOv2

将 VISReg(ViT-L/14)在 ImageNet-22K(约 1400 万张图像)上预训练后,其 6 个 OOD 数据集的平均精度达72.94%,与在10 倍规模的 LVD-142M(1.42 亿张图像)上训练的DINOv2(72.93%)基本持平。也就是说,VISReg 以约1/10 的数据达到了同等水平。(作为对照,同为 ViT-L/14、但仅用 ImageNet-1K 预训练的 VISReg 平均精度为 70.63%。)这说明其学到的表征具有很强的通用性。

图5:在 ImageNet-22K 上预训练的 VISReg,在 OOD 基准上比肩用 10 倍数据(LVD-142M)训练的 DINOv2。

4.迁移微调:全面超过 DINO

尽管 VISReg 在部分域内数据集上的线性探测精度略低于 DINO,但经过微调后,它在 CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10 全部五个数据集上均超过 DINO 与有监督预训练——这表明其表征分布更均匀、冗余更低、可迁移性更强。

图:迁移学习对比。微调后,VISReg 在所有测试数据集(CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10)上都优于 DINO 与有监督预训练。

5.稠密预测与生成引导

VISReg 的优势不局限于分类。在ADE20K 线性语义分割上(ViT-B/16),其 mIoU 为30.16,高于 DINO(29.40)与 MAE(23.60),仅次于 MoCoV3(31.69);在不使用任何启发式技巧的前提下,这一结果具有竞争力。论文亦坦言,稠密预测与最佳方法仍有差距,是后续优化的重点。

图 7:ADE20K 上的线性语义分割。在不使用任何启发式技巧的情况下,VISReg 取得了具有竞争力的 mIoU,仅次于 MoCoV3。

生成引导上(SiT-B/2,iREPA 框架,10 万步训练),由 VISReg 特征引导的生成在四项指标中的三项优于 DINO:gFID40.36(DINO 41.15)、Precision51.38(DINO 50.51)、Recall61.26(DINO 60.70),IS 基本持平(33.48 vs 33.47)。这说明 VISReg 学到的表征作为生成引导信号同样更优。

图8:使用 SiT-B/2、分别由 VISReg 与 DINO 特征引导的图像生成。VISReg 在多数指标上都提供了更好的引导(更低的 gFID、更高的 Precision 与 Recall)。

6.低质量数据上的鲁棒性

长尾分布(ImageNet-LT)与低秩(Galaxy10)等低质量数据集上,VISReg 能稳定地防止坍塌并学到有意义的表征,而 DINO 在缺乏精细调参时直接失败。

表 1:ImageNet-LT上的线性探测精度

表 2:Galaxy10 上的域内线性探测精度

结论

VISReg 表明:将表征正则解耦为「尺度」与「形状」两个独立组件,可以得到一种比现有方法更稳定、更高效、泛化性更强的自监督学习方法。

在不使用任何训练启发式技巧的前提下,它在图像识别、分割与生成引导等多个维度上取得了领先或接近领先的结果,并以约 1/10 的数据达到了 DINOv2 的 OOD 水平。这为 JEPA 世界模型长期存在的表征坍塌问题提供了一种新的正则化解法。

参考资料:

https://arxiv.org/abs/2606.02572

最新快讯

2026年07月28日

18:51
有大事发生! 刚刚,隐身两年的Ilya,终于出现了。 他创立的安全超级智能实验室(SSI),正式宣布与英伟达达成长期战略合作伙伴关系。 消息一出,业界震动。 这可不只是一次简单的买卡合作。 据悉,英伟达将对SSI进行「规模可观」的投资(50亿美元),并承诺在未来12个月内,让SSI的可用算力提升10倍。 这意味着,...
18:51
比亚迪人形机器人项目迎来明确落地节点。 7月28日,比亚迪官方向财联社记者证实,其人形机器人产品将于八月正式亮相。此前,比亚迪曾在“迪空间|郑州馆”发布一张人形机器人宣传海报,海报称“八月初,有个新朋友,想来认识你”。 受此消息影响,比亚迪A股盘中快速拉升,一度涨超2%;板块方面,人形机器人概念震荡拉升,明新旭腾2连板,上纬新材涨超9%...
18:51
2026 年年中,AI 行业的主要经营指标,收入、调用量均保持高速增长。但拆分各家公司的财务与业务结构后可以发现,同一组增长数据背后,商业模式不尽相同。本文梳理当前 AI 商业模式中四个结构性悖论:成本、层级、责任与开闭源。这四个悖论指向同一个底层趋势:智能正在快速商品化,而利润仅停留在少数环节。 成本悖论:Token越便宜,账单越重 ...
18:51
“ 我最爱的网文作者,用 AI 把他的连载变成了拼接尸块。” 如果问现在写作圈最忌惮的话题是什么,那绝对是 AI。 前有《 北京折叠 》作者郝景芳,公开承认新书掺 AI 被骂;后有网络文学《 鬼婴 》被扒全文 AI,作者删号跑路,连微博道歉贴的评论区都被冲了上千层。 传统文学和网络文学双双翻车,让 “AI 写文 ” 一下子被挂...
18:45
鼓狮财经7月28日电,普联软件(300996.SZ)公告称,控股股东、实控人蔺国强、王虎正在筹划公司控制权变更相关事宜,该事项可能导致公司控股股东、实控人发生变更。截至目前,相关各方正在积极推进上述事项的工作,公司预计无法在7月29日开市起复牌。经申请,公司股票及可转债自7月29日开市起继续停牌,预计继续停牌时间不超过3个交易日。停牌期间,公司可转债“普联转...
18:45
鼓狮财经7月28日电,中金黄金(600489.SH)公告称,公司拟与关联方中金地质、金洲致远按股权比例同比例对中金和田公司增资,其中公司增资7.52亿元,增资后持股比例仍为30%。本次增资用于支付中金和田公司竞得的新疆阿克陶县吐根曼苏金铜矿项目探矿权出让收益。
18:45
鼓狮财经7月28日电,东箭科技(300978.SZ)公告称,公司及全资子公司MKIEnterpriseGroupInc.于近期陆续收到美国关税退回款项,累计收到美国关税及利息退回合计约2304万元。该款项拟计入2026年当期损益,预计影响归母净利润约1892万元,占公司最近一期经审计净利润的13.28%。
18:45
鼓狮财经7月28日电,西班牙中部多起山火蔓延速度放缓,但东部卡斯特利翁省的山火仍在持续。据西班牙方面消息,截至目前,该省山火过火面积约为8500公顷,迫使16个市镇疏散,约1.6万人撤离。近期,西班牙多地正遭受山火侵袭,由于本周可能迎来新一波热浪,西班牙内政部官员表示,27日至28日是遏制该国火势的“决定性的两天”。
18:45
7月28日,南下资金净卖出港股24.95亿港元。其中净买入小米集团3.58亿、智谱2.68亿;净卖出美团9.24亿、华虹宏力8.84亿、中芯国际6.82亿、长飞光纤光缆6.4亿、腾讯5.13亿、中国海洋石油5.01亿、阿里巴巴3.74亿、兆易创新2.72亿、建滔积层板2.71亿。据统计,南下资金已连续3日净卖出中海油,共计13.4188亿港元;连续5日净卖出...
18:08
鼓狮财经7月28日讯周二,日本西南部熊本县发生地震。据日本气象厅消息,该地震震级为里氏7.1级,达到日本地震烈度等级的最高值7级。在日本地震烈度等级中,7级震级意味着低抗震性能的建筑物可能会倾斜或倒塌。 据日本气象厅公告,该地震于日本当地时间周二下午4点35分(北京时间3点35分)发生,震源深度10公里,随后发生了一系列震级最高达4.5级的余震。周边几个地...
18:07
近日,美国加州北区联邦法院正式批准作家群体诉Anthropic集体诉讼和解方案,这场持续两年的版权拉锯战终以15亿美元落槌。 在高额和解金之外,真正撼动行业的是,法院判决背后的“逻辑炸弹”:AI仅抓取训练但不留存副本,与批量爬取并永久囤积素材的两种行为,从此被切割为两个完全独立的法律问题——合法阅读抓取可以免责,非法获取囤积必须重罚。 ...
18:07
2026年最魔幻的商业叙事之一,是保健品龙头汤臣倍健成了中国AI大模型赛道最活跃的跨界玩家。 DeepSeek成立以来从未公开披露具体融资估值,市场传闻从2000亿到5000亿满天飞。结果捅破这层窗户纸的,是两家A股的公司,其中一家卖箱包的开润股份,另一家则是卖保健品的汤臣倍健。 不久前,汤臣倍健发布公告披露,出资1.3亿元,间接持有D...