近年来,基于视频生成模型的世界模型(World Models)已成为人工智能领域备受关注的方向。Sora、Genie、Cosmos、V-JEPA 等模型都指向一个共同假设:如果它们看过足够多的视频,或许就会逐步形成“物理直觉”,进而理解物理世界。
然而,问题在于,现有基准很难验证这一假设是否成立。视频生成模型究竟是遵循了物理定律,还是只是生成了看起来正确的结果?它能否像牛顿一样用物理定律思考,而不只是像亚里士多德那样依赖“直觉”?
针对这些问题,南洋理工大学 S-Lab 团队及其合作者提出了首个以物理定律为核心的视频模型评估基准 Apple-π。结果表明,当前的视频生成模型距离可靠的通用世界模拟器仍有很大差距,即便是 SOTA 模型,得分也只有 0.473。
论文链接:https://arxiv.org/abs/2607.16401
研究团队指出,即使现有模型能根据标注好的第一帧画面生成看起来合理的运动,也不代表它们真的看懂了物体关系、学会了物理规律,或能始终按一致的运动规律生成结果。这项工作旨在帮助未来的视频生成模型真正学会依照物理定律理解和模拟世界,但属于世界模型的“ChatGPT 时刻”依然很远。而要做到这一点,研究人员还需要为视频世界模型赋予更强的场景理解能力、更丰富的物理推理数据,以及专门面向推理的后训练。
Apple-π:锚定物理定律的基准
Apple-π 是首个以物理定律为核心的视频模型评估基准。它要求模型感知相关物理量、表述支配定律,推导出符合定律的后续运动,并定位推理失败发生在哪一步。
图|Apple-π 概览。
具体设计如下:
1. 视频数据集(Orchard):包含 400 个经典力学视频。研究团队先确定物理定律和初始条件,再生成或筛选对应视频。任务分为单一定律和多定律组合两类,覆盖重力、碰撞、惯性及多段运动衔接,考察模型能否持续更新位置和速度。
2. 基准协议:Apple-π 将 Orchard 案例拆分为感知、表述和推导三类任务,包含五个子轨道,用于分项评估模型的物理推理能力。感知-文本用于复刻画面中的数字和标注,感知-图形用于定位并保留实验物体;表述-文本从候选物理公式中选择支配方程并代入变量,表述-图形预测目标时刻的物体位置并标注速度;推导则基于首帧初始条件生成完整运动视频。
3. 评估套件:Apple-π 采用混合评分机制。多模态大模型评分用于评估回答合理性、格式合规性和画面清晰度;在具备物体掩码和轨迹真值的赛道中,物理真值指标用于量化物体定位、轨迹和速度误差,判断运动过程是否符合物理规律。各赛道得分统一归一化至 [0,1]。
无论哪类模型,物理推导表现都十分有限
研究团队在完整 Apple-π 基准上评估了 11 个代表性模型。整体结果显示,视频预训练、推理监督和统一理解均能改善模型的感知和表述能力;不过无论哪类模型,物理推导表现都十分有限。
具体来看,专有模型结果整体强于基础开源视频模型,大规模、高质量视频训练可以蒸馏有用的物理先验;经过视频推理微调的 VBVR-Wan2.2,也在视频模型中表现更有竞争力;GPT Image 2 和 Nano Banana 2 结果显著领先,说明显式理解和可控视觉生成有助于标注读取、物体定位和最终帧生成。即便是 SOTA 模型,得分也只有 0.473,物理运动推理仍然是目前的主要瓶颈。
此外,为了进一步定位模型在不同推理环节中的问题,Apple-π 将评测流程拆分为感知、定律建模和动态推演三个阶段,考察模型在感知、对齐、推理和生成上的能力。结果显示,模型的错误并不只出现在最终生成阶段,还体现在中段的物理推理环节:即使部分模型能完成标注读取和物体定位,其在物理规则选择、状态更新以及后续运动预测上仍明显不足。它们更多依赖表层视觉模式匹配,尚未形成稳定的物理状态建模能力。
局限性
尽管 Apple-π 能更细致地评估视频模型的物理推理能力,但仍存在一些不足。
例如,Apple-π 覆盖的范围仍然有限。它主要聚焦经典刚体力学,包括重力驱动运动、动量守恒碰撞、牛顿第一定律,以及这些规律的简单组合,但并未评估流体、热力学、电磁学、断裂、颗粒介质、生物运动或量子现象。
同时,Apple-π 覆盖的物体和场景也不全面。数据中的动态物体只包括球体、立方体、圆柱体和圆锥体。由于使用单一固定相机,因此它并不直接考察多视角一致性或新视角生成能力。
研究团队指出,Apple-π 的输入设置依然依赖第一帧标注来固定场景与物理量的对应关系。因此,基准主要考察模型在已有视觉场景下的物理推理能力,不测试模型能否仅凭文本构造完整物理场景。
此外,当前的评估方式也存在不足。MLLM 裁判无法完全判断物理过程是否正确,因此 Apple-π 还需要结合掩码、像素和速度等指标,这些指标也会受到分割质量、画面差异和标注噪声的影响。
最后,Apple-π 在时间归一化上也有局限。评估默认将完整解码后的输出视为提示词要求的物理时长,但视频生成服务可能返回不随请求时长变化的固定长度视频容器,评估结果会因此受到影响。
