9月16日,WorldArena 2.0全球终榜正式揭晓。考拉悠然旗下的“悠然无界世界模型”在视频质量赛道综合得分位列全球第二。本次评测汇集了来自阿里巴巴、中国科学院等顶尖科技企业、科研机构及具身智能独角兽公司的80个模型,围绕世界模型的视频生成质量、时序一致性与物理演化能力展开统一评估。在多项核心指标上,悠然无界世界模型展现出领先性能,其中“背景一致性”指标位列全球第一,JEPA Similarity指标同样夺魁。
背景一致性排名第一,意味着模型能在长时生成过程中稳定维持全局环境与场景布置,有效解决了长视频生成中常见的场景漂移问题。JEPA Similarity指标的不凡表现,则在于它不比对像素,而是在高层表征空间中度量生成结果与真实世界演化过程的距离,考察场景语义、物体状态与动作变化是否被正确保留。两项第一叠加指向同一个结论:模型不只是画得像,而是真正学到了物理世界随时间演化的规律。
考拉悠然的技术路线,是以“世界模型+智能体+场景复制”回应这一技术转折。底层是悠然无界世界模型,上层是Geek Mind极客心智具身大脑,中间由跨空间、跨任务、跨本体的“三跨”能力打通。世界模型的胜负手在于架构而非算力。不同于语言模型像“读过万卷书”的学者靠统计规律预测下一个词,世界模型要做的,是在给定当前场景与动作序列后,在“脑子里预演一遍”接下来会发生什么。这比拼的是对物理约束的建模能力。
针对长时推演中的误差累积以及面对未见环境时的分布漂移,考拉悠然团队做了针对性的双层架构设计。一是结构化4D世界建模,协同建模首帧3D场景几何与运动轨迹,为后续每一帧生成提供持续的几何与运动约束,如同给生成过程装上“定位与惯性导航”,抑制物体位置漂移与误差随时间累积。二是动态场景记忆,持续保持并更新场景的纹理、外观、布局等关键特征,防止模型在长程生成中逐渐“忘记”场景自身样子。训练策略上,采用由粗到精的两阶段模式:第一阶段利用大规模、多样化数据学习通用场景表征与运动规律;第二阶段筛选高质量数据进行精细化微调,强化几何一致性、时序连贯性与运动准确性,完成从广泛学习到精确推演的跃迁。

在Track 1赛道上,悠然无界世界模型在场景、运动与交互层面展现出高度一致的未来推演能力,有效缓解了复杂长程生成中的状态漂移、误差累积与物理失真。具体来看,它能够应对多类高难度具身任务:包括在分布外场景中保持几何与交互一致性的泛化任务,沿动作序列持续推演未来状态的长程任务,以及双臂协同与长程操作的综合挑战任务。
基于悠然无界世界模型构建的Geek Mind,已率先实现行业落地。在工业巡检领域,针对人力成本高、危险区域作业受限及人工记录难以标准化等问题,考拉悠然将Geek Mind集成于四足机器人平台,为大型央企制造车间提供巡检解决方案。其核心能力体现在三个层面:快速部署,通过预训练模型与场景自适应机制实现巡检路线的快速配置;深度推理,基于世界模型驱动的感知与推理闭环,不仅采集数据还能进行因果分析,输出可追溯的判定依据;空间无界,四足平台具备跨楼层、跨地形机动能力,覆盖人工难以抵达的高空、狭小与危险区域。
具身智能在工业场景的价值,在于构建一套可复制、可规模化的无人巡检范式。央企制造车间,正在成为这一范式最早验证的场域。随着算力成本下行、具身硬件供给趋于充足以及行业客户从看演示转向算产出,空间智能技术的竞赛才刚刚开始。考拉悠然目前握有原创架构、经国际榜单验证的世界模型底座以及一套把技术复用到多本体的“三跨”机制。真正的考验在于,跨本体泛化的上限能否在更多极端场景中保持稳定——这将决定世界模型从“能推演”走向“能干活、能复制”的速度。
