连比亚迪都开始发AI论文了!

而且不是成果平平的灌水文章。

最新公开的一篇HyWorldVLA,来自比亚迪汽车新技术研究院,瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action(VLA)+ World Model(世界模型)。

HyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩,PDMS达到 90.59。

太反差了!

过去几年,外界提到比亚迪智能化,更多想到的是“天神之眼”、供应链整合、规模化落地,当然还有今年的“兜底”。

但要让你具体callback一下,迪子有啥具体到“代码级自研”的AI技术、学术成果……一片空白。

甚至有传言比亚迪智能发布会的PPT,都是供应商帮忙做的。

但这篇论文一出,让所有人看到一个基因都完全不一样的比亚迪:

不但有自动驾驶成果,还有一支长期投入物理AI基础模型的研发团队。

HyWorldVLA想解决什么?

先说这篇论文到底在研究什么。

HyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线:

让AI从“识别道路”走向“理解世界”

因此,近几年行业开始探索端到端自动驾驶模型,模型直接从传感器输入,输出车辆控制或轨迹,而进一步的发展,就是加入世界模型(World Model)。

简单理解,世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么,还能预测未来:几秒后道路会如何变化?其他交通参与者可能如何行动?车辆应该采取什么策略?

这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。

但问题是,目前的自动驾驶世界模型仍然面临一个核心矛盾:

既想让模型理解真实世界的细节,又希望模型能够高效推理

一种方式是Pixel-level World Model,也就是直接预测未来视频画面。优势是直观,模型可以生成未来道路、车辆、环境变化。但缺点也明显:计算成本高,而且容易受到视觉噪声影响。

另一种方式是Latent World Model,也就是在压缩后的隐藏空间中预测未来。这种方法效率更高,更适合大规模模型训练。但问题是:模型可能理解了抽象关系,却丢失了真实世界细节。

HyWorldVLA提出的,就是一种混合世界模型(Hybrid World Modeling),留视觉世界模型对于环境细节的理解能力,又利用隐空间模型提升推理效率。

在此基础上,论文进一步引入Vision-Language-Action(VLA)模型,让系统不仅能够理解视觉环境,还能够结合语义信息生成驾驶动作。

把两条路的好处都拿到,同时把各自的短板规避掉,最终形成:看见环境、理解环境、预测未来、采取行动的端到端流程。

效果如何?

HyWorldVLA选择的测试平台,是当前自动驾驶研究领域较受关注的公开基准:NAVSIM v1

和传统视觉任务测试并不一样,它更关注:如果车辆真的按照AI规划路线行驶,会不会安全、高效完成驾驶任务。

因此,它采用了更接近实际驾驶质量的综合指标PDMS(Predictive Driver Model Score)。其中包括是否发生责任碰撞;是否保持在可行驶区域;是否保持合理安全距离;是否完成驾驶目标;车辆运动是否平顺舒适。

也就是说,一个模型不能靠“慢慢开”获得高分,也不能只追求速度而忽略安全,需要同时做到:安全、效率、舒适。

HyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩,达到公开结果中的领先水平

这说明:至少在公开数据集和仿真驾驶环境中,比亚迪这套基础模型具备当前自动驾驶研究前沿能力

但需要客观看待:benchmark领先,不等于已经完成量产自动驾驶。

所以,比亚迪自动驾驶大模型SOTA,更准确的意义是:

比亚迪证明了自己具备多模态、物理AI基础模型研究能力

怎么做到的?

HyWorldVLA的混合不是简单地把两条路线拼接在一起,而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。

第一步:训练一个视频压缩器

先用视频VAE把连续的视频帧压缩成紧凑的隐特征,后续模型在这个压缩空间里做预测,而不是在原始像素空间里硬扛噪声。为了提升压缩质量,编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节,显著改善了重构画面的清晰度。

第二步:预训练。 把图像、动作、语言和隐特征全部转成统一的离散token,拼成一个长序列,用自回归的方式让模型学会预测下一个token是什么。

这个阶段的关键设计是“两条腿走路”——模型同时做两件事:预测未来画面的token,以及预测未来隐特征。画面token预测相当于一个“监工”,逼迫隐空间必须保留足够的信息才能还原出清晰的画面,防止表征在学习过程中变得空洞无用。

第三步:联合微调。 到了这一步,模型不再预测画面,只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。

论文验证了两种动作模块——一种是从候选轨迹里打分选最优,一种是用生成模型直接输出连续轨迹——两者都有提升,说明这套方法的增益不依赖特定的动作设计。

那SOTA到底靠什么赢的?消融实验给出了答案。

最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间,PDMS从90.59掉到87.50——这是所有消融里跌幅最大的,说明像素级的精细监督对整体表现至关重要。反过来,去掉隐空间、只保留像素级模型,PDMS也掉到89.91。两条路线谁都不能少,单靠一条都到不了90.59。

隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征(λ₃=0),PDMS只有90.17;给一个适中的权重(λ₃=0.1),达到最优90.59;权重继续加大反而掉到89.75。这说明:适度约束能防止预训练学到的语义在微调中被冲掉,但约束太强又会束缚模型自己去发现对开车最有用的表征。

噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65,DriveVLA-W0也只有61.18;HyWorldVLA达到86.87。这个差距说明:在恶劣天气下,在压缩空间里做推理远比在像素空间里死磕要可靠得多。

一句话总结:这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”,让它保留足够的环境信息;微调时切换到纯隐空间推理,自动获得了对雨雾光照的免疫力。

两个阶段分工明确,互不干扰,而不是让一个模型同时扛两项任务。

HyWorldVLA代表的是自动驾驶基础模型探索方向,与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势,但选择了VLA与混合世界模型结合的具体技术路径,有自己的差异化侧重。

但距离真正大规模量产部署,仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。

重新认识比亚迪AI:论文背后是一支什么样的团队?

HyWorldVLA这篇论文完全由比亚迪汽车新技术研究院(也就是原来的规划院,杨东生领导)独立完成,没有外部高校或研究机构合作署名,这在车企AI论文中不算常见。

顺着“新技术研究院”这条线,再把范围扩大到整个比亚迪关联去扩大检索,可以发现一些更完整的信息。

HyWorldVLA是比亚迪第一篇多模态基础模型论文,但不是第一篇AI论文

至少还有一篇EMoE-Planner(基于混合专家的自动驾驶规划模型),发表于2025年。

其他的论文还包括赛车轨迹优化(Global minimum time trajectory planning considering curvature and distance for track racing)、胎噪判断地形(Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle)。

但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。

而再往前,公开渠道几乎查阅不到比亚迪的AI学术论文。

这在一定程度上证明,比亚迪对于核心的AI基础模型研究,是近几年才开始做的

几个高频出现的名字,也印证了这种判断。

Liulong Ma,资料不多,github上极其低调,也没有个人主页和Google学术主页,但比亚迪汽车新技术研究院几篇公开AI论文中都有署名,而且是通讯作者

第一次出现的时间点,是2025年。

再往前,Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向,与当前Physical AI技术趋势高度重合——

他出身哈工大,而且是著名的哈工大机器人技术与系统国家重点实验室,以及哈工大机电系

从他的研究方向上推断,指导老师有可能是哈工大的赵杰教授,哈工大机器人研究所所长。

再从哈工大这条线索入手,还能够发现比亚迪AI团队更鲜明的哈工大基因

Hongbiao Zhu,前面提到的EMoE-Planner第一作者,2025年论文发表时,也隶属比亚迪汽车新技术研究院,但是他的过往履历,同样紧密关联哈工大,以及CMU

说明BYD新技术研究院的AI团队,不是单纯招聘汽车算法工程师,而是在吸收顶尖名校的计算机、机器人人才,包括哈工大、CMU,形成一个“机器人AI派”的团队

最后,总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。

第一,时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner,2026年有HyWorldVLA,中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。

这表明比亚迪内部有一个稳定运转的基础AI研究小组,而非项目制的阶段性投入

第二,学术圈露出的团队成员背景高度集中,鲜明的哈工大和CMU背景。

第三,这与比亚迪同时在推进的自研机器人项目形成了呼应。

据公开信息,比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线,本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。

比亚迪这个AI团队,和其他车企最大的不同在于,不是从汽车电子或ADAS工程延伸过来的研发路线,某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。

这是物理AI从技术出发的第一性原理,在组织架构上的反应。

所以,比亚迪发布HyWorldVLA的意义,不只是多了一篇论文。

它让外界第一次看到:这家年销量全球领先的新能源车企,正在展示过去并不显性的能力——物理AI的基础模型研发。

自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”,比亚迪显然已经认识到这一点,不过HyWorldVLA是否代表比亚迪已经进入第一梯队,还有待验证。

但至少,比亚迪是所有老牌车企中,率先摆脱“就事论事”搞智能辅助驾驶,按照AI系统能力建设团队,把研究向机器人和基础大模型推近的玩家。

最新快讯

2026年07月29日

19:13
近日,智元发布了全球首 个机器人武侠 IP“远征A3·绝世高手之武林高手”,武术动作明星樊少皇、张蓝心真人上阵,与远征 A3 展开了一场激烈的武术人机实战。远征 A3攻防进退、见招拆招,以“以柔克刚,唯快不破”的武道内核,具象化呈现智元 AI 大脑的自主决策能力与本体的卓 越运动控制能力。全新上线的第二季《远征A3·绝世高手之武林高手》,跳...
19:13
据报道,新一代豆包手机把备货量从3万台提升到数十万台,上一代最受关注的GUI能力却被收了回来。新产品将不再读取屏幕、模拟点击微信、淘宝和支付宝等头部应用;只有应用主动提供MCP服务、开放相应数据和操作权限后,豆包手机才能接入。 在豆包调整路线前后,Agent手机集中走向台前。 7月13日,阶跃星辰发布STEPX Neo、智能体操...
18:42
7月28日,通用具身基础模型公司智在无界BeingBeyond正式发布Being-H0.8——全球*隐式触觉世界动作模型。Being-H0.8首次将触觉模态引入大规模模型预训练,并将视觉、触觉、动作以及未来状态变化统一到同一隐空间(latent space)。这使机器人不仅能够理解“看到了什么、做了什么、接触到了什么”,还能够进一步理解“世...
18:42
鼓狮财经7月29日讯美东时间周二,美国Meta创始人马克·扎克伯格在接受媒体采访时表示,美国政府不应为了在AI竞赛中占据优势而禁止中国AI模型,并警告称,美国前沿实验室可能通过“控制监管力量”的方式来扼杀本土竞争。 抹黑制裁中国企业并非解决方案 美东时间周二,扎克伯格公开参与了华盛顿以及人工智能领域主要企业之间一场激烈的辩论,讨论美国应如何监管这一快速发展的...
18:42
鼓狮财经7月29日讯在持续数月强势领涨后,美股市场AI行情近期迎来剧烈反转,大量过度集中的头寸集中了结,芯片板块成为调仓重灾区。 据媒体报道,本月,瑞银美股一篮子AI受益股相对受AI冲击标的组合跑输42个百分点,创历史记录。 注: 橙色柱为瑞银一篮子美股AI受益股相对AI冲击标的收益差;黑色柱为欧洲市场的对应组合收益差 动量剧烈回调 业内指出,动量交易自今...
18:42
一篇讨论工业革命的历史论文里,要是突然出现这样一句话:“马达加斯加紫色自行车对着天花板低语。”——大多数人肯定会觉得,这简直是胡言乱语。 然而,美国一所大学的 32 名学生,却把这些内容原封不动地交了上去,因为:他们根本没有写论文,而是直接把考试题目丢给了AI,再把 AI 生成的答案一键复制提交,连最...
18:42
在最新的一次深度对话中,OpenAI CEO Sam Altman围绕AGI、算力需求、权力集中、人机关系以及OpenAI的发展历程,展开了长达近一小时的坦诚分享。从“算力将成为史上最稀缺的商品”到“我每天都害怕权力集中”,他的观点既宏大又具体。 以下是对话全文整理: 重新聚焦:过去一年是痛苦的,但未来12个月将是最好的 Sa...
18:42
周三,韩国综合指数收报5663点,SK海力士收报140.1万韩元。据悉,曾在韩国综合指数处于7700点高位时(7月8日),通过将SK海力士目标价下调至185万韩元(当时海力士价格为232.9万韩元),从而精准预言了韩国综合指数此后暴跌的韩国本土券商——BNK投资证券,今日再度将SK海力士的目标价大幅下调至148万韩元。要知道,在韩国证券界,券商几乎不可能直接...
18:42
7月29日,南下资金净卖出港股55.89亿港元。其中净买入阿里巴巴13.26亿、腾讯8.31亿、智谱4.91亿、兆易创新3.51亿;净卖出中芯国际20.08亿、小米集团19.47亿、美团6.35亿、长飞光纤光缆2.8亿、建滔积层板1.71亿。据统计,南下资金已连续6日净卖出长飞光纤光缆,共计22.6831亿港元;连续3日净卖出中芯国际,共计33.8856亿港...
18:27
鼓狮财经7月29日电,渤健(Biogen)第二季度营收27.4亿美元,预估24.7亿美元;调整后净利润5.362亿美元,同比下降33%;调整后每股收益3.60美元,上年同期5.47美元,预估2.89美元。
18:27
鼓狮财经7月29日电,乌克兰总统泽连斯基表示,他已请求美国总统特朗普提供紧急“冬季援助计划”,包括大量“爱国者”防空导弹拦截弹,以抵御俄罗斯对乌克兰能源基础设施的持续打击。泽连斯基称,乌克兰的“爱国者”拦截弹库存几乎耗尽,希望在冬季前获得300枚拦截弹。他透露,特朗普早前已同意由美国向乌克兰授予“爱国者”拦截弹生产许可,不过即便如此,大规模生产拦截弹仍需1至...