连比亚迪都开始发AI论文了!

而且不是成果平平的灌水文章。

最新公开的一篇HyWorldVLA,来自比亚迪汽车新技术研究院,瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action(VLA)+ World Model(世界模型)。

HyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩,PDMS达到 90.59。

太反差了!

过去几年,外界提到比亚迪智能化,更多想到的是“天神之眼”、供应链整合、规模化落地,当然还有今年的“兜底”。

但要让你具体callback一下,迪子有啥具体到“代码级自研”的AI技术、学术成果……一片空白。

甚至有传言比亚迪智能发布会的PPT,都是供应商帮忙做的。

但这篇论文一出,让所有人看到一个基因都完全不一样的比亚迪:

不但有自动驾驶成果,还有一支长期投入物理AI基础模型的研发团队。

HyWorldVLA想解决什么?

先说这篇论文到底在研究什么。

HyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线:

让AI从“识别道路”走向“理解世界”

因此,近几年行业开始探索端到端自动驾驶模型,模型直接从传感器输入,输出车辆控制或轨迹,而进一步的发展,就是加入世界模型(World Model)。

简单理解,世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么,还能预测未来:几秒后道路会如何变化?其他交通参与者可能如何行动?车辆应该采取什么策略?

这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。

但问题是,目前的自动驾驶世界模型仍然面临一个核心矛盾:

既想让模型理解真实世界的细节,又希望模型能够高效推理

一种方式是Pixel-level World Model,也就是直接预测未来视频画面。优势是直观,模型可以生成未来道路、车辆、环境变化。但缺点也明显:计算成本高,而且容易受到视觉噪声影响。

另一种方式是Latent World Model,也就是在压缩后的隐藏空间中预测未来。这种方法效率更高,更适合大规模模型训练。但问题是:模型可能理解了抽象关系,却丢失了真实世界细节。

HyWorldVLA提出的,就是一种混合世界模型(Hybrid World Modeling),留视觉世界模型对于环境细节的理解能力,又利用隐空间模型提升推理效率。

在此基础上,论文进一步引入Vision-Language-Action(VLA)模型,让系统不仅能够理解视觉环境,还能够结合语义信息生成驾驶动作。

把两条路的好处都拿到,同时把各自的短板规避掉,最终形成:看见环境、理解环境、预测未来、采取行动的端到端流程。

效果如何?

HyWorldVLA选择的测试平台,是当前自动驾驶研究领域较受关注的公开基准:NAVSIM v1

和传统视觉任务测试并不一样,它更关注:如果车辆真的按照AI规划路线行驶,会不会安全、高效完成驾驶任务。

因此,它采用了更接近实际驾驶质量的综合指标PDMS(Predictive Driver Model Score)。其中包括是否发生责任碰撞;是否保持在可行驶区域;是否保持合理安全距离;是否完成驾驶目标;车辆运动是否平顺舒适。

也就是说,一个模型不能靠“慢慢开”获得高分,也不能只追求速度而忽略安全,需要同时做到:安全、效率、舒适。

HyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩,达到公开结果中的领先水平

这说明:至少在公开数据集和仿真驾驶环境中,比亚迪这套基础模型具备当前自动驾驶研究前沿能力

但需要客观看待:benchmark领先,不等于已经完成量产自动驾驶。

所以,比亚迪自动驾驶大模型SOTA,更准确的意义是:

比亚迪证明了自己具备多模态、物理AI基础模型研究能力

怎么做到的?

HyWorldVLA的混合不是简单地把两条路线拼接在一起,而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。

第一步:训练一个视频压缩器

先用视频VAE把连续的视频帧压缩成紧凑的隐特征,后续模型在这个压缩空间里做预测,而不是在原始像素空间里硬扛噪声。为了提升压缩质量,编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节,显著改善了重构画面的清晰度。

第二步:预训练。 把图像、动作、语言和隐特征全部转成统一的离散token,拼成一个长序列,用自回归的方式让模型学会预测下一个token是什么。

这个阶段的关键设计是“两条腿走路”——模型同时做两件事:预测未来画面的token,以及预测未来隐特征。画面token预测相当于一个“监工”,逼迫隐空间必须保留足够的信息才能还原出清晰的画面,防止表征在学习过程中变得空洞无用。

第三步:联合微调。 到了这一步,模型不再预测画面,只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。

论文验证了两种动作模块——一种是从候选轨迹里打分选最优,一种是用生成模型直接输出连续轨迹——两者都有提升,说明这套方法的增益不依赖特定的动作设计。

那SOTA到底靠什么赢的?消融实验给出了答案。

最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间,PDMS从90.59掉到87.50——这是所有消融里跌幅最大的,说明像素级的精细监督对整体表现至关重要。反过来,去掉隐空间、只保留像素级模型,PDMS也掉到89.91。两条路线谁都不能少,单靠一条都到不了90.59。

隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征(λ₃=0),PDMS只有90.17;给一个适中的权重(λ₃=0.1),达到最优90.59;权重继续加大反而掉到89.75。这说明:适度约束能防止预训练学到的语义在微调中被冲掉,但约束太强又会束缚模型自己去发现对开车最有用的表征。

噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65,DriveVLA-W0也只有61.18;HyWorldVLA达到86.87。这个差距说明:在恶劣天气下,在压缩空间里做推理远比在像素空间里死磕要可靠得多。

一句话总结:这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”,让它保留足够的环境信息;微调时切换到纯隐空间推理,自动获得了对雨雾光照的免疫力。

两个阶段分工明确,互不干扰,而不是让一个模型同时扛两项任务。

HyWorldVLA代表的是自动驾驶基础模型探索方向,与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势,但选择了VLA与混合世界模型结合的具体技术路径,有自己的差异化侧重。

但距离真正大规模量产部署,仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。

重新认识比亚迪AI:论文背后是一支什么样的团队?

HyWorldVLA这篇论文完全由比亚迪汽车新技术研究院(也就是原来的规划院,杨东生领导)独立完成,没有外部高校或研究机构合作署名,这在车企AI论文中不算常见。

顺着“新技术研究院”这条线,再把范围扩大到整个比亚迪关联去扩大检索,可以发现一些更完整的信息。

HyWorldVLA是比亚迪第一篇多模态基础模型论文,但不是第一篇AI论文

至少还有一篇EMoE-Planner(基于混合专家的自动驾驶规划模型),发表于2025年。

其他的论文还包括赛车轨迹优化(Global minimum time trajectory planning considering curvature and distance for track racing)、胎噪判断地形(Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle)。

但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。

而再往前,公开渠道几乎查阅不到比亚迪的AI学术论文。

这在一定程度上证明,比亚迪对于核心的AI基础模型研究,是近几年才开始做的

几个高频出现的名字,也印证了这种判断。

Liulong Ma,资料不多,github上极其低调,也没有个人主页和Google学术主页,但比亚迪汽车新技术研究院几篇公开AI论文中都有署名,而且是通讯作者

第一次出现的时间点,是2025年。

再往前,Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向,与当前Physical AI技术趋势高度重合——

他出身哈工大,而且是著名的哈工大机器人技术与系统国家重点实验室,以及哈工大机电系

从他的研究方向上推断,指导老师有可能是哈工大的赵杰教授,哈工大机器人研究所所长。

再从哈工大这条线索入手,还能够发现比亚迪AI团队更鲜明的哈工大基因

Hongbiao Zhu,前面提到的EMoE-Planner第一作者,2025年论文发表时,也隶属比亚迪汽车新技术研究院,但是他的过往履历,同样紧密关联哈工大,以及CMU

说明BYD新技术研究院的AI团队,不是单纯招聘汽车算法工程师,而是在吸收顶尖名校的计算机、机器人人才,包括哈工大、CMU,形成一个“机器人AI派”的团队

最后,总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。

第一,时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner,2026年有HyWorldVLA,中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。

这表明比亚迪内部有一个稳定运转的基础AI研究小组,而非项目制的阶段性投入

第二,学术圈露出的团队成员背景高度集中,鲜明的哈工大和CMU背景。

第三,这与比亚迪同时在推进的自研机器人项目形成了呼应。

据公开信息,比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线,本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。

比亚迪这个AI团队,和其他车企最大的不同在于,不是从汽车电子或ADAS工程延伸过来的研发路线,某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。

这是物理AI从技术出发的第一性原理,在组织架构上的反应。

所以,比亚迪发布HyWorldVLA的意义,不只是多了一篇论文。

它让外界第一次看到:这家年销量全球领先的新能源车企,正在展示过去并不显性的能力——物理AI的基础模型研发。

自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”,比亚迪显然已经认识到这一点,不过HyWorldVLA是否代表比亚迪已经进入第一梯队,还有待验证。

但至少,比亚迪是所有老牌车企中,率先摆脱“就事论事”搞智能辅助驾驶,按照AI系统能力建设团队,把研究向机器人和基础大模型推近的玩家。

最新快讯

2026年07月29日

18:27
鼓狮财经7月29日电,渤健(Biogen)第二季度营收27.4亿美元,预估24.7亿美元;调整后净利润5.362亿美元,同比下降33%;调整后每股收益3.60美元,上年同期5.47美元,预估2.89美元。
18:27
鼓狮财经7月29日电,乌克兰总统泽连斯基表示,他已请求美国总统特朗普提供紧急“冬季援助计划”,包括大量“爱国者”防空导弹拦截弹,以抵御俄罗斯对乌克兰能源基础设施的持续打击。泽连斯基称,乌克兰的“爱国者”拦截弹库存几乎耗尽,希望在冬季前获得300枚拦截弹。他透露,特朗普早前已同意由美国向乌克兰授予“爱国者”拦截弹生产许可,不过即便如此,大规模生产拦截弹仍需1至...
18:27
鼓狮财经7月29日电,据媒体29日援引伊朗高级官员的话报道,伊朗已拒绝阿曼提出的联合管理霍尔木兹海峡航运的地区机制。伊朗提出,通过海峡的船只的进出港航线中,一条须完全经过伊朗水域,另一条也须部分经过伊朗水域。
18:27
鼓狮财经7月29日电,据报道,英国央行正在评估在伦敦运营的投资银行对亚洲股票的风险敞口,以降低与少数人工智能相关公司有关的集中度风险。监管机构据悉正在评估银行如何通过英国业务,为对冲基金及其他机构的亚洲投资提供融资。受人工智能热潮推动,少数亚洲公司吸引了大量对冲基金资金流入,其中包括韩国的SK海力士和台积电。报道援引知情人士称,对部分银行而言,亚洲地区对这类...
18:27
鼓狮财经7月29日电,日本熊本县宇城市市长末松直洋当地时间29日表示,接到报告称,该市市内有两名男性因前一日发生的地震死亡。至此,此次地震遇难人数升至14人。据中国地震台网正式测定,当地时间28日16时27分(北京时间15时27分),日本九州岛发生6.8级地震,震源深度10公里。 (央视新闻)
18:07
鼓狮财经7月29日讯面对韩国股市连续两日暴跌,韩国高层密集发声。相较于韩国财长等高官极力安抚投资者并诚恳认错的态度,随总统李在明出访巴西的青瓦台政策室室长金容范(Kim Yongbeom)的表态却引发争议与不满,被斥为有“甩锅”之嫌。 针对近期韩股大幅下挫,金容范认为当前无须采取 “股市稳定措施”,并将当前的行情定性为市场寻找均衡点的"再评估过程&...
18:07
《科创板日报》7月29日讯 产能吃紧叠加原材料涨价,日韩两大MLCC供应商一同开启了新一轮涨价。 据韩国朝鲜日报今日消息,三星电机近日已向销售合作伙伴发出通知,自8月1日起,MLCC产品出货价格将在现行基础上统一上调30%。 涨价根源在于AI带来的高端MLCC需求飙升。三星电机在通知中表示,“过去几个月以来,全球电子产业出现结构性需求增长。虽然公司持续提升生...
18:06
拿下诺贝尔化学奖不到两年,AlphaFold 背后的专属研发团队散场了。 7 月 29 日,《金融时报》报道称,谷歌 DeepMind 已经拆解负责开发 AlphaFold 的专门团队。过去一年中,AlphaFold 论文的大部分原作者被重新分配至其他项目,部分人员转向 Gemini、AI 编程、基因组学、酶设计和核聚变研究,另一些人则进入...
18:06
2008年,谷歌把安卓免费“送”给全球手机厂商和开发者。通过统一的软硬件接口,改变了应用分发、数据和服务的价值排序。 掌握“灵魂”定义权的玩家,最终攫取了硬件的核心价值。沿着类似的产业逻辑,具身智能也在开源“赚钱”的道路上狂奔。  资源雄厚的大厂是显眼的风向标。 7月8日,蚂蚁集团旗下蚂蚁灵波科技宣布全面开源具身基...
18:06
从2026年3月崔添翼加入DeepSeek开始组建Harness团队到今天,憋了5个月,DeepSeek的Harness工具这回真的要来了? 一张截图在各大AI社区流传,内容是DeepSeek Harness的内部测试招募通知。 按照截图的说法,Harness计划于本周晚些时候开启内测,首批用户从小范围群组中筛选,入选者需要提交个...