2026年7月末,比亚迪罕见发表论文HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING,论文提出的HyWorldVLA大模型,与之对比的基线模型就是DRIVEVLA-W0,而DRIVEVLA-W0是华为汽车事业部即深圳引望智能技术和中科院自动化研究所联合提出的。
比亚迪论文的附录有大量HYWORLDVLA与DRIVEVLA-W0的对比。

图片来源:论文HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING
这里的“Ours”就是比亚迪自己的HYWORLDVLA。GT为真值,即GroundTruth。

来源:论文HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING

来源:论文HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING
显然是比亚迪的HYWORLDVLA更胜一筹,不过论文到量产隔着很长的路要走,无论是HYWORLDVLA还是DRIVEVLA-W0基本都是前瞻性研究,根本没考虑量产,其摄像头布局只有一个前方摄像头,和目前的7摄像头布局有着天壤之别。

来源:论文HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING
目前常见的VLA和世界模型的PDMS得分,DriveVLA-W0在数据及其他增强下,成绩可以提高到93.0。
传统分段端到端模型PDMS得分对比

数据来源:理想汽车论文TransDiffuser: End-to-end Trajectory Generation with Decorrelated Multi-modal Representation for Autonomous Driving
V代表视觉,L代表激光雷达。理想汽车的TransDiffuser得分已经超越了人类得分,是目前最高的94.9分,第二名的TrajHF也是理想汽车提出来的。

目前最强的VLA是AutoVLA,数据来源:论文AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning。

来源:论文HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING
比PDMS略难一点的EPDMS得分,比亚迪领先程度比较明显,传统分段式端到端得分都比较难看,ReCogDrive得分也不高。博世的ExploreVLA(在数据和其他增强下,ExploreVLA的PDMS得分有93.7)得分也不错,略低于比亚迪,排名第二。排名第三的是长安汽车和中科院自动化研究所的Latent-WAM。第四名是小米汽车和北京交通大学合作的DriveWorld-VLA。并列第四名的DreamerAD也是长安汽车和中科院自动化研究所合作的。这些说明,世界模型研发方面没有门槛,传统车厂或Tier1也可以做得很好。再有就是中科院自动化研究所的世界模型研发能力超强。

来源:论文HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING
比亚迪特别加入了比较少见的噪音鲁棒性测试,也就是雨雾恶劣天气影响,论文从 OpenScene 测试数据中收集了 655 个包含雨、雾等非均匀噪声的案例,单独建立了一组测试。显然是比亚迪遥遥领先。
世界模型分两大流派,一是基于像素的,二是基于潜(latent)隐性特征。
基于像素的世界模型参数庞大,基本上类似于WAN这种文本生成视频的模型,比较费运算资源。另外鲁棒性会差一点,但可靠性更高,绝大部分时候不会出错。
基于隐性特征的世界模型不要求模型还原完整画面,只预测经过压缩的未来特征。过滤掉纹理、亮度和局部模糊之后,模型的输出鲁棒性更好,但是有可能过滤掉重要信息,比如红绿灯和前方的刹车灯。

来源:论文HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING
比亚迪HYWORLDVLA的架构,整套框架分为视频VAE预训练、模型预训练、联合微调三大流程,搭配语言引导可学习查询Token动作专家三大配套模块,全程基于北京智源的Emu3 VLM多模态大模型作为主干。
首先文本引导视频VAE:统一图像压缩与重建底座,空间编码器完成8倍下采样提取空间特征,轻量时序编码器做4倍时序压缩,去除帧间冗余信息,输出紧凑潜特征。编码块内嵌入Flan-T5文本交叉注意力,输入驾驶场景文字描述,抑制画面拖影边缘模糊时序闪烁,大幅提升重建画面真实度;既能还原高清路面画面,又能产出干净带语义信息的隐向量,是混合建模的基础载体。
预训练阶段:像素 潜特征双重监督,这是核心点。同步执行两项预测任务,双向约束模型表征学习:视觉 token 提供细粒度约束,告诉模型车道线在哪里、道路怎么延伸、周围车辆如何运动。Latent 则尝试提炼更稳定的高层状态,告诉模型这段未来里,哪些信息真正影响规划。图像用VQ量化动作序列用FAST工具离散导航指令用Emu3分词器,统一离散Token输入序列;引入可学习查询TokenQ,作为潜特征预测载体,输入MLP网络输出未来视频潜向量;HyWorldVLA使用VLM大模型为训练视频生成简短的场景描述,更像是给视觉表征增加一层语义提示,帮助 latent 少记一些无关纹理,多保留一些道路和交通结构。
联合微调阶段:仅保留潜特征推理,适配实车部署,预训练完成后,模型不再重建完整像素画面,仅输出预测潜特征送入动作专家模块生成轨迹。1. 历史图像导航指令预测潜特征通过共享注意力层交互,提取全局驾驶上下文;2. 支持两类动作专家:流匹配生成模型和轨迹选择模型,分别对应不同损失函数。
我们再来看华为与中科院自动化研究所的DRIVEVLA-W0: WORLD MODELS AMPLIFY DATA SCALING LAW IN AUTONOMOUS DRIVING。

图片来源:DRIVEVLA-W0: WORLD MODELS AMPLIFY DATA SCALING LAW IN AUTONOMOUS DRIVING
DRIVEVLA-W0架构,为了确保广泛适用性,模型建立了两种主流 VLM 变体:
VLA (VQ):将图像量化为离散视觉 token即自回归AR世界模型,适用于 Emu3 (8B),这和比亚迪用的VLM完全相同,主要做当前场景预测。
VLA (ViT):提取连续特a即Diffusion扩散世界模型,适用于 Qwen2.5-VL (7B),主要做未来场景预测。
VLA 的输入包括语言指令、前视图像和过去动作。并将其转换为 token 序列:语言指令 (L_t):通过 VLM 自身的 native tokenizer 进行处理。之前的动作使用 FAST tokenizer 将连续的路径点轨迹转换为离散的 token 序列。
DriveVLA-W0 通过预测未来图像来监督VLA模型,这为 VLA 主干网络提供了更丰富、更直接的学习信号。

图片来源:DRIVEVLA-W0: WORLD MODELS AMPLIFY DATA SCALING LAW IN AUTONOMOUS DRIVING
DriveVLA-W0采用混合专家架构,包含80亿参数的VLA专家和5亿参数的动作专家,DriveVLA-W0更像是一个VLA模型,世界模型只是用来做监督训练VLA。
VLA和世界模型不是竞争关系,比亚迪、长安、小米和博世的研究都是用世界模型来增强VLA,VLA是核心,VLA最大不足是监督不足,而世界模型正好与之互补,未来世界模型增强VLA会是主流。
免责说明:本文观点和数据仅供参考,和实际情况可能存在偏差。本文不构成投资建议,文中所有观点、数据仅代表笔者立场,不具有任何指导、投资和决策意见


VIP复盘网