佐思汽研发布《2026年汽车与机器人的VLA大模型应用研究报告》。
VLA(Vision-Language-Action,视觉-语言-动作)模型是一种融合视觉、语言、动作三大模态的模型。它通过统一的多模态学习框架,将感知、推理与控制一体化,直接根据视觉输入(图像/视频)和语言指令生成可执行的物理世界动作(如机器人关节运动、车辆转向/加速/制动控制)。
VLA = VLM(理解与描述)+ E2E(端到端决策控制)+ CoT(思维链类人推理)。能力对比上,VLA同时具备精准3D感知、常识理解、逻辑思维和可解释性。
01
VLA发展现状及主要挑战
VLA在自动驾驶中的演进分为四个阶段:
语言作为解释器(Pre-VLA):语言模型仅生成场景描述,不参与控制;
模块化VLA:语言作为规划组件参与决策,但多阶段流程有延迟;
统一端到端VLA:单次前向传播将传感器输入直接映射为动作;
推理增强VLA:LLM进入控制闭环,具备长时推理、记忆、交互能力,如理想MindVLA。
落地节奏:
分段式端到端已于2024-2025年规模化量产;
一段式端到端与VLA在2025-2026年集中落地;
2026年是智驾大模型“多路线博弈加剧、范式融合提速”的关键窗口期。
技术现状与核心指标:
模型参数跨度大:英伟达Alpamayo 1.5含5亿/100亿(10B)参数;元戎启行为40B基座;千里科技StepVL基座为32B(蒸馏至7B/3.6B);理想MindVLA基座32B蒸馏为3.6B MoE,车端模型4B。
车端实时性:理想通过稀疏注意力+MoE在Orin X上实现10Hz、延迟100ms;小鹏第二代VLA延迟压至80ms以内;元戎40B模型通过KV Cache、多Token预测(MTP)、量化及定制引擎,单步时延60–85ms,实现10–15Hz闭环。
算力适配:元戎可在100TOPS平台部署纯驾驶VA模型,在500TOPS平台部署带逻辑推理的VLA;零跑D19搭载双高通8797芯片(1280TOPS)实现端侧VLA辅助驾驶;吉利H9采用双英伟达Thor(2000TOPS)。
开环性能:基于nuScenes数据集,VLA轨迹误差明显低于世界模型(如AutoDrive-R2 70亿参数L2距离0.19m,SENNA 0.22m;世界模型最优Drive-OccWorld为0.32m),说明VLA具备复刻人类真实轨迹的能力。
主要挑战
实时性与算力瓶颈:传统VLA自回归生成仅3-6Hz,单次推理普遍超200ms,车端算力/存储带宽消耗大。
数据“监督赤字”:VLA输入是高维视觉,监督却是低维稀疏动作,模型潜力被浪费;需用世界模型预测未来图像提供密集监督,或改用视频预测预训练。
安全冗余缺失:VLA端到端单模型容错较低,需传统算法兜底(如被广泛采用的“快慢双系统”、地平线Lite Safety Checker、博世安全门控奖励)。
幻觉与长尾:复杂/未见场景成功率下降,需通过世界模型+强化学习探索来提升(如博世ExploreVLA、华为WEWA、Momenta R7)。
02
主机厂典型VLA方案
主机厂中,小鹏第二代VLA和理想MindVLA最具代表性,二者分别代表“原生多模态物理世界基座”和“空间-语言-动作统一 + 隐世界模型”两条路线。
主机厂VLA典型方案对比(小鹏 vs 理想)

来源:佐思汽研整理
小鹏第二代VLA
小鹏认为智能驾驶本质是“物理AI”问题。第二代VLA被打造成原生多模态物理世界基座模型:设计原生多模态Tokenizer,以极高效率进行早期融合,避免单一模态偏差;引入视觉推理思维链(CoT),将推理效率提升32倍,在跟车场景中自动生成“变道/跟车”等方案并生成抽象鸟瞰图打分;原生舱驾联动使模型不仅输出动作,还能生成视频和声音,成为VLA底座及世界模型、仿真、强化学习的基础框架。它基于两段式模型做参考重新训练一段式基座模型,去除了语言转译环节,使延迟压至80ms以内。
小鹏第二代VLA

来源:小鹏汽车
理想MindVLA
架构包含三部分:
V(空间智能):在BEV+OCC基础上采用3D Gaussian作为中间表征,利用激光雷达点云作三维几何提示,通过3D ViT编码器+前馈式3DGS进行3D场景重建,静态环境与动态物体分别建模;
L(语言智能):重新训练LLM基座(发采用MoE+稀疏注意力),快思考并行解码直接输出Action Token,慢思考同时输出思维链CoT+Action Token;
A(动作策略):采用VLA-MoE架构并内置Action Expert,通过离散扩散(Discrete Diffusion)和并行解码迭代优化,输出高精度驾驶轨迹。
工程上分四阶段:
VL基座预训练(32B,后蒸馏为3.6B MoE以适配双Orin-X/Thor-U)
模仿学习后训练(4B)
强化训练(RLHF+纯RL,构建世界模拟器闭环)
司机Agent人机交互。
后续MindVLA-U1实现统一流式,语言与连续动作联合建模,引入Intent-CFG。
理想MindVLA

来源:MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving,2026年5月
其他主机厂:
小米XLA认知大模型(VLM+端云一体,计划推VLA);
零跑LEAP 4.0 VLA(端侧全模态,“理解-规划-预演-判断-修正”闭环);
长城CP Master双VLA(左脑行车智能体、右脑座舱智能体);
奇瑞猎鹰900(VLA+世界模型,支持L3)。
03
供应商典型VLA方案
供应商中,英伟达Alpamayo和元戎启行40B VLA最具代表性,分别代表“推理型双LLM VLA+世界模型”和“40B统一基座三阶段VLA”方案。
供应商VLA典型方案对比(英伟达 vs 元戎启行)

来源:佐思汽研整理
英伟达 Alpamayo
英伟达Alpamayo是系统级VLA方案,包含物理AI数据集、VLA大模型和AlpaSim仿真框架。车端为车企提供三代轨迹生成选项:回归预测(TensorRT,如SparseDrive)、扩散生成(TensorRT,如DiffusionDrive)、流匹配式(TensorRT-Edge-LLM,如Alpamayo基于Qwen3 VL)。
以Alpamayo-R1-10B为例:输入历史图像、用户指令、历史轨迹与噪声动作;经VLM Flow Matching Tokenizer转换为Text/Image/Trajectory Token;80亿参数Qwen3 VL-LLM负责场景理解与隐式CoT推理,输出推理文本并生成KV Cache;20亿参数Qwen3 VL-LLM接收噪声轨迹与KV Cache,通过Flow Matching逐步去噪修正,最终输出未来轨迹。云端Cosmos世界模型生成长尾场景训练,车端采用传统算法安全兜底+端到端VLA主系统,支持L2—L4。未来在Latent Space连续潜在空间推理可加速2–4倍。
英伟达Alpamayo生态

来源:英伟达
元戎启行 40B VLA
元戎启行将自动驾驶决策精细拆为三阶段:观察阶段——多摄像头视频经视觉编码转换为约1000个视觉Token;推理阶段——模型对场景深度语义分析,生成关键事件与决策逻辑描述,推理Token严格控制在10–50个;执行阶段——输出驾驶控制指令,仅需约10个Token。通过统一的40B Foundation Model集成“驾驶员(看传感器做动作)+分析师(分析因果)+评论员(评判决策)”三种能力,并用V+A、V+A→L、V→L+A三类任务联合训练,实现“先思考再开车”。预训练从“轨迹监督”改为“视频预测”,利用海量视频每一个像素学习物理规律,数据利用率从0.001%提升到100%。部署时通过KV Cache、MTP、量化及定制推理引擎把单步时延压到60–85ms,实现10–15Hz车端实时闭环;并按算力灵活蒸馏:100TOPS平台部署纯驾驶VA模型,500TOPS平台部署完整VLA。
元戎启行 40B VLA

来源:元戎启行
其他供应商:
千里科技采用“VLA+E2E”协同闭环(VLA慢系统输出CoT文本,E2E快系统输出目标检测/车道检测,汇入规控;StepVL 4.0由32B预训练蒸馏至7B);
轻舟智航2026升级为“VLA+世界模型+强化学习”统一架构,基于单征程6M实现城市NOA;
卓驭推出VLA World Model(原生多模态基础模型、世界链Chain of World、结构-运动解耦潜运动表征)。
04
VLA发展趋势
趋势一:混合架构成主流
Diffusion + Transformer + LLM/VLM深度融合成为主流。Diffusion擅长高质量连续动作/轨迹生成,Transformer擅长长序列建模,LLM/VLM擅长语义与多模态理解。代表:理想MindVLA(3D高斯+MoE LLM+扩散动作专家)、英伟达GR00T-N1(快慢双系统:快200Hz Diffusion Action,慢10Hz VLM)、HybridVLA(自回归+扩散协同)。产业形成三种融合模式:①一段式端到端+世界模型+RL(Momenta、地平线);②VLA+世界模型(小鹏等);③E2E+基础模型VLM/VLA(千里科技VLA慢系统+E2E快系统)。
趋势二:VLA与泛世界模型融合为 World VLA / VLA World Model
VLA负责认知与动作,世界模型负责未来推演,二者统一使车辆从交通工具升级为“移动机器人”,从规则驱动迈向认知驱动,具备自主感知、推理决策、精准执行能力。卓驭VLA World Model演进到第三代原生多模态基础模型,通过世界链(Chain of World)在隐空间多步预测世界状态,实现“先想后做”;结构-运动解耦潜运动表征降低重建成本。吉利千里浩瀚融入VLA和世界模型,车辆可自动执行任务。WorldVLA将动作与图像联合理解生成,世界模型与动作模型相互增强。
趋势三:VLA + 世界模型 + 强化学习三位一体,RL成为核心引擎
行业形成“预训练→仿真→强化学习”三层架构。世界模型生成长尾场景,VLA在环内推理,RL在推演空间迭代最优策略。代表:华为WEWA 2.0(多智能体博弈+云端在线RL,训练强度提升10倍);Momenta R7(三段式:预训练→仿真→RL,让AI从“模仿者”变“决策者”);小马智行PonyWorld 2.0(自我诊断+定向进化+精度飞轮)。
同时,世界模型从像素预测走向隐空间与因果推理:英伟达Alpamayo在Latent Space隐式推理加速2–4倍,并基于因果链CoC生成完整推理链路;理想在VLA内嵌预测式隐世界模型;小鹏去掉语言转译,架构从V-L-A改为V/L-A降低信息耗损。华为DriveVLA-W0证明加入世界建模后,数据量从70万→7000万帧时碰撞率持续下降且优势被放大,数据Scaling Law被强化。
趋势四:工程化落地与安全保障加速
2025-2026年一段式端到端与VLA集中落地;L3/L4演进推动安全冗余成为刚需(传统算法兜底+端到端主系统,如英伟达快慢双系统、地平线Lite Safety Checker、博世安全门控PDMS奖励)。算力分级蒸馏成为量产关键:100-500TOPS灵活部署VA/VLA(元戎启行),双Thor/双8797等高算力平台支撑L3。
VLA正成为智能驾驶从“端到端感知-控制”走向“理解-推理-控制”的核心路径。2026年,在主机厂(小鹏、理想等)与供应商(英伟达、元戎启行、千里科技、轻舟智航等)共同推动下,VLA与世界模型、强化学习深度融合,混合架构成型,World VLA雏形已现。随着时延、算力、数据监督与安全冗余问题逐步破解,VLA将支撑L3及以上自动驾驶规模化落地,并让汽车进化为物理世界的通用智能体


VIP复盘网