扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 汽车与机器人VLA研究:混合架构成主流、与泛世界模型融合、强化学习成为核心引擎

股市情报:上述文章报告出品方/作者:佐思汽车研究;仅供参考,投资者应独立决策并承担投资风险。

汽车与机器人VLA研究:混合架构成主流、与泛世界模型融合、强化学习成为核心引擎

时间:2026-09-03 11:29
上述文章报告出品方/作者:佐思汽车研究;仅供参考,投资者应独立决策并承担投资风险。


佐思汽研发布《2026年汽车与机器人的VLA大模型应用研究报告》。


VLA(Vision-Language-Action,视觉-语言-动作)模型是一种融合视觉、语言、动作三大模态的模型。它通过统一的多模态学习框架,将感知、推理与控制一体化,直接根据视觉输入(图像/视频)和语言指令生成可执行的物理世界动作(如机器人关节运动、车辆转向/加速/制动控制)。


VLA = VLM(理解与描述)+ E2E(端到端决策控制)+ CoT(思维链类人推理)。能力对比上,VLA同时具备精准3D感知、常识理解、逻辑思维和可解释性。


01


VLA发展现状及主要挑战


VLA在自动驾驶中的演进分为四个阶段:


  • 语言作为解释器(Pre-VLA):语言模型仅生成场景描述,不参与控制;

  • 模块化VLA:语言作为规划组件参与决策,但多阶段流程有延迟;

  • 统一端到端VLA:单次前向传播将传感器输入直接映射为动作;

  • 推理增强VLA:LLM进入控制闭环,具备长时推理、记忆、交互能力,如理想MindVLA。


落地节奏:


  • 分段式端到端已于2024-2025年规模化量产;

  • 一段式端到端与VLA在2025-2026年集中落地;

  • 2026年是智驾大模型“多路线博弈加剧、范式融合提速”的关键窗口期。


技术现状与核心指标:


  • 模型参数跨度大:英伟达Alpamayo 1.5含5亿/100亿(10B)参数;元戎启行为40B基座;千里科技StepVL基座为32B(蒸馏至7B/3.6B);理想MindVLA基座32B蒸馏为3.6B MoE,车端模型4B。

  • 车端实时性:理想通过稀疏注意力+MoE在Orin X上实现10Hz、延迟100ms;小鹏第二代VLA延迟压至80ms以内;元戎40B模型通过KV Cache、多Token预测(MTP)、量化及定制引擎,单步时延60–85ms,实现10–15Hz闭环。

  • 算力适配:元戎可在100TOPS平台部署纯驾驶VA模型,在500TOPS平台部署带逻辑推理的VLA;零跑D19搭载双高通8797芯片(1280TOPS)实现端侧VLA辅助驾驶;吉利H9采用双英伟达Thor(2000TOPS)。

  • 开环性能:基于nuScenes数据集,VLA轨迹误差明显低于世界模型(如AutoDrive-R2 70亿参数L2距离0.19m,SENNA 0.22m;世界模型最优Drive-OccWorld为0.32m),说明VLA具备复刻人类真实轨迹的能力。


主要挑战


  • 实时性与算力瓶颈:传统VLA自回归生成仅3-6Hz,单次推理普遍超200ms,车端算力/存储带宽消耗大。

  • 数据“监督赤字”:VLA输入是高维视觉,监督却是低维稀疏动作,模型潜力被浪费;需用世界模型预测未来图像提供密集监督,或改用视频预测预训练。

  • 安全冗余缺失:VLA端到端单模型容错较低,需传统算法兜底(如被广泛采用的“快慢双系统”、地平线Lite Safety Checker、博世安全门控奖励)。

  • 幻觉与长尾:复杂/未见场景成功率下降,需通过世界模型+强化学习探索来提升(如博世ExploreVLA、华为WEWA、Momenta R7)。


02


主机厂典型VLA方案


主机厂中,小鹏第二代VLA和理想MindVLA最具代表性,二者分别代表“原生多模态物理世界基座”和“空间-语言-动作统一 + 隐世界模型”两条路线。


主机厂VLA典型方案对比(小鹏 vs 理想)

来源:佐思汽研整理




小鹏第二代VLA


小鹏认为智能驾驶本质是“物理AI”问题。第二代VLA被打造成原生多模态物理世界基座模型:设计原生多模态Tokenizer,以极高效率进行早期融合,避免单一模态偏差;引入视觉推理思维链(CoT),将推理效率提升32倍,在跟车场景中自动生成“变道/跟车”等方案并生成抽象鸟瞰图打分;原生舱驾联动使模型不仅输出动作,还能生成视频和声音,成为VLA底座及世界模型、仿真、强化学习的基础框架。它基于两段式模型做参考重新训练一段式基座模型,去除了语言转译环节,使延迟压至80ms以内。


小鹏第二代VLA

来源:小鹏汽车




理想MindVLA


架构包含三部分:


  • V(空间智能):在BEV+OCC基础上采用3D Gaussian作为中间表征,利用激光雷达点云作三维几何提示,通过3D ViT编码器+前馈式3DGS进行3D场景重建,静态环境与动态物体分别建模;

  • L(语言智能):重新训练LLM基座(发采用MoE+稀疏注意力),快思考并行解码直接输出Action Token,慢思考同时输出思维链CoT+Action Token;

  • A(动作策略):采用VLA-MoE架构并内置Action Expert,通过离散扩散(Discrete Diffusion)和并行解码迭代优化,输出高精度驾驶轨迹。


工程上分四阶段:


  • VL基座预训练(32B,后蒸馏为3.6B MoE以适配双Orin-X/Thor-U)

  • 模仿学习后训练(4B)

  • 强化训练(RLHF+纯RL,构建世界模拟器闭环)

  • 司机Agent人机交互。


后续MindVLA-U1实现统一流式,语言与连续动作联合建模,引入Intent-CFG。


理想MindVLA

来源:MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving,2026年5月




其他主机厂:


  • 小米XLA认知大模型(VLM+端云一体,计划推VLA);

  • 零跑LEAP 4.0 VLA(端侧全模态,“理解-规划-预演-判断-修正”闭环);

  • 长城CP Master双VLA(左脑行车智能体、右脑座舱智能体);

  • 奇瑞猎鹰900(VLA+世界模型,支持L3)。


03


供应商典型VLA方案


供应商中,英伟达Alpamayo元戎启行40B VLA最具代表性,分别代表“推理型双LLM VLA+世界模型”和“40B统一基座三阶段VLA”方案。


供应商VLA典型方案对比(英伟达 vs 元戎启行)

来源:佐思汽研整理




英伟达 Alpamayo


英伟达Alpamayo是系统级VLA方案,包含物理AI数据集、VLA大模型和AlpaSim仿真框架。车端为车企提供三代轨迹生成选项:回归预测(TensorRT,如SparseDrive)、扩散生成(TensorRT,如DiffusionDrive)、流匹配式(TensorRT-Edge-LLM,如Alpamayo基于Qwen3 VL)。


Alpamayo-R1-10B为例:输入历史图像、用户指令、历史轨迹与噪声动作;经VLM Flow Matching Tokenizer转换为Text/Image/Trajectory Token;80亿参数Qwen3 VL-LLM负责场景理解与隐式CoT推理,输出推理文本并生成KV Cache;20亿参数Qwen3 VL-LLM接收噪声轨迹与KV Cache,通过Flow Matching逐步去噪修正,最终输出未来轨迹。云端Cosmos世界模型生成长尾场景训练,车端采用传统算法安全兜底+端到端VLA主系统,支持L2—L4。未来在Latent Space连续潜在空间推理可加速2–4倍。


英伟达Alpamayo生态

来源:英伟达




元戎启行 40B VLA


元戎启行将自动驾驶决策精细拆为三阶段:观察阶段——多摄像头视频经视觉编码转换为约1000个视觉Token;推理阶段——模型对场景深度语义分析,生成关键事件与决策逻辑描述,推理Token严格控制在10–50个;执行阶段——输出驾驶控制指令,仅需约10个Token。通过统一的40B Foundation Model集成“驾驶员(看传感器做动作)+分析师(分析因果)+评论员(评判决策)”三种能力,并用V+A、V+A→L、V→L+A三类任务联合训练,实现“先思考再开车”。预训练从“轨迹监督”改为“视频预测”,利用海量视频每一个像素学习物理规律,数据利用率从0.001%提升到100%。部署时通过KV Cache、MTP、量化及定制推理引擎把单步时延压到60–85ms,实现10–15Hz车端实时闭环;并按算力灵活蒸馏:100TOPS平台部署纯驾驶VA模型,500TOPS平台部署完整VLA。


元戎启行 40B VLA

来源:元戎启行




其他供应商:


  • 千里科技采用“VLA+E2E”协同闭环(VLA慢系统输出CoT文本,E2E快系统输出目标检测/车道检测,汇入规控;StepVL 4.0由32B预训练蒸馏至7B);

  • 轻舟智航2026升级为“VLA+世界模型+强化学习”统一架构,基于单征程6M实现城市NOA;

  • 卓驭推出VLA World Model(原生多模态基础模型、世界链Chain of World、结构-运动解耦潜运动表征)。


04


VLA发展趋势




趋势一:混合架构成主流


Diffusion + Transformer + LLM/VLM深度融合成为主流。Diffusion擅长高质量连续动作/轨迹生成,Transformer擅长长序列建模,LLM/VLM擅长语义与多模态理解。代表:理想MindVLA(3D高斯+MoE LLM+扩散动作专家)、英伟达GR00T-N1(快慢双系统:快200Hz Diffusion Action,慢10Hz VLM)、HybridVLA(自回归+扩散协同)。产业形成三种融合模式:①一段式端到端+世界模型+RL(Momenta、地平线);②VLA+世界模型(小鹏等);③E2E+基础模型VLM/VLA(千里科技VLA慢系统+E2E快系统)。




趋势二:VLA与泛世界模型融合为 World VLA / VLA World Model


VLA负责认知与动作,世界模型负责未来推演,二者统一使车辆从交通工具升级为“移动机器人”,从规则驱动迈向认知驱动,具备自主感知、推理决策、精准执行能力。卓驭VLA World Model演进到第三代原生多模态基础模型,通过世界链(Chain of World)在隐空间多步预测世界状态,实现“先想后做”;结构-运动解耦潜运动表征降低重建成本。吉利千里浩瀚融入VLA和世界模型,车辆可自动执行任务。WorldVLA将动作与图像联合理解生成,世界模型与动作模型相互增强。




趋势三:VLA + 世界模型 + 强化学习三位一体,RL成为核心引擎


行业形成“预训练→仿真→强化学习”三层架构。世界模型生成长尾场景,VLA在环内推理,RL在推演空间迭代最优策略。代表:华为WEWA 2.0(多智能体博弈+云端在线RL,训练强度提升10倍);Momenta R7(三段式:预训练→仿真→RL,让AI从“模仿者”变“决策者”);小马智行PonyWorld 2.0(自我诊断+定向进化+精度飞轮)。


同时,世界模型从像素预测走向隐空间与因果推理:英伟达Alpamayo在Latent Space隐式推理加速2–4倍,并基于因果链CoC生成完整推理链路;理想在VLA内嵌预测式隐世界模型;小鹏去掉语言转译,架构从V-L-A改为V/L-A降低信息耗损。华为DriveVLA-W0证明加入世界建模后,数据量从70万→7000万帧时碰撞率持续下降且优势被放大,数据Scaling Law被强化。




趋势四:工程化落地与安全保障加速


2025-2026年一段式端到端与VLA集中落地;L3/L4演进推动安全冗余成为刚需(传统算法兜底+端到端主系统,如英伟达快慢双系统、地平线Lite Safety Checker、博世安全门控PDMS奖励)。算力分级蒸馏成为量产关键:100-500TOPS灵活部署VA/VLA(元戎启行),双Thor/双8797等高算力平台支撑L3。


VLA正成为智能驾驶从“端到端感知-控制”走向“理解-推理-控制”的核心路径。2026年,在主机厂(小鹏、理想等)与供应商(英伟达、元戎启行、千里科技、轻舟智航等)共同推动下,VLA与世界模型、强化学习深度融合,混合架构成型,World VLA雏形已现。随着时延、算力、数据监督与安全冗余问题逐步破解,VLA将支撑L3及以上自动驾驶规模化落地,并让汽车进化为物理世界的通用智能体

股票复盘网
当前版本:V3.0