扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 世界模型能落地么?世界模型推理延迟分析

股市情报:上述文章报告出品方/作者:佐思汽车研究;仅供参考,投资者应独立决策并承担投资风险。

世界模型能落地么?世界模型推理延迟分析

时间:2026-09-14 13:45
上述文章报告出品方/作者:佐思汽车研究;仅供参考,投资者应独立决策并承担投资风险。


世界模型用在自动驾驶领域需要增加一个Action Expert(实际就是解码阶段),也就是WAM。


三种世界模型对比

图片来源:论文《Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future》


世界模型再分为基于像素的、基于占用网络的和基于潜空间的三大类。动作专家主要也分三大类,一是基于扩散,二是基于flow matching,三是基于MLP的。


与常见的AI应用不同,自动驾驶和机器人在大模型推理时每次只有一个样本量,只有一个请求,也就是说其批处理规模batch size=1,这就意味着GPU/NPU的利用率很低,因为GPU/NPU是并行处理结构,batch size越高,吞吐量就越高,利用率就越高。batch size=1意味着几乎变成了串行结构,GPU/NPU的并行处理能力完全没法显示。


英伟达开源自动驾驶模型Alpamayo R1的推理Runtime分析

图片来源:论文《Latency Analysis and Optimization of Alpamayo 1 via Effcient Trajectory Generation》


无论是VLA还是WAM,其推理runtime基本都是上面的四个部分,首先是输入数据的预处理即编码,这部分很少有人提及,它主要包括图像tokenizer分词化,输入文本提示词的分词化,还有自车轨迹的分词化,这里的text prompt实际就是导航指令,从A点到B点的语音输入再转换为文本。这些分词化实际是矢量嵌入,它不是深度神经网络,一般都由CPU而非NPU负责。第二部分是推理。第三部分是动作生成也就是动作专家。第四部分是后处理,将动作token转换为waypiont,同时为了让乘客理解自动驾驶,将动作token转换文字或语音提示车辆的下一个动作。第四部分也是由CPU完成,而非NPU或GPU。


绝大部分论文都不考虑实际落地,因为论文就是前瞻性研究,但也有例外。我找了几篇对世界模型自动驾驶推理延迟分析的论文,第一篇是英伟达联合UT奥斯汀和斯坦福大学的《Latent Chain-of-Thought World Modeling for End-to-End Autonomous Driving》,11位作者中10位都来自英伟达。论文提出了Latent-CoT-Drive (LCDrive) 模型,与依赖文本思维链不同,LCDrive 通过基于学习的潜世界模型 (LWM) 的向量空间监督思维链tokens进行推理,该方法通过在动作对齐的潜空间中表示思维链推理和决策,从而统一两者。该模型不使用自然语言,而是通过交替使用以下两种tokens进行推理:(1)动作提议tokens,这些tokens使用与模型输出动作相同的词汇;(2)世界模型tokens,这些tokens基于学习的潜世界模型,并表达这些动作的未来结果。通过监督模型的动作提议和世界模型tokens,并基于场景的真实未来演变轨迹,对潜思维链进行冷启动训练。


Latent-CoT-Drive (LCDrive) 模型架构

图片来源:论文《Latent Chain-of-Thought World Modeling for End-to-End Autonomous Driving》


LCDrive模型架构表明实际就是用VLA增强世界模型。英伟达选择了Qwen-0.5B的VLM,参数最少,只有5亿,选择了DINOv2做视频的分词化tokenizer。输入摄像头只有两个,一个宽FOV 120度,一个30度,分辨率为320*512。


图片来源:论文《Latent Chain-of-Thought World Modeling for End-to-End Autonomous Driving》


AR1即文本型思维链,是对比基线,英伟达使用RTX A5000专业显卡推理,价格大概是2.1-2.2万人民币。这里的wall-clock就是墙钟,Wall time(也称为clock time 或real time)和Real time 意义相同,都是指程序从开始执行到结束所花费的时间,包括了CPU/GPU 时间和与CPU /GPU时间无关的时间。可以看出轻量级的LCDrive都需要2.2秒,这个显然无法落地,自动驾驶最低下限是10Hz,也就是200毫秒。如果是高速场景,最低下限是20Hz,也就是100毫秒。这里英伟达特别点出batch size为1,这也是为何推理速度慢的主要原因。


NVIDIA RTXTM A5000

图片来源:NVIDIA


RTX A5000专业显卡性能算力不高,只有222TOPS,但是其存储带宽很高,有768GB/s,是英伟达Thor-U存储带宽的2.8倍。比英伟达Orin-X实际要高,英伟达Orin-X的AI算力分三部分,一是DLA,二是CUDA核心,三是Tensor核心。DLA是一个外设,是Devices,不可编程,它只能做卷积运算。而LLM/VLM/VLA时代,从头到尾都是transformer架构,根本没有DLA用武之地,LLM/VLM/VLA时代英伟达Orin-X的稀疏算力值只有167TOPS。


第二篇论文是华中科技大学和东风汽车研究中心的《SimWAM: A Simple World Action Model for End-to-End Autonomous Driving》。


图片来源:论文《SimWAM: A Simple World Action Model for End-to-End Autonomous Driving》


上图中的“Ours”即SimWAM,这里使用的是英伟达的单张A100显卡,A100自2019年推出,直到今天还是卖得很好,并且估计再热卖5年不成问题。目前的价格大约是8-10万人民币。纵轴的PDMS可以简单理解为自动驾驶性能得分,SimWAM最好的成绩同时延迟最低,但即便是最低延迟也在400毫秒之上,达不到市区NOA的10Hz下限。


NVIDIA  A100  Tensor Core GPU

图片来源:NVIDIA


英伟达A100的算力就强很多,INT8稀疏模式下是1248TOPS,存储带宽也非常高。


输入分辨率和取样步数对延迟的影响

数据来源:论文《SimWAM: A Simple World Action Model for End-to-End Autonomous Driving》


上图可以看出,分辨率对延迟影响很小,对性能影响也很小,取样步数对延迟影响很大,但取样步数至少要有5步,1步的性能得分太低。5步以上则性能差异不大,当然延迟会大幅度增加。


第三篇论文《Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving》,作者主要是北航AI学院和上海交通大学以及极佳科技,还有中国电信研究院。


Drive-HWM提出的快慢两种世界模型

图片来源:论文《Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving》


Drive-HWM提出了快慢两种世界模型。慢世界模型使用光流做动态监督,使用META的VL-JEPA做骨干,小鹏和零跑也是使用V-JEPA做骨干,使用多步取样和动态潜空间感知。快世界模型使用北京智源的EMU3,参数是80亿,采用AR自回归动作专家。


Drive-HWM的延迟

图片来源:论文《Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving》


快世界模型使用自回归动作专家,无需多步取样,延迟达到81.6毫秒,DriveVLA-W0则是华为的模型,用世界模型增强VLA,骨干也是80亿参数的EMU3,PDMS得分高达93.8,是目前最强的世界模型。看起来达到10Hz的最低下限,不过这是用英伟达H200取得的。H200价格是22-27万人民币之间。


NVIDIA H200

图片来源: NVIDIA


H200的INT8稀疏算力在3300TOPS以上,存储带宽高达4.8TB/s,这个存储带宽是靠高成本的HBM取得的,成本大约1.5万美元,汽车行业显然不可能用HBM。


以上的论文都是用英文写的,受众面很窄,也不是具身智能刷榜的论文能融资,这些论文没有造假的动机,世界模型能不能落地,读者们应该已经非常清楚了。VLA延迟要比世界模型好得多,英伟达Thor-U勉强达到10Hz的下限,实际目前量产的都是传统BEV+占用网络的传统算法,世界模型都是宣传用的。

股票复盘网
当前版本:V3.0