扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 【AI系列深度22期】智能驾驶VLA模型的架构范式与厂商路线

股市情报:上述文章报告出品方/作者:东吴证券,黄细里、谭行悦、杨惠冰等;仅供参考,投资者应独立决策并承担投资风险。

【AI系列深度22期】智能驾驶VLA模型的架构范式与厂商路线

时间:2026-08-08 23:18
上述文章报告出品方/作者:东吴证券,黄细里、谭行悦、杨惠冰等;仅供参考,投资者应独立决策并承担投资风险。

多模态智能的本质,是把文本、图像、音频、视频等映射进统一表示,并在此基础上完成理解、推理、生成与交互。我们认为,多模态是AI2.0“架构、任务、模态三重收敛”在模态维度的集中兑现。

我们依据“模态对齐发生在流程的哪个阶段”,将多模态的发展过程划分三阶段:2021—2023年为外挂式/组合式阶段,CLIP、Flamingo、BLIP-2、LLaVA等通过视觉编码器、投影层、Q-Former或指令微调把图像接入语言模型;2023—2024年进入原生多模态阶段,Gemini代表多模态能力从接口层前移到预训练阶段;2024年至今进入全模态Omni阶段,GPT-4o将文本、视觉和音频输入输出纳入同一实时交互闭环。

沿三阶段看,主线是对齐位置不断前移、转换损耗逐级下降。外挂式阶段工程效率高,但图像先被视觉编码器压缩再送入语言模型,细节、空间关系和时序信息存在损耗;原生阶段让文本、图像、音频、视频从训练早期共同参与表示学习,提升复杂真实任务中的泛化能力,同时显著抬高数据、训练系统和跨模态对齐门槛;Omni阶段进一步将多模态从“统一预训练”推进到“实时统一交互”,补齐听、看、说的互动性。

我们认为,Omni并非多模态发展的终点,理解与生成统一、多模态深度推理有望成为下一阶段两条核心主线。其一,理解偏重高层语义,生成需保留空间结构与纹理细节,二者存在表征冲突,业界正沿纯自回归、扩散及二者融合等范式,探索共享编码或“编码解耦、主干统一”。其二,以o1为代表的深度推理已由语言扩展至图像、视频和具身场景,但当前仍以语言思维链为主;视觉工具增强、视觉—语言交错推理、多模态潜空间推理等方向正在加速发展,以视觉表示或多模态潜变量为原生载体的推理仍处于早期阶段。

我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。

风险提示:技术迭代不及预期的风险,大模型厂商 ARR 增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险

股票复盘网
当前版本:V3.0