投资要点
投资要点:
物理AI正建立在数字AI能力外溢的基础之上,且借鉴层级正在上移。早期迁移主要发生在架构理念层面,Transformer注意力机制、BEV、端到端等方法被引入驾驶感知、轨迹预测和一体化规划;近年则开始向模型层面迁移,Waymo EMMA构建于Gemini之上,理想MindVLA、小鹏世界基座模型等车端VLA实践,均体现数字AI基础模型能力向物理AI扩展。
可迁移红利并非线性外推,而会随任务靠近真实物理世界而收窄。越偏向语义理解、规划和多模态表征,数字AI既有模型与训练范式的可复用性越强;越接近实时三维感知、接触控制、安全攸关决策和高物理闭环,直接迁移比例越低。总体看,数字AI提供能力底座,物理AI仍必须补足物理世界表征、真实数据和安全闭环。
物理AI相较数字AI的第一项系统差异在表征。文本天然离散且带语义,数字AI输入具备较强结构化基础;物理世界则由连续光子、点云、运动和接触构成,必须先被编码为可学习的三维空间表征。VectorNet、BEV Transformer、Occupancy、三维高斯等技术,本质上都是对物理世界进行模型可读表征的不同路径。
第二项差异在数据。数字AI训练语料大量沉淀在互联网中,Scaling核心是抓取、清洗和压缩已有数据;物理AI最有价值的长尾、事故和极端场景天然稀疏、昂贵且危险,单靠真实路测难以覆盖。世界模型因此被推向“数据工厂”位置,用于重建、生成和放大稀缺场景,为策略训练与安全验证提供可控环境。
第三项差异在学习范式。数字AI模仿的是互联网级人类知识,模仿上限对应超人类广度,强化学习更多承担对齐和推理增强功能;物理AI模仿对象常是平均人类司机,而安全目标要求显著超越人类,单纯模仿的上限更低。强化学习在高物理闭环任务中更像突破能力边界的关键环节,而非后置修补。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代不及预期的风险,大模型厂商 ARR 增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。


1
数字AI能力向物理AI迁移,物理闭环决定兑现质量
物理AI Physical AI通常指能够感知物理世界、并在三维空间中完成决策与行动的人工智能系统,自动驾驶是其最具代表性的落地场景之一。黄仁勋在2025年CES主题演讲中,将人工智能发展划分为感知AI、生成式AI、智能体AI与物理AI四个阶段,并提出通用机器人的ChatGPT时刻临近。
数字AI以大语言模型为代表,主要处理文本、代码、图像等数字信号;物理AI则需要在真实三维空间中感知、决策和行动。我们以智能驾驶作为切入点,复盘数字AI能力如何迁移到物理AI,以及迁移过程中哪些环节仍需重构。
1.1
从架构理念到模型层迁移:借鉴层级持续上移
智能驾驶对数字AI的借鉴大体经历两个阶段。第一阶段以架构理念移植为主:Transformer确立的注意力机制与序列建模思想被引入驾驶感知与轨迹预测,催生了矢量化表示VectorNet,Waymo,CVPR 2020,鸟瞰图BEV与Transformer结合的统一空间表征,以及以查询解码为核心的端到端一体化框架UniAD。这一阶段迁移的是建模范式,而非具体模型权重。
第二阶段进一步表现为模型层面的直接迁移。代表性工作是Waymo于2024年提出的端到端多模态驾驶模型EMMA,该模型构建在谷歌多模态大模型Gemini之上,将原始摄像头输入与文本指令映射到统一语言空间,再输出轨迹、目标检测与道路图等结果。与此同时,源自机器人领域的视觉—语言—动作 VLA范式被引入车端,例如理想汽车2025年发布的MindVLA,以及小鹏汽车2025年提出的约720亿参数世界基座模型。


1.2
越接近物理闭环,直接迁移红利越收窄
我们认为,沿着从架构理念到具体模型的借鉴层级上移,可直接复用的成果在形态上越来越完整,但其与物理世界的耦合也越来越紧密。文本、代码等数字信号与驾驶所需的三维时空信号之间存在结构性差异;越接近车辆控制、实时三维感知与安全攸关决策环节,数字AI已有成果可直接迁移的比例越低,需要针对物理世界重新设计或重新训练的部分越多。借鉴层级在上移,但越靠近物理闭环,可直接迁移的红利区间可能趋于收窄。
2
物理AI相较数字AI:表征、数据与学习范式三重差异
在共享底层技术的同时,物理AI与数字AI在输入表征、数据获取与训练范式三个方面存在系统性差异。
2.1
表征差异:物理世界表征是必经门槛
数字AI处理的文本天然是离散的、带语义的符号 token,可被模型直接读取,输入端已经具备较强结构化基础。物理世界的原始输入则是连续的光子、点云等信号,并不存在天然、通用、可被模型直接处理的物理世界符号化 tokenization 方案。
因此,智能驾驶技术演进中包含了数字AI无需经历的一段历程:将三维物理空间构建为可学习的模型底座。代表性的表征范式包括矢量化表示VectorNet、BEV与Transformer结合的鸟瞰栅格表征、占用网络Occupancy Network,以及三维高斯泼溅3D Gaussian Splatting。
我们认为,数字AI面对的是已被人类语言编码过的世界,而物理AI需要先把物理世界编码成模型可学习的表征。表征构建能力由此成为物理AI区别于数字AI的基础门槛。


2.2
数据差异:高价值数据稀疏,世界模型承担数据工厂角色
数字AI的重要红利在于训练语料已经大量沉淀在互联网中,文本、代码、图像等数据获取成本相对较低,规模化的核心动作是抓取、清洗与压缩已有数据。
物理AI最具价值的数据恰恰是长尾、极端与事故场景,而这类数据天然稀疏、采集成本高,且可能涉及安全风险。兰德公司在2016年的情景测算说明了路测里程的量级问题:以2013年美国人类驾驶的安全水平为基准,每1亿英里约1.09起致死事故;若要在95%置信度下证明自动驾驶致死率达标,在无失效情形下约需2.75亿英里无失效里程;若要将致死率估计到±20%的精度,95%置信区间,则约需88亿英里。以百辆车规模的车队计算,后者需要数百年。作为对照,谷歌自动驾驶车队在2009—2015年累计自动驾驶里程约为130万英里。
为缓解高价值数据稀疏问题,业界发展出以世界模型 World Model 生成合成数据的路径。代表性项目包括Wayve的GAIA-1与GAIA-2,英伟达面向物理AI的世界基座模型平台Cosmos,腾讯混元3D世界模型1.0,以及小鹏云端世界基座模型。


2.3
范式差异:强化学习成为物理AI关键环节
数字AI的预训练以下一词元预测为代表,本质上也是一种模仿,但其模仿对象是整个互联网上的人类知识,模仿学习可覆盖的知识边界更宽,因此该路径能够持续释放能力;强化学习与基于人类反馈的强化学习 RL/RLHF 更多承担对齐和推理能力增强角色。需要说明的是,强化学习在数字AI中的作用近年来同样上升:DeepSeek于2025年发布、并于同年9月在Nature发表的R1工作显示,纯强化学习可在不依赖监督微调的情况下激发模型推理能力;OpenAI的InstructGPT亦表明,经RLHF训练的较小模型,其输出可被更多评价者偏好于规模更大的基础模型。
物理AI,以L4级自动驾驶为代表,所模仿的对象通常是平均水平的人类司机,而其安全性目标却是显著超越人类。以Waymo披露的运营数据为例,其无人驾驶里程已累计超过1.7亿英里,与人类基准相比,涉及严重伤害及以上的碰撞减少约92%、安全气囊弹出事件减少约83%。
我们认为,当模仿对象为平均水平人类司机、而目标是大幅超越人类安全性时,单纯模仿学习的上限相对更低。在此意义上,强化学习在物理AI中更接近突破能力边界的关键路径,而非后置修补。

3
结论:数字AI提供能力底座,物理AI补足物理闭环
物理AI正建立在数字AI能力外溢的基础之上,且借鉴层级持续上移:从Transformer等架构理念的移植,发展到以EMMA构建于Gemini之上、车端VLA等为代表的模型层面直接迁移。我们认为,越靠近物理世界本身、越接近实时三维感知与安全攸关决策环节,数字AI已有成果可直接迁移的比例越低,可迁移红利区间可能趋于收窄。
物理AI相较数字AI存在系统性差异,可分为三方面:在表征上,物理世界缺乏天然、通用的符号化方案,需要先构建可学习的三维表征;在数据上,高价值长尾与极端场景天然稀疏,世界模型被部分机构用作合成数据的数据工厂;在范式上,由于模仿对象为平均水平人类司机而安全目标远超人类,强化学习被多方视为不可或缺的环节。
4
风险提示
技术迭代不及预期的风险:数字 AI、物理 AI 技术进展低于预期,任务或应用场景拓宽速度低于预期。
大模型厂商 ARR 增速放缓的风险:若客户增长、续费率或客单价不及预期,模型厂商 ARR 增速可能放缓。
云服务商资本开支不及预期的风险:若自由现金流承压,或 AI 算力需求及投资回报低于预期,云服务商可能下调资本开支。
智能驾驶及机器人商业化落地不及预期的风险:若产品可靠性、成本下降或用户需求低于预期,相关产品商业化进程可能放缓。


VIP复盘网