物理AI与数字AI的根本差异,首先体现在表征获取方式上。文本天然离散且带语义,数字AI输入具备较强可token化基础;物理世界的输入则由连续光子、点云、运动和空间关系构成,缺乏天然通用的物理世界token化方案。因此,物理AI需要先构建三维物理空间的可学习表征,再进入规划、控制和行动。
以智能驾驶为例,表征演进可概括为原始像素、BEV/VectorNet、Occupancy、多模态Token和潜在状态五个阶段。原始像素端到端简洁但缺少结构约束;BEV Transformer与矢量化VectorNet是同一层级的两条并行路线,分别以特斯拉和Waymo为代表,前者把多摄像头信息统一到鸟瞰三维空间,后者把道路和参与者抽象成数学对象;Occupancy从识别对象类别转向判断空间占据;多模态Token连接视觉、语言和动作;潜在状态则把世界压缩到可预测空间。
物理AI中的token化器本质上是重型编码网络。文本分词通常只是把离散符号映射为token,而车端BEV编码器、占用网络、VAE、3D编码器等承担了从连续物理输入到可学习表征的核心转换。离散化和嵌入不是预先给定的,而是由网络学习形成;这也是物理AI相较数字AI多出的一道关键工程门槛。
从公司证据看,特斯拉、小鹏、华为、理想、Waymo、Wayve等路线虽不同,但共同主线是从目标级识别走向空间级理解,再走向潜在状态预测。多种表征长期并存,并非简单替换:BEV与矢量、占用、3D高斯、世界模型潜空间,分别服务不同层次的感知、预测、仿真和规划需求。
世界模型可能成为表征训练的关键手段。标签稀缺使物理世界嵌入难以完全依赖人工监督,GAIA、Cosmos、JEPA系等世界模型通过自监督预测未来状态、生成场景或学习潜在动力学,帮助模型在无标注或弱标注条件下形成更统一的物理表征。竞争壁垒正从单点感知精度,前移到如何将物理世界嵌入可预测潜在空间。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代不及预期的风险;大模型厂商 ARR 增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险


VIP复盘网