物理AI正接棒成为下一阶段AI增长的核心变量。物理世界数据作为贯穿感知至反馈的关键引擎,面临巨大需求刚性缺口。受制于保真、规模与成本的“不可能三角”,物理世界数据获取倒逼行业有望迎来三重变革:商业模式端通过社会化众包采数,技术范式端依托世界模型虚拟造数,资产属性端跃升为企业高溢价核心无形资产。供需失衡驱动物理数据资产价值重估,资本加速向数据基础设施与评测集聚。市场格局尚未定局,掌控稀缺数据与造数闭环能力的企业有望迎来核心溢价。

物理世界数据价值高、缺口大,资本倾斜态势加速。物理AI正成为下一阶段AI增长的核心新变量。物理数据作为贯穿感知与反馈、赋能智能中枢的关键引擎,受高门槛限制面临严重供给瓶颈。刚性供需矛盾推动数据资产价值重估,资本正加速涌入数据与评测基础设施,催生出以光轮智能为代表的高估值数据独角兽。
数据采集技术路径尚未收敛,“高质量 规模化”成为破题关键。物理AI数据体系面临保真、规模与成本的“不可能三角”,在采集、解译、流转及迭代环节存在技术与效率壁垒。为突破获取瓶颈,行业正从商业模式、技术范式及资产属性三维深改,加速构建数据供给与变现闭环。
趋势一:商业模式创新。通过社会化“众筹与众包”模式,激活“Ego UMI 众包”的社会化采数网络,分布式地获取高频、长尾的现实世界行为数据,展现出巨大的规模扩张潜力。
趋势二:技术范式革新。基于“种子数据为基、世界模型扩容、持续学习闭环”战略,打造“虚拟扩容与持续闭环”的造数引擎,打破物理时空限制,将商业侧采集到的种子数据实现指数级放大。
趋势三:资产价值重塑。物理世界数据的资产属性正在经历根本性的价值重估,它正从流转的“中间加工要素”跃升为企业的核心壁垒与高溢价无形资产。
市场发展方兴未艾,竞争格局尚未定局。物理AI正迎来爆发式增长,驱动物理数据与仿真市场步入广阔的增量空间,沙利文预计2030年中国物理AI仿真及数据平台市场规模有望突破1800亿元。随着产业竞争加速向“物理数据驱动”进行范式转移,科技巨头、原生物理AI数据企业及传统数据标注厂商,正纷纷依托各自的核心资产与技术优势,积极抢占物理数据时代的战略窗口。

一、物理世界数据价值高、缺口大,资本倾斜态势加速
1.数据贯穿物理AI能力体系,驱动全链生态自进化闭环
当前,人工智能正加速与实体产业深度融合发展,AI技术能力沿着“内容生成-自主代理-闭环执行”的路径持续迭代演进,逐步突破虚拟信息域的边界,向真实物理世界渗透落地,物理AI有望成为继生成式AI、代理式AI之后,引领下一阶段人工智能增长的核心新变量。
(1)数据贯通五大能力体系,助力物理AI自进化闭环。物理AI由“感知、决策、验证、执行、反馈”五大核心能力模块协同构成,在功能与数据流上深度耦合,共同构成可工程化实现、可系统测试、可持续迭代的完整技术链路,形成在真实物理环境中稳定可靠运行的智能系统。其中,在感知方面,通过感知设备以及模型等感知系统实现物理世界数据采集、治理与输出;在决策方面,决策系统融合各类感知信息,按照“策略-方法-执行”三层架构,将任务目标转化为可解释映射;在验证方面,验证系统旨在实际执行前,通过虚拟仿真、数字孪生等技术手段,提前识别并过滤潜在风险。高质量场景数据、感知数据正是虚拟仿真、数字孪生系统构建的关键基础;在执行方面,执行系统通过硬件载体与控制算法将决策层输出的动作序列转化为精准、稳定、可重复的物理动作;在反馈方面,反馈系统将物理执行过程与结果转化为可分析、可复用的结构化数据资产,实现“持续运行与自主演进”,构建完整的数据闭环。
(2)数据资产激活全链生态,技术使能层构筑产业智能中枢。物理AI产业链呈现出清晰的层级架构与协同生态,纵向由基础设施层、技术使能层、软硬融合层、行业应用层及运维服务层构成,共同构建了物理智能从泛在算力底座到垂直场景落地的高效工程化链路。其中,技术使能层承担着承上启下的枢纽角色,向下深度整合异构算力,向上为软硬融合层赋能。通过仿真层与模型层的深度耦合,技术使能层实现了物理世界与数字空间的双向映射,为物理AI的策略泛化与风险验证提供了核心的认知与控制底座。数据层则是技术使能层乃至整个产业链的核心资产与演进关键,涵盖数据采集、标注与治理、合成数据生成及数据交易服务等业态,不仅为模型层的表征学习提供高质量的模态输入,更为虚拟仿真系统构建起高保真度的环境基准。高价值场景数据的闭环回流与资产化沉淀,是驱动物理AI实现自主演进的决定性变量。

总体来看,物理AI正以“数据”为核心纽带,全面驱动能力体系与产业生态的深度变革。在能力链条中,数据贯通感知至反馈的全流程,构建起系统自进化的完整闭环。在产业链拓扑中,数据层作为核心资产与演进燃料,不仅筑牢了高保真仿真环境的数字底座,更深度赋能技术使能层这一产业智能中枢。
2.物理世界数据沉淀少、门槛高,需求侧面临刚性缺口
物理AI所需的数据与大语言模型存在本质差异。近年来大模型的突破式发展,本质上是互联网文本、音频、视频等标准化数据的集中释放。物理AI数据具备两个核心特性:1)多模态维度更为丰富,除文本、图像、声音外,还需涵盖深度、距离、力觉、触觉、温度等感知信息,这些模态共同决定了智能体对物理世界的理解能力;2)具备真实的物理因果反馈,数据流并非源于人为预设的符号规则,而是智能体与真实世界交互产生的时空连续反馈,自然规律构成天然的判别准则,使智能体得以通过“试错-反馈”的动态闭环直接从物理现实中学习,从而突破传统大模型依赖人工对齐与静态标签的局限。这意味着物理世界数据从结构、语义到物理属性,都需要被重新构建、标准化与验证,天然具备高门槛与低沉淀特征。

从数据存量来看,物理世界数据与大模型数据之间存在跨量级的鸿沟。根据艺恩《全球大模型数据市场白皮书》统计,当前全球可用的机器人具身训练数据仅为240万集(episodes),与文本大模型15万亿Token的庞大数据量相比,存在数量级差距。以GPT-3约4500亿Token的训练数据为参照,目前全球最大的机器人开放数据集OpenX-Embodiment整合了22种机器人平台、60余个数据集,最终规模也仅为100万条轨迹。

真实物理世界数据的极度匮乏,已成为当前物理AI规模化落地的核心产业卡点。以具身数据为例,具身智能的演进深度依赖于数据规模的指数级爆发:从2022至2024年“分模块”阶段的万小时级数据,到2025至2026年“端到端VLA”时代跨越至十万到百万小时级,再到2027年及以后“世界模型”对千万至亿小时级数据的海量需求,技术范式的每一次迭代都伴随着数据量级的跃升,供需缺口将持续放大。

“仿真到现实”的迁移鸿沟进一步印证了高质量物理数据的刚性缺口。2026年4月斯坦福HAI发布的《AIIndexReport2026》显示,RLBench等仿真基准上,机器人操控在仿真环境中的成功率高达89.4%,但在真实家庭环境中骤降至12%,存在77%的仿真到现实迁移鸿沟,根源在于具身智能大脑受制于高质量真实数据的供给不足。

从行业共识来看,物理世界数据缺口已达数量级层面。据亿欧智库测算,具身智能要达到真正可用,至少需要1000万小时级别的真实场景交互数据,而当前全行业高质量真实物理交互数据总量仅为50万小时,缺口高达20倍。觅蜂科技的数据进一步表明,全球有效具身数据约为几十万小时规模,而要达到GPT-3.5级别“开箱即用”的类人初步能力,需要一亿小时量级,存在2至3个数量级的巨大缺口。综合来看,物理世界数据的供给侧远远无法匹配需求侧的指数级增长,这一结构性矛盾既是产业当前的核心瓶颈,也为具备高质量数据采集、合成与仿真能力的企业构筑了长期价值护城河。
3.国内首个数据独角兽诞生,资本加速向物理AI数据基础设施延伸
数据资产在物理AI时代重新定价,数据与评测基础设施受到资本青睐。据IT桔子数据,2026年上半年,国内具身智能赛道融资总金额已突破900亿元,达到935亿元,较2025上半年提升了5倍;融资事件数量达到322笔,同比增长了137%,反映出资本对具身智能赛道的投资信心持续增强。根据浪潮之巅数据,2026年上半年机器人赛道呈现出全链布局趋势,从大模型到数据平台,资本正在“全链条”押注机器人产业,2026H1数据/训练细分领域发生融资15笔。其中,具身智能的“数据英伟达”光轮智能完成新一轮10亿元战略融资,投后估值超150亿元。光轮智能两周内完成两轮约20亿融资,资本的青睐表明具身智能的产业重心,正从模型与本体延伸至支持机器人持续学习的数据等底层基础设施。

二、数据采集技术路径尚未收敛,“高质量 规模化”成为破题关键
1. 保真、规模与成本存在“不可能三角”,数据采集技术路径尚未收敛
基于保真度、规模以及成本原则,物理世界数据可按照自下而上分为人类/互联网视频、仿真与合成数据、便携采集数据以及真机遥操数据,保真度与成本依次提升,数据规模逐步下降。总体来看,物理世界数据存在保真、规模与成本“不可能三角”特征。
(1)人类/互联网视频数据规模巨大且成本趋零,存在形态断层,需要进一步跨模态映射与特征对齐。人类/互联网数据主要涵盖人类在真实世界中沉淀的海量多模态视频、第三方观察视角以及无动作标注的第一人称生活记录,是机器人构建物理世界语义常识与视觉先验的重要基石。然而,其核心痛点在于严重缺乏动作标签、物理基础相对较弱,无法直接转化为机器人的控制指令,在实际应用中亟需通过下游的蒸馏与清洗技术进行价值重塑。
(2)仿真与合成数据通过物理引擎与生成式AI,覆盖长尾场景,受制于“虚实鸿沟”与物理背离。仿真与合成数据是依托物理引擎与生成式AI的结合,开启的批量化造数新范式。这种模式能够模拟逼真的物理世界法则,通过自动化生成大量数据来高效覆盖现实中罕见的长尾场景。由于其成本仅为真机采集的百分之一左右,因此成为了在低预算下快速构建海量多模态训练集的破局利器,主要包括数据仿真和数据合成,其中:
数据仿真,是指通过计算机模拟技术生成虚拟环境和场景,核心在于创建一个虚拟世界,依赖高保真的物理引擎和场景模型,遵循物理规律,模拟真实世界中的物理过程和交互,生成用于训练机器人的数据。其缺点在于环境构建与动力学建模的泛化能力不足,高度依赖人工设计场景,且由于传感器噪声、接触面摩擦力等微观物理特性的简化,极易导致模型在向现实世界迁移时出现“虚实鸿沟”引起的动作变形。
数据合成,是指将算法、统计模型或真实世界数据导入仿真平台,然后通过算法合成在统计学上与真实数据相似的新数据的过程,主要包括轨迹合成、资产合成、决策生成和预测生成等技术路径。其缺点在于高度依赖基础生成模型,生成数据在统计学上虽具有相似性,但是缺乏真实的物理约束,容易产生“物理背离”与穿模幻觉,且在面对极端少见的长尾分布时,依然存在生成样本失真或坍塌的局限。
(3)便携采集数据大幅降低端侧交互成本,是打破高质量动作数据规模化瓶颈的性价比之选。便携采集数据是通过可穿戴设备或数据手套进行第一人称视角的行为采集,不仅保留了人类原生动作的灵活性,更在实际操作中比传统真机遥操实现了约10倍的降本。它成功打破了高质数据的规模化瓶颈,是实现高性价比大模型训练的关键路径。其缺点在于所采数据为“非本体对齐”轨迹,依赖运动重定向算法将人类高自由度运动强行映射给机器人,极易造成动作精度肉眼可见损耗;同时,由于本体未实际性参与,数据中缺乏端侧电机的真实电流、扭矩反馈以及物理受力对抗,难以直接应对高精度的重负载交互任务。
(4)真机遥操数据高质量具备极致精度与本体天然对齐优势,高昂的硬件与时间损耗使其成为难以规模化量产的数采范式。真机遥操数据是指通过VR设备或动作捕捉技术直接操控真实机器人,能够实现操控动作与机器人本体的天然对齐。这种范式获取的数据质量最高、精度最深,但其高昂的设备与时间成本,以及极高的技术门槛,使其成为最昂贵且最难走向规模化量产的数据获取手段。便携采集数据与真机遥操数据从技术路径角度来看,可以分为以下技术路径:
位姿类遥操作,是指人类操作员通过直接记录位姿数据进行远程控制,其中,遥操设备需要将位姿信号转换为机器人的位姿控制信号,主要分为同构类遥操作、穿戴类遥操作、手持类遥操作。
视觉类遥操作,是指使用视觉传感技术捕捉人类操作员的动作,然后将这些动作转换为控制命令来操作机器人。由于利用了运动重定向方法将人类运动映射到机器人动作上,动作映射的准确性依赖于重定向算法的质量,动作精度和异构结构需要较多调试。
光惯类遥操作,是指一种结合光学运动捕捉系统和惯性测量单元的复杂操作系统,综合了穿戴类遥操作技术和视觉类遥操作技术的优势,可以实现对人类操作员动作的准确、连续、可靠跟踪。早期主要在影视、游戏制作领域使用,近年来逐步拓展到具身智能的数据采集领域。

2. 传统数据驱动范式难以为继,感知融合、流转迭代、标准统一建设有待破题
目前,物理AI数据体系仍面临阶段性瓶颈,如从物理世界数据的采集供给、解译认知、流转复用及迭代链路等各环节存在一定的技术断层与效率壁垒,成为阻碍物理AI大规模商业化落地进程的制约因素。
从数据属性来看,物理世界数据存在高噪声性、强耦合性以及不可复刻性等基本特征,“以量取胜”的传统数据驱动范式失效。首先,传感器采集信号夹杂环境干扰与设备误差,信噪比远低于结构化文本数据;其次,表现为温度、湿度、振动、材质等多物理量实时交织、无法独立建模的强耦合性;同时还伴随着同一动作在不同时间、空间和环境条件下产生差异化结果的不可复刻性,使得统计规律极难进行跨场景迁移。上述特性相互交织放大,导致单纯的数据堆叠根本无法根治感知精度不足、物理规则缺失以及实时推理滞后的系统级硬伤,阻碍了模型层技术鲁棒性无法收敛、难以完成商业化闭环与产业落地转化。
从数据采集来看,需求端对真机数据的“强依赖”与供给端产能、重资产约束下的“低效率”激烈错配,数据采集陷入高成本的供需失衡。在需求端,为解决动作精度瓶颈,当前大模型微调阶段的核心需求主要集中在真机数据。根据普华技术产业化研究院调研,目前,复杂任务中真机数据占比约为70-80%,头部企业真机数据均未达到百万小时级别,有效真机数据多在几十万条区间;仿真数据可用率极低,仅为1‰-1%。在供给端,真机遥操正遭遇物理产能与重资产的双重钳制。受生理视差、软硬件时延与工效疲劳制约,遥操动作节拍仅达机械臂极限的67%,单人日均高质产出仅2-5小时,极难规模化并发。供需失衡导致造数成本高企,根据亿欧智库数据,真机数据市价已达500-1000元/小时;硬件端单台遥操设备资本开支超20万元,叠加持续的人力边际成本,真机遥操已成为制约物理AI发展的关键效率壁垒。
从数据解译来看,多模态感知的离散割裂与物理机理的缺失叠加,物理AI面临“能拟合、难认知”的表层智能陷阱。首先,多模态感知解译碎片化。视觉、触觉、力觉等多源数据独立且异构,缺乏高精度时空对齐,导致系统无法建立统一的物理环境认知。其次,物理规则深度缺失。模型仅具表层“统计拟合能力”,缺乏动力学、材料力学等刚性定律约束,无法预判动作引发的物理反馈。再者,实时性与鲁棒性不足。受云边端数据传输与交互学习限制,云端网络高延迟,边缘端算力精度差,无法满足毫秒级决策与高可靠执行的刚性需求。
从数据迭代来看,“采集—合成—评测 ”链路存在割裂,数据飞轮难以实现闭环。当前行业普遍采用“真机、仿真与视频”混合训练,但在实际研发中,异构数据的融合与迭代流程依然存在系统性断层。首先,混合模式放大了真机采集的规模瓶颈。视频与仿真虽能堆量,但因缺乏动作反馈,系统对真机数据的强依赖并未减弱;而真机数采属重资产工程,链条长、成本高,导致高质量数据无法同步规模化放大。其次,合成与视频数据的物理失真难以在迭代中弥合。视频缺乏深度与力觉,仿真数据在摩擦力、刚度弹性等精细交互中深陷“仿真鸿沟”,混合训练易导致模型产生物理认知冲突。再者,多源混合数据缺乏统一的评测基准。由于缺乏高保真仿真环境,研发团队无从诊断模型究竟是真机数据不足还是虚拟数据引入了噪声,导致数据迭代飞轮难以为继。

从数据流转来看,行业标准的普遍缺失与机器人本体“泛化、强耦合”双重叠加,“数据孤岛”现象显著。首先,行业统一的数据质量标准与评估体系严重缺失。由于缺乏通用规范,不同平台生产的物理世界数据在格式、标注颗粒度、任务定义及元数据上面临多维不一致,导致跨平台数据共享与复用极难实现。其次,数据与机器人本体的强耦合形成了天然技术壁垒。不同硬件形态的传感器配置与执行器参数差异巨大,这种深度绑定不仅限制了存量数据的跨形态迁移,更在本体泛化的过程中,进一步加剧了“数据孤岛”困境。

为突破物理世界高质量、规模化数据的获取瓶颈,行业正在从商业模式、技术范式、资产属性三个维度发生深刻变革,共同构建起数据供给与变现的闭环。
趋势一:商业模式创新。通过社会化“众筹与众包”模式,激活“Ego UMI 众包”的社会化采数网络,分布式地获取高频、长尾的现实世界行为数据,展现出巨大的规模扩张潜力。在落地实践中,行业正加速衍生出以第一人称视角(Ego)与手持/便携式设备(UMI)为核心技术模式的社会化众包采集方式:
(1)影子模式采集,依托已量产或商业化运营的机器人、智能汽车终端,在后台静默运行算法。当遭遇人类接管或特定边缘场景时,自动抓取并回传现场真实的第一人称视角(Ego)多模态交互数据,实现“用真机长尾数据喂养算法”。
(2)便携式硬件众包采集,通过向社会化长尾劳动力分发低成本、低门槛的消费级数据手套或轻量化可穿戴动捕设备(如UMI等手持/便携式设备)。让兼职人员在日常真实的生活与工作场景中,以第一人称视角低成本记录原生的行为动作。
(3)遥操任务平台采集,打造类似于云端威客的机器人遥操平台,将高难度的工业或服务业操作转化为线上“打怪升级”的游戏任务。吸引全球专业飞手或游戏玩家跨地域远程控制真机,在完成实际作业的同时,高质高效地“众筹”动作标签。
趋势二:技术范式革新。基于“种子数据为基、世界模型扩容、持续学习闭环”战略,打造“虚拟扩容与持续闭环”的造数引擎,打破物理时空限制,将商业侧采集到的种子数据实现指数级放大。
(1)多模态感知。具身智能深度整合视觉、听觉、触觉、力觉及雷达等多维传感器信号。这种多模态感知流的交织,能实时构建高保真度的三维空间表征,为后续的规划与控制决策提供最丰富的语义与物理信息。
(2)合成数据与世界模型。利用先进的物理引擎与生成式AI(世界模型),在虚拟环境中批量构建具备真实物理属性的场景。通过虚拟机器人与虚拟环境的深度交互,以最低的边际成本和庞大的产能自动生成海量数据。这是目前唯一具备指数级扩张弹性的路径,切实解决了数据供需严重错配的瓶颈。
(3)仿真评测与反向校准。行业正加速构建自动化的“Sim-to-Real评测与校准工具链”:一方面,利用高精度算法作为“数据质检员”,对合成数据进行数据蒸馏,剔除幻觉与环境噪声;另一方面,引入少量真机反馈作为“物理金标准”,对虚拟训练出的智能体进行反向校准与边界测评。通过这种“生产-评测-修正”的持续学习闭环,确保高复用性的数据集能真正转化为工业级安全的泛化控制能力。
趋势三:资产价值重塑。物理世界数据的资产属性正在经历根本性的价值重估,它正从流转的“中间加工要素”跃升为企业的核心壁垒与高溢价无形资产。
(1)不可复制性构建绝对护城河。随着通用AI算法与大模型架构的开源同质化,网络层数不再是竞争壁垒,针对复杂物理交互、真实长尾场景的多模态数据集正成为不可复制的“绝对资源”。这种涉及物理实体碰撞、非结构化环境博弈的数据,无法通过互联网文本爬取获得。
(2)高数据治理技术壁垒确立资产稀缺性。物理世界数据的清洗、对齐与物理解释性标签化,其技术门槛远超传统数仓。如何从混杂、异质的社会化数据或仿真噪音中,精准提取出符合牛顿力学逻辑、无幻觉的高价值动作序列,构建出自动化、高精度的清洗与反向校准工具链,其工具链本身就是行业最高的准入门槛。
(3)清晰产权规则保障资产变现与估值。随着国家数据局出台《数据产权登记工作指引(试行)》,全国统一的数据产权登记体系步入实质性落地阶段。政策通过发放统一编码的“产权登记凭证”,赋予了物理世界数据资产合规流通、入表及资产评估的法定效力。产权规则的完善消除了行业协同壁垒,推动高质量数据集作为核心生产要素深度嵌入产业链,推动物理世界数据从“中间加工要素”跃升为企业的核心壁垒和高溢价无形资产。

三、市场发展方兴未艾,竞争格局尚未定局
1.市场发展方兴未艾,市场空间潜力可观
物理AI正迎来爆发式增长,而作为其底层基石的“物理世界数据与仿真市场”正展现出极其广阔的增量空间与战略价值。根据Statista预测,全球物理AI市场规模将增长3倍以上,从2025年的927亿美元增长至2030年的3327亿美元,复合年增长率高达29.1%。普华永道2026年3月发布报告,预测到2030年全球物理AI市场将达到约5000亿美元。Zinnov在2025年11月发布报告,预测到2030年物理AI将驱动超过1万亿美元的经济规模。根据36氪研究院等机构发布的《2026年具身智能产业发展研究报告》,我国具身智能市场规模已经从此前的千亿元区间快速扩大,有望在2026年突破万亿元。沙利文发布《2026年中国物理AI仿真及数据平台研究报告》,预计到2030年中国物理AI仿真及数据平台达到1806亿元,其中智能汽车、具身智能机器人为主要的下游应用领域,分别占比36%、34%,达到652亿元、612亿元。

以具身数据为例,物理世界数据正展现出极其广阔的市场空间与爆发潜力。根据亿欧智库数据,2024年全球具身智能数据集市场规模大约为7.37亿美元,预计2031年达到70.14亿美元,2025-2031期间复合增长率达到38.2%。中国具身智能数据及市场快速发展,预计到2031年占全球50%左右。具身数据作为物理世界数据的高阶与核心组成部分,其市场规模的快速扩张,客观上论证了物理世界数据领域蕴含的长期商业潜力。

2.多类玩家积极布局,竞争格局尚未定局
随着物理AI的竞争正加速向“物理世界数据驱动”进行范式转移,科技巨头、原生物理AI数据公司以及传统AI数据标注厂商,各自依托核心资产与技术路径,积极抢占物理数据时代的战略窗口。

(1)科技巨头:算力筑基,以“标准框架 仿真合成 世界模型”降维打击。科技巨头的核心优势在于算力、生态与存量资产的绝对垄断。英伟达凭借Cosmos/Isaac掌控物理仿真生态,谷歌、Meta手握全球最大视频库并具备顶级自监督算法能力,特斯拉则拥有FSD/Optimus全球最大规模的真机运行资产。战略层面,巨头普遍回避高成本的真机采集路线,倾向于聚焦仿真合成与视频蒸馏——以极低边际成本换取数据规模。总体来看,巨头走的是“以既有护城河(算力/视频/车队)向物理世界数据平滑迁移”的降维路径,优势十分明显。但其合成数据的“物理真实性”仍需真机与仿真交叉校验,这为产业链上游留下了确定性空间。
其中,英伟达的核心战略可归纳为“一套标准、一个仿真平台、一个世界模型、一个数据工厂”,将算力转化为高产出的合成数据以弥合“虚实鸿沟”。公司首先以OpenUSD作为物理AI的底层数据框架,统一物理世界数据标准;再利用Omniverse/Isaac仿真平台对牛顿力学、传感器和力反馈进行代码化还原;在此基础上,通过Cosmos物理世界模型赋予AI预测与生成物理连续画面的能力;最终依托物理AI数据工厂,实现高质量合成数据的规模化量产。

(2)原生物理AI数据公司:真实性稀缺为矛,垂直卡位为盾。原生物理AI数据公司的核心优势在于数据保真度与场景稀缺性。帕西尼以6D触觉、动捕实现真机轨迹的全模态实采,保真度最高;它石智航、灵初智能通过可穿戴手套/头显将采集成本降低约10倍;光轮智能则在仿真合成、仿真评测、人类视频数据三个维度实现全球领先交付,已成为全球具身数据领域的首个独角兽。各家战略侧重各异——或深耕真机高保真、或主打端侧降本、或规模化生产长尾场景——但共性在于,卡位“巨头合成数据难以覆盖的物理真实性与长尾场景”,以专业化换取议价权,是产业链中确定性与稀缺性兼具的关键环节。
其中,光轮智能作为全球首个具身数据独角兽,依托“求解-测量-生成”三位一体全栈自研仿真平台,持续构建高质量数据生成、工业级规模化评测与真实部署反馈能力,推动具身智能从技术演示走向规模化落地。公司已在人类视频数据、仿真合成数据和工业级仿真评测三个维度形成全球第一的规模化交付能力。根据其经营数据显示,在优质场景中数据复售率已超10倍,2026年一季度新增订单达5.5亿元。

(3)AI数据标注公司:工程化能力复用,向具身对齐延伸。AI数据标注厂商的优势在于成熟的采集网络、工业级标注流程与多传感器工程经验。Scale AI推出物理AI引擎与真机训练器卡位供应链,海天瑞声利用多年数据标注经验,打造具身数据第二增长曲线;Surge AI则以专家级RLHF解决机器人复杂推理死角。战略重心在于将既有标注/对齐能力横向迁移至具身场景,主打“多模态对齐 真机数据工程化”。总体来看,这类厂商转型的关键在于能否从“通用文本图像标注”真正跨越到“物理世界高精对齐”——具备车规级、多传感器融合经验者更易成功,工程化落地能力是其核心壁垒,也是与纯数据生产商的差异化所在。

(1)核心技术突破滞后风险。物理世界长尾场景复杂,多模态数据融合与高精度仿真技术未破。长序列动作轨迹对齐难度大,高质量物理表征模型短期难实现,制约具身智能泛化能力进阶。
(2)产业生态建设不完善风险。硬件平台百花齐放导致数据格式与接口标准不一,开源工具链与通用数据集稀缺。高精度传感器等核心零部件依赖特定供应链,关键设备受限形成“卡脖子”隐患。
(3)应用落地场景稀缺风险。具身数据多处于实验室或单一工位验证阶段,缺乏跨场景商业落地。现实世界容错率极低,垂直需求与动作算力不匹配,试点项目难复制,商业化盈利模式未形成。
(4)政策与监管适配风险。数据深度涉及隐私、商业机密及空间安全,确权与跨境监管规则不明朗。政策多集中于研发与硬件制造端,数据流通与转化扶持不足,规则滞后影响产业稳定。
(5)投入与回报失衡风险。真机采集与数据标注极度依赖高价值硬件和密集人工,搭建高精度环境需巨额资金。商业化变现周期模糊,投融资退潮易引发资金链断裂,拖累产业节奏。


VIP复盘网