机器人为什么搬了东西会摔倒?拿取了东西为什么动作做不稳?高动态运动为什么做不好?2026年的世界人形机器人运动会上,机器人大讲堂发现,赛场上的机器人开始有了腰,几乎能发挥身体全部能力,实现大跳快跑,可以打球、踢球,甚至击败人类百米纪录。在场竞赛,机器人会触碰着试探捆住一条线缆,能根据阻力变化不断调整插口插拔的位置和力度,一旦发生卡滞,还要知道什么时候应该退回来重新尝试。
2026年,人形机器人从“腰”起步,划开了很有意思的分水岭,有了腰的人形机器人,似乎正在开始理解自己的身体正在发生什么。这也是2026年具身智能技术演进中,一个越来越明显却容易被忽视的变化。这背后,是行业关注的重点正在从VLA带来的视觉—语言—动作闭环,进一步走向Whole-Body Intelligence(WBI,全身智能),这在构型上,让人形机器人逐渐有了腰部,并且学会了全身发力。
不仅仅是国内,Google DeepMind最新一代机器人模型2026年下半年来也已经开始强调WBI,尝试让模型控制从脚到指尖的完整身体;与此同时,学术界正在把触觉、力觉、本体状态以及身体动力学纳入世界模型,让机器人不仅预测环境下一步会发生什么,也预测自己的动作会如何改变身体和接触状态。
这意味着,具身智能的下一阶段,可能不不仅仅是给机器人一个更聪明的大脑,而是如何同时让这个大脑真正拥有一副可被感知、可被预测、可被控制的身体。

01.
机器人开始从“看见世界”,走向“感觉世界”
过去几年,具身智能最明显的进展发生在视觉和语言。机器人能够识别物体、理解指令,再通过VLA模型生成动作。但真实世界有一个非常棘手的特点:决定动作成败的信息,很多并不在视觉里。
一个机器人拿起杯子,视觉可以告诉它杯子在哪里,却不能完整告诉它杯壁究竟承受了多大的力。机器人把插头送向插座,视觉可以帮助它找到位置,却无法直接判断插头进入一毫米后受到的阻力是否正常。机械臂抓取一个柔软物体,摄像头可以看到物体发生了形变,但机器人真正需要知道的,是自己施加了多少力、接触点发生了怎样的变化,以及继续施力会不会导致物体滑落或者损坏。
人类完成这些动作时,依靠的并不只是眼睛。肌肉、关节、皮肤和前庭系统持续向大脑提供身体状态,大脑再根据这些反馈调整下一步动作。机器人过去缺少的,正是这一层闭环。因此,WBI真正改变的不是机器人同时控制了多少个关节,而是控制逻辑开始从我应该做什么动作?进一步变成我的身体现在处于什么状态?这个动作会让我进入什么状态?
这也是力觉、触觉等核心零部件2026年来开始重新获得资本关注的原因。例如六维力传感器能够同时测量三个方向的力和三个方向的力矩,让机器人获得关于外部接触和身体受力状态的直接信息。视触觉把机器人认识世界的维度拓展到了更深层。从传统机器人控制看,它是一个反馈元件。从具身智能的视角看,它可能成为一个让机器人更好认识自己身体的一种物理接口。
与此同时,这种“身体先验前置”的思路,也已经在一些新成立的全身智能公司中成为核心训练范式,这是创新公司后发还能拿到融资的原因。例如源策未来创始人李弘扬在RSS 2026上提出,WBI并非单独的大模型,而是一套系统级预训练范式,将机器人智能划分为四层能力栈,S2任务语义理解、S1人形基础能力(身体先验)、S0.5意图到全身运动生成、S0实时平衡与控制。其核心主张是从训练开始就把认知、身体和环境放到一起学习,而非事后拼接。
02.
WBI真正需要的,是身体状态?
然而一个误区在于,WBI并不是简单地把更多传感器装到机器人身上。它真正要解决的是身体状态的统一表达。例如机器人走路时,足底受到的力会改变平衡;机器人弯腰拿东西时,手臂负载会改变身体重心;机器人推门时,手臂受到的反作用力会传导到躯干和腿部;机器人一边走路一边抓取物体时,移动和操作实际上已经成为一个耦合系统。
这也是近期whole-body control研究越来越强调身体动力学、接触状态和动作后果的原因。例如CMU Robotics Institute近期关于人形机器人安全与灵巧性的研究指出,人形机器人面对的是高维动力学以及不断变化的接触关系,几乎所有真正有用的行为都同时成为控制和安全问题。
因此,未来机器人需要融合的可能是一组完整的身体状态:视觉告诉它外部环境;关节编码器告诉它自身姿态;IMU告诉它身体运动状态;足底压力告诉它支撑状态;触觉告诉它局部接触;六维力传感器则告诉它整体受力和力矩变化。
这也是为什么,力控不应该再被简单理解为机械臂末端的一个功能。因为当机器人开始做全身任务,力觉就从局部控制变量变成了身体状态变量。

这个变化非常重要。它意味着力传感器的上游价值开始发生变化,它不再只是服务于一个控制器,而可能进入未来具身模型的数据闭环。力觉真正的价值,可能从“控制信号”变成“身体数据”。
在产业端,例如德塔智能等新公司也提出了一种Loco-manipulation边走边干活的思路,这种操作在原先控制器时代很难想象。其研发的人形机器人基础模型从一开始就把完整身体作为建模对象,自研3D世界引擎让机器人在行动前先理解空间关系、环境变化和动作后果,大脑负责场景理解与动作决策,小脑将任务意图转化为全身多关节的连续控制,力位混合控制则兼顾位置精度、力反馈和身体稳定性,这恰好对应了“移动和操作实际上已经成为一个耦合系统”的论述。
如果把上述变化放到一起,会看到一个更加有意思的趋势。WBI需要身体状态,而世界模型开始预测接触状态,触觉和力觉开始进入模型,本体感知也开始被重新理解。这意味着具身智能的数据结构正在发生变化。
过去我们说机器人数据,首先想到的是,视频、语言、动作轨迹。但真正的物理交互数据,还应该包含机器人当时的姿态、每个关节的状态、身体受到的外部力、接触发生的位置、力矩如何变化、物体是否发生滑移、动作最终是否成功,如果失败,失败发生在什么阶段。
这些数据共同描述的,不是“机器人做了什么”。而是机器人为什么成功,为什么失败。这可能会成为下一阶段具身智能数据飞轮的重要部分。
因为对于模型而言,一段机器人视频只能告诉它“手伸过去了”。而同步的视觉、动作、关节状态和力觉数据,能够告诉它手为什么停下来、为什么改变方向、为什么增加力度、为什么退回来、为什么重新抓取,以及最终成功的动作与失败动作之间,到底差在哪里。
这就是身体数据真正的价值。从这个意义上说,感知层在具身智能的产业位置可能正在发生变化。它过去是一种精密硬件。未来,它还可能成为机器人身体数据的重要采集入口。

03.
世界模型开始学习“碰到了什么”
这一变化在最新论文中已经非常明显。过去讨论世界模型,人们更多想到的是视频预测:机器人做一个动作之后,环境画面会怎样变化。但真正的物理世界,最难预测的往往发生在接触之后。
例如今年6月发布的TacForeSight,把高频腕部力/力矩信号和双指触觉信息一起输入触觉世界模型,预测未来短时间内触觉状态的变化,再利用预测结果调整机器人动作。研究在多个接触丰富任务中验证了这种方法,尤其关注动态扰动下的操作能力。7月的TouchWorld进一步将视觉、触觉世界模型和高频动作调整组合起来,用触觉预测帮助机器人处理长时程、接触密集型任务。8月的HiTac-WAM甚至开始预测候选动作之后可能出现的接触状态、形变和滑移风险,再从多个动作中选择成功概率更高的方案。
论文里的变化其实非常值得产业界关注。因为感知层正在从过去的:发生异常→传感器反馈→控制器纠正,逐渐走向了:受力→预测未来接触→提前调整。换句话说,感知层正在从控制信号向模型输入迁移。
感知层提供的不只是对于控制层进行动作判断的一个数字。而是构成了机器人与物理世界发生接触时,一条连续、可量化的身体状态信息。它把感知层原先一种事后反馈,推向了一种未来状态预测的条件变量。
过去的逻辑是机器人碰到了东西、传感器测到异常、控制器修正。现在开始出现另一种逻辑,那就是机器人感知当前接触、模型预测接下来可能发生什么,然后去提前调整动作。如果真实结果和预测不一致,再重新规划。这会让任务的成功率逐步、更加趋于最优解。

感知层的作用,不再只是告诉机器人“你刚才做错了”。而是在帮助模型判断如果继续这么做,接下来可能发生什么。这是WBI真正需要的能力。
例如戴盟机器人在2026年8月发布全球首个触觉锚定世界模型Daimon-TWM,就尝试以原生触觉贯穿理解、推理、预测和验证,构建从指尖感知到大脑推理、再返回动作控制端的“触觉神经系统”。模型采用“一脑三体”架构,物理认知模块靠“摸”来确认接触状态和力与形变,推演决策模块通过触觉思维链在动作执行前推演接触演化趋势和失败风险,瞬时操控模块以100Hz高频融合实现毫秒级动态纠偏。实测中,在调整、擦拭、插入、装配四类接触密集型任务中,Daimon-TWM在人为扰动条件下成功率仍达53.5%,而行业经典模型π0.5在同一测试口径下骤降至5.8%。
智在无界则从另一条路径切入。其2026年7月发布的隐式触觉世界动作模型Being-H0.8,首次将触觉模态系统性引入大规模模型预训练,把视觉、触觉、动作以及未来状态变化统一到同一隐空间。虽然核心设计依然是“慢快动作专家”机制,模型在每个动作时域开始时计算一次“世界—动作上下文”并缓存,随后在时域内少数锚点处注入最新观测到的本体状态与触觉反馈,动态生成或修正当前动作片段。
极佳视界在全身控制方向拿出了更直接的成果。其GigaBrain-WBC-0.5是首个面向人形全身控制的行为世界模型,核心能力是让机器人预判自己的下一步,每步输出动作的同时,既预测自身下一刻的状态(例如座面是否承重、手里有无负载、脚下支撑面高度等接触信息),也预测下一条指令“可能长什么样”。当操作者给出做不到的动作时,它不会急停或僵立,而是自动将指令“折”成自己能做到且最接近的动作继续完成。
这也是为什么,核心零部件真正的竞争会越来越难靠参数表结束,如果传感器只是一个元件,竞争自然可以围绕精度、价格和尺寸展开。但如果它成为具身模型感知身体的一部分,要求就会完全不同。第一是精度。模型必须相信数据。第二是一致性,因为不同机器人、不同批次之间的数据分布不能出现不可控的变化。第三是长期稳定性,机器人工作几个月以后,传感器产生的数据仍然应该具有可比性。第四是标定和校准能力,不同传感器之间需要建立统一的测量尺度。第五是数据频率。接触控制需要捕捉快速变化的物理过程,低频、延迟或者噪声过大的数据,很难进入高频控制闭环。
所以,未来评价一款力觉或者触觉的传感器,可能还需要问:它能不能稳定地给模型提供一套可信的身体状态。这会把核心零部件的竞争,从单纯的硬件性能,推进到全面的一体化能力。
04.
具身智能如何获得可信的身体状态?
这里还有一个非常有意思的反例。8月底发布的《Blind Dexterity》研究,在Unitree G1上展示了仅依靠本体感知完成部分全身操作的能力,没有使用视觉、力/力矩传感器或触觉传感器。研究说明,在机器人主动与环境发生接触时,关节编码器自身的状态变化,也能够携带相当一部分接触信息。例如波士顿动力Atlas此前的表现也证明了这一点,其仅依靠两种执行器覆盖其全身。它的手臂和腿部也采用对称设计,简化了控制和仿真。这种精简的架构使工程师能够在虚拟环境中更高效地训练机器人,并快速将这些能力迁移到真实机器人上。
这意味着未来机器人并不会简单走向“传感器越多越好”。真正的方向,是让机器人获得更加完整、可靠的身体可观测性。有些信息可以来自本体感知。有些信息可以来自触觉。有些任务则需要更加直接、精确的力和力矩测量。所以,六维力传感器的价值并不是证明“机器人必须安装它”,而是提供一类非常直接的物理量。
当任务涉及精密装配、柔顺抓取、碰撞检测、人机协作、动态平衡等场景时,机器人需要的不只是“感觉到异常”,本质上是知道异常到底发生了什么。力是多少。方向在哪里。力矩如何变化。这些信息是否稳定。能否跨设备复现。WBI最终竞争的不是传感器数量,而是身体状态的可信度。而这恰恰把问题重新带回到六维力传感器最基础、也最难的技术问题上。

这件事说明,具身智能其实未来的方向并不是简单地给机器人堆各种传感器。而是让机器人真正理解不同身体信号之间的关系。例如关节编码器提供本体状态、IMU提供姿态和运动变化、足底传感器提供支撑信息、视觉提供外部环境、触觉提供局部接触、力/力矩传感器提供整体受力和力矩变化。真正的WBI,需要把这些信息融合成一个统一的身体状态。这意味着未来的机器人感知系统,很可能不是某一种传感器取代另一种,而是从单模态感知逐步走向身体状态融合,也可以做减法以小博大。
这一趋势在产业端已经催生了专门做全身触觉融合的团队。例如成立于2026年5月的模感科技聚焦机器人全身多模态触觉感知系统,其定位就是做机器人全身触觉的融合方案,试图将触觉感知从指尖扩展到躯干、腿部等全身接触面。这与“机器人的身体本身就可能成为一个隐式触觉系统”的论述直接对应,当触觉从指尖扩展到全身,本体感知与显式触觉之间的边界正在变得模糊。
超维动力则把这一思路推向了整机闭环。其KAI Bot全尺寸本体近80%体表覆盖触觉皮肤,约1.8万个触点,可感知0.1N级以上轻触。同时自研KAI World Model,将视频生成与4D空间建模结合,在同一套表示中处理纯移动、纯操作以及全身移动操作等不同任务。它把“本体—触觉—灵巧手—数据—世界模型—控制”做成闭环,是显式触觉从指尖向全身扩展的典型样本。高动态场景上,SMASH 2.0人形乒乓系统已实现对来球的毫秒级识别、轨迹预测、动作规划与全身协同击球,并验证了向宇树G1、智元远征A3等异构本体的迁移能力。
感知层的价值,也因此不应该简单理解为“没有它机器人就不能工作”。真正的问题是在什么任务、什么控制层、什么精度和什么可靠性要求下,显式力觉能够给机器人带来多少额外的信息,最终辅助任务决策。
05.
WBI最终考验的,可能是谁的身体数据最干净
感知层的数据干净程度,这是今天具身智能产业里一个还没有被充分讨论的问题。
过去的大模型竞争,本质上是数据、算力和模型规模的竞争。具身智能会复杂得多,因为机器人数据必须和真实物理世界绑定。如果一台机器人今天感受到的10牛和另一台机器人感受到的10牛力并不是同一种意义,数据就很难直接迁移。
如果同一款机器人在不同温度下的力觉信号发生明显漂移,模型可能把传感器误差当成环境变化。如果不同批次传感器的输出存在系统性差异,模型训练出来的策略可能很难跨硬件迁移。
这就是为什么具身智能时代,传感器的一致性可能会成为模型泛化能力的一部分。这是一个很容易被忽略,却非常重要的技术关系。模型越大,数据越多,机器人越多,这个问题反而越重要。因为规模扩大以后,数据异质性也在扩大。未来真正高质量的机器人数据,可能不只是“采得多”。而是身体状态足够准确,时间同步足够可靠,传感器之间足够一致,动作与结果之间能够建立清晰因果关系。
这也是核心零部件企业新的价值空间。它们不仅在制造硬件。它们实际上是在决定机器人能够以什么样的精度认识自己的身体。当然,这也可能是传统数采工厂模式在物理AI和世界模型的训练需求下,真正崩盘的原因。

06.
从模型竞争进入“身体基础设施”竞争
WBI真正带来的变化,并不是机器人突然学会了控制更多关节。它改变的是一个更底层的问题:机器人开始需要理解自己的身体。它要知道身体处在什么状态。知道自己正在承受什么。知道动作会带来什么后果,知道什么时候应该继续,什么时候应该退让。知道一次接触为什么成功,另一次为什么失败。
这也是为什么,最近的研究开始出现一个越来越清晰的方向:世界模型开始预测接触;触觉模型开始预测未来状态;全身控制开始考虑环境如何改变身体动力学;本体感知开始被重新理解为一种隐式触觉;力觉则开始从传统控制反馈进入更复杂的具身模型闭环。
机器人正在把身体本身变成数据。关节是数据。触觉是数据。力觉是数据。足底压力是数据。身体受到的扰动也是数据。机器人每一次成功和失败,最终都可能成为模型理解物理世界的训练样本。
所以,这一轮具身智能产业真正值得关注的,不只是哪个模型参数更大、哪个机器人动作更复杂。还有一批长期处于产业底层的创新零部件和本体企业,正在把机器人从“能动”推向“能感知、能控制、能稳定工作”。这些结果背后共同形成了一条中国人形机器人逐渐闭环的产业链路。
这或许也是今天重新讨论国产核心零部件的意义所在。机器人产业最热闹的时候,大家往往更容易看到站在台上的机器人。但真正决定机器人能否走进工厂的,往往是藏在身体里的那些东西。是一枚传感器是否稳定。一套标定系统是否可靠。一条产线能否把实验室指标复制到数万次。一家公司能否持续把产品送到客户现场,并经得起长期运行。
这些事情不会制造最热闹的发布会。却会制造真正的产业壁垒。而当WBI开始让机器人重新认识自己的身体时,这些过去隐藏在控制系统底层的能力,正在第一次被推到具身智能产业的前台。机器人最终需要的不只是一个更聪明的大脑,而是一副足够可靠、足够可测、足够可控的身体。谁能把这副身体做好,谁才真正拥有了参与下一轮机器人产业竞争的资格。
这几条线最终可能汇成同一个方向:机器人正在从“动作智能”走向“身体智能”。而身体智能的基础,不只是模型。还有一整套能够让模型准确理解身体的硬件和数据体系。因此,今天重新看待六维力传感器这样的核心零部件,不能只把它放在BOM表里。

它可能是机器人获得物理世界反馈的入口,也是未来身体数据进入模型的重要接口。但这并不意味着核心零部件企业只要踩中WBI的风口就能获得成功。
恰恰相反。WBI把行业的要求提高了。过去,传感器只需要证明自己能够测量。未来,它需要证明自己能够稳定、精准地测量。过去,产品做到一个样机的极限性能就足够形成技术亮点。未来,需要把这种性能复制到成千上万台机器人。过去,核心零部件企业可以围绕几个参数竞争。未来,客户真正关心的会是长期可靠性、一致性、交付能力和与整机、控制系统、模型协同迭代的能力。
这也是具身智能产业正在发生的一次价值重估。机器人的“大脑”正在快速进化,但真正决定它能不能成为生产工具的,仍然是身体。而身体的进化,往往不会发生在发布会的聚光灯下。它发生在零部件乃至更深的材料里、结构里上、产线上,也发生在工程师反复处理的那些看起来微不足道的误差里。
真正的机器人产业化,不是让机器人越来越会表演。而是让它在第1次和第10万次执行同一个任务时,都知道自己的身体发生了什么。这可能才是WBI真正打开的下一扇门,也是中国具身智能核心零部件企业真正应该争夺的长期能力。



VIP复盘网