01
多场景落地:三道难关
大家下午好。我是来自浙江人形机器人创新中心的熊蓉。我们在两年半的时间里,主要是面向人形机器人能否在多场景中应用、如何做到这一点,开展了一系列工作。经过两年半的努力,也展示了我们目前不管是在零售、商服,还是在工业的各个场景里面,验证了这套技术体系的有效性,部分在工厂里也实现了真正的落地应用。今天在这里给大家介绍一下我们在基座和生态建设上开展的工作。
我的报告会分为四个方面展开。首先来讲一下多场景应用所面临的难点
随着社会的发展,越来越多的行业场景对机器人提出了应用需求。但与目前很多场景中机器人规模化应用相比,这些场景面临着这样的特点。首先,整个市场需求很大,但就每一个场景来讲,应用量可能并不是那么大规模的——所以它是高度碎片化的。而且这些场景差异很大,里面的物品各种各样,并且随着生产生活的发展,也在快速迭代。
第二,很难再用“一个机器人干一个活”的思路。往往是由人完成一系列工作——包括取料、对准、使用工具、最后放到指定地点。如果用传统方法,可能需要多个机器人,占用更大空间,改造成本较高。所以如何让一个机器人完成长程的多样化任务,是第二个难点。
第三,任务的执行是柔性变化的。生产制造正向柔性化、个性化发展,需要能够快速换线,甚至频繁换线。生活中各种情况会突发,需求在不断调整,环境又是动态变化的,具有很强的非结构化特征。所以很难用传统方法,由专业人员提供解决方案,做场景固定、定制开发等。原来的方法很难在这些场景中实现。
所以我们选择具身智能这条途径,来解决场景多样化、柔性化的需求。我们希望通过通用的行为智能,加上人形机器人作为通用载体,更好地适应人类为自己打造的生活和工作环境。当二者能力叠加,市场非常广阔,其规模与智能水平密切相关
现在已经有很多在产线上和生活中应用的机器人,基本具备L2级智能,部分具备L3级,大多数处于二三级之间。我们要做的是达到L4级——能够适配多个场景,在场景中完成非结构化、柔性化的任务。当具备这个能力后,才能通过数据叠加,推动大模型向全面智能进军。
这两年具身智能技术快速发展。人形机器人整机方面,中国已有近200家整机企业。具身智能大小脑模型,各家都开展了丰富的研究。总体来看,2024年我们应用模仿学习加强化学习,使人形机器人具备了灵活的运动能力;2025年做了充分展示,并结合语言视觉大模型提升机器人的自然交互能力。到今天,沿着VLA、VLN等端到端行为策略学习,到结合世界模型构建世界动作模型,可以看到作业智能大大提升,大家也在多个场景中进行了验证。在这次世界机器人大会上,相信大家也有深刻感受。
但这些技术演示如何落地?还要解决哪些问题?如果机器人真正进场,还有一些问题需要解决。
02
从演示到产线:四个Gap
首先,它能否在工厂环境中长期可靠地运行?进了工厂以后,会有很多突发情况、异常工况。这种情况发生时,模型会失败,导致整个作业失败,就需要采集数据、补充数据、进行训练
第二,泛化能力实际上还不足。现在往往是一试一训——当物体变化、场景变化、光照变化,又要重新采集数据、进行学习训练。
第三,目前操作基本在厘米级到毫米级,但工业上往往要达到亚毫米级。而这部分操作精度,视觉已经不可见,需要用力触来解决——这方面我们还有欠缺。
最后,大家都觉得机器人执行效率偏低。因为感知、推理、决策到控制形成的回路,与原来闭着眼睛重复干相比,多了很多环节,还要保证推理执行的准确性,都使其更加耗时。这些使得它与真实落地应用之间,除了要解决泛化性,还要保证可靠性、高效率、低成本,以及工业场景中的高精准——之间还存在一个gap。
我们会发现,现在这些方法并没有真正解决传统模型的问题。泛化性不够,希望通过数据多样性来学习——并没有达到这一点,甚至失去了原来机器人所具备的精准、可靠、高效的执行能力。这是我们所面临的问题。
归根到底,这是因为物理世界具有不可约性。为什么专家模型不行?因为专家模型无法用总结学习出的规则来描述物理世界的复杂性。同样,现在的数据和模型能力,也无法涵盖物理世界的丰富性和复杂性。
03
技术破局:四个层面
技术方面,我认为有几个点需要注意。
第一是表征层。具身智能的核心在于与环境的交互,这种交互不仅体现在视觉上,而现在大量模型学习都基于视觉表征。但交互一定涉及力触,且这种力触与形状、重量、材质、行为强相关。我们很难用视觉表征出物理交互的本质。在仿真中学习,也面临Sim to Real的gap问题。所以我们在表征层提出了将视觉、力触融合的通用表征方法,可以支撑在仿真中学习训练,再迁移到真实环境。
第二是感知层。现在很多做法是将语言、视觉和行为做对齐,这极大依赖于语言视觉大模型。但这些大模型并不完善,缺乏空间理解能力和物理常识。在开放混杂的场景下,感知精准性会显著下降。当看不清、识不准时,会直接影响行为生成。所以不能仅仅依靠行为与感知的对齐来解决问题,感知能力依然需要增强。我们在VLM基础上增强了空间理解能力,并构建了对环境中各种物体在非接触和接触状态下的预测模型,用预测模型推动行为学习。由空间理解能力、预测模型和实时感知模型形成世界模型,让世界模型与具身模型协同进化
第三是模型层。目前高度依赖数据堆砌和驱动,但缺少抽象思维能力。如果学会了怎么拿一双鞋子,鞋子千变万化,人不需要学习很多双鞋子怎么拿,不需要采集那么多图像。所以要考虑如何举一反三。否则,当各种任务、各种数据堆砌在一起时,多维度、高维度数据融合带来的学习挑战会更大。我们通过表征的突破,形成了Real to Sim to Real的数据飞轮,构建了大规模训练数据。
第四是数据。仍然需要低成本获取大规模高质量数据的方法。现在已有多渠道的数据采集方法,如何提升数据质量,也需要持续优化。
这是我们目前形成的整个智能模型体系。在智能世界模型中做了认知模型加强、感知模型优化、即时预测模型。在具身模型方面,做了大小脑分段训练,再做融合。让大脑适应环境和任务,实现混杂开放场景下的长序列规划,并能检测错误进行纠正;让小脑适应环境的即时动态变化、适应各种物体,保证具有语义性、精准性的技能作业能力。
认知基础模型和感知重构模型对具身大脑模型发挥主要作用,认知基础模型和即时预测模型对小脑发育起主要作用。同时引入专家模型,让我们能学习专家模型中已有的人类总结过的知识能力,具备通用性,不需要反复采集数据训练;同时通过数据补偿专家模型对长尾场景的覆盖不足
通过这样的方式,我们将模型各部分拆解、优化,再融合进化,既能实现更好的端到端发育,也推动这些技术直接在应用中落地。训练架构上,我们会采集真实环境、物体和人的操作行为数据,通过高保真重构和重定向技术进入仿真环境。在仿真中,环境变得可编辑,能生成各种新数据。用通用表征建立基础预测模型,推动行为策略学习,行为策略又与预测模型不断迭代,推动两者能力提升。语言视觉大模型提供语义表征,已有专家模型提供专家知识表征。
通过这种方式,很多场景中可以不用重新训练,直接在真实场景中通过人的简单示教,一次示教就能完成具体任务。当然,对于部分复杂的、特别是高精度操作,需要做一些校正,通过真机强化来实现。
04
基座与生态:从实验室到产线
通过这些体系,我们构建了具有泛化性和精准可靠性的具身智能大小脑模型,为实现通用奠定了基础。同时作为产品体系,也要有好用的机器人。我们注重能够双臂手协同作业的机器人,保证精度、实时和可靠;以及能够在多行业中、让开发人员便捷使用的工具链。它构成了面向各行业、各种场景应用的基座和支撑,也构成了与行业合作伙伴合作的基础。这是我们的工具链和整机,具体不展开了
目前已经实现了多行业、多场景应用,部分已实现规模化。3C领域已签约百台级订单;服装领域签到了2000台订单——能完成汽车装配,服装柔性面料抓取,包括做衬衫布、牛仔布、贴袋模板机操作;也能做透明液体的精准分液,精度可达1毫升;能做物流中的拆垛、码垛,以及柔性屏的撕膜、贴膜、上下料检测。也有出口海外完成各种任务。在服务场景中,包括厨房,今年3月发布了机器人总厨Cook。也有面向安防巡检的1.8米全身人形机器人,在教育领域也做了很多推广,培养相关人才。
总体来讲,验证了通过基座和产品体系能实现跨场景应用,并达到工业级亚毫米精度和4个9(99.99%)的成功率,得到工厂高度认可。特别是效率近几个月快速提升——搬运5米内可达35秒;贴袋全流程人工40秒,机器人可做到50秒,达到人工的80%。
在这样的基础上,这几年也一直在与生态合作。上游供应链方面,提出优化需求,进行性能测试,为合作方提供组装工艺和作业指导,推动国产化率提升。下游覆盖了多个行业,与头部合作企业共同打造新的解决方案。有一批数据合作伙伴,为他们提供标准化数据采集与标注工具链,共同面向行业需求定义场景和采集规范。与很多应用开发伙伴联合创新解决方案,为他们开发赋能。
除了产业协同,我们也深感整个产业人才非常缺乏。所以与研究类大学、应用类本科、职业类高职和中职院校都开展了合作,结合应用方企业共同进行人才培养赋能。提供整套课程体系、教学载体,把实际场景融入实训基地。成立了产教融合共同体、产业联盟和行业人才培训基地。目前已培训200多名教师和1000多名学生。
我们希望为具身智能人形机器人的发展打造更好的基座,让我们走得更远更好。谢谢


VIP复盘网