克雷西 发自 凹非寺
量子位 | 公众号 QbitAI
过去一年,具身智能行业的新闻雷声大、雨点也大。根据量子位不完全统计,截至2026年6月12日,国内具身智能赛道共融资约438亿元,已经达到了2025年全年的近八成。
这些demo和融资,覆盖的场景五花八门,家用陪伴、商业导览、工业产线,每个细分领域都有公司在做。但demo跑通和真正批量部署,是两张皮的事,不是每个场景都能同时跨过去,如果视角直接盯着「具身智能」这个大概念,未免太过宽泛。
那么究竟哪个场景离批量落地最近?答案是工业。
机器人落地,还得是工业场景
听到「工业」二字,很多人会认为门槛高、技术严苛,但对于具身智能而言,工业生产反而比生活场景来得简单。工业场景中,取放、搬运、插拔,这类动作重复度高,任务边界也相对固定。
相比家用场景里随时可能出现的宠物、玩具、陌生访客,工业场景更容易在短时间内被集中突破。所以,工业变成了具身智能里跑得最快的那条赛道。
国家税务总局的数据显示,2026年1-5月,全国工业企业购进具身智能机器人的总金额同比增长了2.3倍。企业的钱,正在从「买demo」转向「上产线」。
如果说上一轮AI浪潮的主角,是「会聊天的模型」;那这一轮的主角,就是「会干活的机器」。
但「会干活」这件事,没法只靠一次对话或一段演示视频来验证。模型参数堆得再大,论文指标刷得再高,机器人到底能不能在真实产线上运转,答案都只能从产线上找。
这也意味着,具身智能这条赛道,比的是谁先把机器人送进工厂、让它连续转起来。只凭借模型参数的大小,无法取得竞争优势。
但同时也需要明晰,之前可能有一批传统的工业机器人已经开始进场上班,但这种模式仍然不能称为「具身智能的工业化落地」。
焊接、搬运、喷涂这类固定动作,传统工业机器人早已干得又快又稳,但它们面前仍然有两堵绕不开的墙:
一堵是硬件:结构固定,换一个工位、换一种物料,就要重新设计; 另一堵是软件:动作靠预先编程,看不懂场景、听不懂指令,更不会举一反三。
过去几十年,工业自动化的边界,被死死圈在「重复、固定、大批量」三个词里。
打破这两堵墙,正是这一轮技术浪潮真正要解决的问题。
为此,机器人得先看懂当前的场景该干什么,这是认知判断;再准确地把动作做出来,这是动作执行;还要在无人盯梢的情况下,稳定运行足够长的时间,不能三天两头出故障。
这背后需要一整套体系,从认知判断,到动作执行,再到长期稳定运行,每一环都要跟上。
一周六个模型,直指具身智能落地
要覆盖如此复杂的一整套流程,单靠一个模型可能确实有些捉襟见肘。
最近这几天,有家公司一口气就发布了六款模型,指向了数据生成、认知理解、训练进化、动作执行、端到端部署几个环节。从数据到部署,被这家公司用这六个模型给串起来了。
这家公司,就是专注工业具身智能商业化落地的安努智能。
六款模型,分别是实时长视频生成模型Helios、软物体仿真平台SimLab、让世界模型对动作后果负责的ActiWorld、强化学习工具EvoHIL、工业垂类模型AnuVerse-0.5,以及端到端部署系统Nexus。
看上去有点眼花缭乱,没关系,我们先用一张图看一看这些模型构成的体系,接下来再一层一层拆解。

第一步要解决的,是工业具身机器人落地绕不开的一个难题——数据采集。
Helios赋能下一代具身智能与世界模型
安努先做了视频生成模型Helios。传统的视频生成往往面临着「生成慢、时间短、易崩坏」的痛点。
Helios通过底层架构的创新,显著改善了这一现状,它不仅能实时生成分钟级的长视频,而且在单张H100 GPU上就能实现19.5 FPS的推理速度。
有意思的是,Helios最初并不是专门为机器人或具身智能设计的,但它解决的几个核心问题——长时序建模、持续生成、实时推理、高效视频生成——恰好也是今天具身智能和世界模型绕不开的基础问题,Helios目前已被多家头部具身智能与世界模型团队采用,成为具身智能研究里不可忽视的关键技术底座。
ANU SimLab聚焦软物体操作仿真
工业场景里常见的刚性物体仿真,行业已经做得比较成熟,但物料分拣、快递包装这些任务中的软体物体,褶皱和光线一变,用传统物理引擎就很难精确建模,识别难度陡增。
这种软性物体的仿真,至今仍是各家都在攻克的难题。
面向物流软包裹分拣的抓取数据生成、面向工业设备的热视觉数据生成,以及这套仿真到真机的迁移方法,安努SimLab都已经在实际项目里完成验收落地,并且用百元级机械臂、零真实标注就跑通了全流程。
它的核心是一套自研的软体和热学物理求解器,配合基于Isaac Sim搭建的合成数据工厂,再加上一套已经在真实机械臂上验证过的sim2real迁移方法,把仿真里学到的东西搬到真机上。
配合自研的数采套件负责现场配套采集,三者合在一起,构成了给上层输送训练素材的数据工厂。
ActiWorld让世界模型开始对动作负责
地基打好之后再往上走,就是ActiWorld。它的核心,就是让机器人对自己动作的后果负责,在真正伸手之前,先知道这一下大概率会不会失败。
纵观现有的世界模型技术路线,有的瞄准物理规律,有的关注空间预测,也有像英伟达Cosmos这样走平台化的路线。
问题在于,画面看起来真实,不代表它真的对应了机器人给出的动作。一旦画面对动作不敏感,视频再逼真也无法支撑决策,这种偏差在操作任务里格外致命。
所以,ActiWorld把资源押在了另外一件事上——动作后果的可验证性。

以前评判一个世界模型好不好,看的是视觉效果和画面流畅度,但这个标准会稀释动作信息,回答不了动作有没有被认真对待这个问题。
所以,ActiWorld换了个问法。
它同时关注动作、时间、空间三个角度,确保模型预测出来的画面包含足够的动作信息,用以分辨出这是抬起还是推动;确保当前状态能够「承上启下」,既能清晰描述过去,又能准确预测未来;确保模型的注意力,放在真正发生变化的地方。

为了把这三个方面的能力真正赋予模型,ActiWorld在训练环节设计了三条约束。
逆动力学头,从相邻预测结果里反推动作; 双向预测,训练时把当前观测保留下来当参照,同时要求模型既还原过去又预测未来; 运动加权,根据相邻真实画面的差异算出运动区域权重,强制模型把注意力放到真正变化的地方。
这三条约束只用在训练阶段。真正上岗的推理环节,走的还是标准接口,不多花一分钱的推理成本,而且直接兼容现有动作条件扩散骨干。
而且ActiWorld能干的,不只让画面更符合需求。
研究团队还拿它去做了另一件事,让它提前判断一套动作方案的后果,从而帮助机器人挑出更合适的动作。
测试下来,它对成败的判断和真实结果的偏差,低于3.25%。
这套预演能力,最后也在真机上得到了验证。
例如一个要求把包裹二维码朝上放到传送带上的分拣任务,原本执行策略的成功率是56%,加上ActiWorld引导的预演之后,相对失败率降了大概13.6%。
相比其他头部团队的世界模型,ActiWorld只关注一件事:动作对不对、能不能提前预判失败。
它训练时就把动作逻辑钉死,推理不加成本,也不绑任何本体,工厂落地,最缺的正是这种「先想一步」的判断力。
光有判断力还不够,机器人真正开始动手实操后,暴露出来的问题往往更棘手。
RoHIL和EvoHIL,让机器人持续可靠工作
比如光照条件一变,动作可能就跟着乱套。这是RoHIL和EvoHIL两代真机强化学习技术要解决的问题。
在RoHIL和EvoHIL框架下,机器人训练只需要30分钟就能达到满分水准,跨光照场景也不需要重新采集数据。奖励标准同样不用人工每次离线重新标注,系统会根据人工确认过的成功样本自己迭代,不用停线重训。
以USB插入这类精密任务为例,做到了100%的成功率,而且光照条件发生完全偏移时,需要人工介入的比例只有1.32%,不到旧方法的十分之一。
既然光照变化是最容易让机器人翻车的因素之一,RoHIL索性把世界模型重新打光,让机器人不管碰到什么样的光照条件,都能维持稳定的判断,跨光照条件部署的成功率做到了100%。
但产线上会变的不只是光照,工位换了、任务变了,同样会让训练好的模型失灵。
靠人工离线重新标注数据、停线重训来应付,成本又太高。
所以这时候,需要机器人拥有自我进化的能力,EvoHIL就是干这个的。
它给奖励模型、动作生成器、视觉感知都装上自适应能力,让模型自己判断动作做得好不好,不用人工离线重新标注数据、停线重训,就能适应新工位、新光照,自己生成新的动作方案去试。
真机测试结果表明,有了EvoHIL,机器人在6类典型工业任务中,成功率大幅提升。

训练、迁移、奖励设计这三块成本叠加起来,同等规模部署下,整体成本能降低80%左右。
但这里其实还没到执行层,真正落到「动作」这一步的,是世界动作模型AnuVerse-0.5。
AnuVerse-0.5攻克工业落地,实现端到端无人作业
它采用视频专家预测画面、动作专家输出动作的MoT架构,基于14B参数的Helios开发。其推理速度做到百毫秒级,一张桌面级显卡就能跑起来,速度和部署成本都处于产线边缘能承受的水平。
这套体系走到这一步,其实已经能看出安努的落子逻辑——数据、判断、执行,每一层都对应着工业落地路上一个具体的卡点。
模型的工作做完,接下来就是部署,这里安努准备了一套部署系统Nexus。
Nexus卡位产业链中最稀缺的「软件定义部署层」
不同品牌的机器人形态不一样,模型也可能不止一种,如果每换一次场景都要重新对接底层控制系统,效率就无从谈起。
Nexus把这些模型和不同机器人之间的调度统一起来,让VLA、世界动作模型这类不同的端到端模型都能快速部署上线。
Nexus端到端部署系统具备快速部署、自主调度、资源汇聚这三大优势。
另外,要想上真实产线,安全稳定是不容忽视的一环,机器人在产线上一旦做错动作,就可能带来巨大的代价。Nexus因此内置了一层基于动作层面的安全盾,兜住这类风险。
还有一个要考虑的问题是,工厂在引入机器人之前,已经有了自己的一套生产管理系统。和人类员工一样,机器人干的活也要能被看到、被管理,需要接入工厂的生产管理系统。
在这方面,Nexus已经打通了SAP的EWM和Joule系统,让机器人真正嵌进工厂原有的生产管理流程里。
除此之外,机器人在产线上的运行情况,也会用来反哺底层的数据环节。
Helios/SimLab生成数据,ActiWorld负责预测,RoHIL和EvoHIL负责机器人技能进化,AnuVerse-0.5负责执行。
它们跑出来的真实数据,会顺着这条线,回流到最底层的数据基座,接着用来训练下一轮。
如此一来,这套完整的体系就实现了有条不紊的运转和进化。
模型可以开源,部署经验不能
关于安努的这套模型体系,还有一个有意思的地方,是他们的研发路径。
具身智能公司常见的打法,是先把模型打磨扎实,再拿着模型去找场景落地。
安努却选了另一路,他们没有一味追求强大的基模,却让工程师先扎进富临精工的真实产线。这背后源于安努一个独到的判断。
安努智能董事长兼CEO文宏杰表示,以前看一家公司,往往先看技术路线、团队背景、市场空间和资本效率。真正进入工厂以后,他对具身智能的理解发生了变化。
他认为,模型能力会随着全行业进步持续外溢,真实产线上,单项技术指标做得足够好,并不能保证整套系统长期运行。
只有部署经验才会越攒越深,成为自己的制胜武器。后来具身行业的发展,也印证了他们的这一预测。
这两年,越来越多的具身基础模型相继开源,没有自己模型的那些公司,也有了可以踩上去的开源肩膀。安努智能就是这么做的,他们基于开源模型,用几个月时间把认知底座和动作模型补了上来。
模型可以依靠开源,但产线上的部署经验,必须靠自己实打实的积累。
这个判断这两年也逐渐得到了行业里更权威声音的印证。
高盛在8月底发布的一份全球具身智能研究报告里提到,机器人走路、导航这类能力,很大程度可以靠仿真训练解决,但柔性物体操作、工具使用、精细抓取这类任务「本质上无法仿真」,因此稀缺的始终是来自真实产线和真实场景的部署数据。
报告因此把这类「部署产生的专有数据」,看作机器人公司真正长期的护城河,比模型代码、机器人外形更经得起时间考验。
为了获得这样的积累,安努的工程师们直接奔赴产线,去收集问题、解决问题。
比如有的抓取任务,实验室里能做到100%成功率,但一搬到产线上,只因为车间顶灯换了个角度,成功率瞬间跌到40%。这种情况在安努入驻的富临精工就真实发生过。
这类意外很难在论文和开源模型、数据集里找到,但却是产线上的常态。
安努内部用FDE(前沿部署工程)来类比这套工作方式。
在驻场环节,工程师解决的是具体问题,项目结束后,人力会撤出,但能够复用的产品能力被保留了下来。
工程师把这些踩过的坑,一点点沉淀成可复用的技能包,下一次遇到同类场景,直接复用就好。
效果也是立竿见影,富临精工的第一个工位,安努用了4个月才跑通部署;有了这些沉淀下来的技能包,同类型工位现在3天就能搞定,而且设备平均故障间隔时间做到了300小时以上。
先部署换来的,是把原本要花在实验室里的时间,提前拿来积累产线上的经验。等模型这一环补齐,安努手里就已经握住了同行还没来得及攒下的部署know-how。
这份经验不会随着模型开源就贬值,反而会随着安努把机器人送进更多工位、更多工厂,越滚越厚。
正如安努董事长文宏杰所说,「当新增一台机器人带来的软件收入增长,快于交付人力的增长,公司才真正进入规模化阶段。」
企业能不能摸到这条线,靠的正是这些产线上踩出来的经验。
这些经验也将成为之后的具身赛道上,能否真正拉开身位的决定因素。
Q&A
带着疑问,我们和安努智能团队做了一些交流。接下来就把交流的内容,以对答形式呈现给大家。
Q1:你们敢说「全栈闭环」的底气是什么?
答:我们选择了另一条兼具挑战却更贴近商业化的路径:把通用基座模型的「动作精度」打磨到工业产线愿意买单的水准。
我们基于通用基座模型,融合富临精工、英特尔等产线回流的真机数据,搭配SimLab仿真平台与Helios生成的长尾数据联合训练。经ActiWorld校验动作、筛选有效样本后,送入拥有抗光照、高鲁棒、自主进化专利的RoHIL/EvoHIL强化学习系统完成迭代;再通过模型蒸馏将能力沉淀至端侧小模型AnuVerse0.5,实现百毫秒级实时响应;最终由Nexus系统完成产线一键规模化部署。
安努的核心壁垒并非从零搭建世界模型,而是在通用基座与真实产线之间构建「检验-学习-执行-落地」的技术闭环。上游重研发、重算力的基座由头部厂商深耕,下游真实场景应用数据来自客户,安努聚焦中间层,让机器人在工厂真正落地,比人工更稳、成本更低,
这就是我们「全栈闭环」的底气。
Q2:如果本体厂商自己下场做工业场景怎么办?你们会不会被吃掉?
答:参照笔记本电脑、智能手机再到新能源汽车的产业发展路径,能成长为行业巨头的主机厂,走的无一不是扶持生态伙伴的路线。
唯有相互依存、双向赋能,才能把产业规模真正做大。我们和本体厂商的关系,也正是如此。
本体商需要有人去证明「我的基座在工厂真的跑得起来」,我们则需要他们的本体和算力支撑;我们在垂直场景沉淀的工程化know-how成果,也会反哺优化基座模型,实现双向增益、生态共赢。
就像英伟达自己不开发游戏,但几乎没有游戏公司能脱离它的技术底座。基座越通用、底层能力越强,安努作为垂直场景公司打磨出的行业方案价值就越高。
Q3:你们的工业数据壁垒到底有多深?别人拿同样基座微调不也能做?
答:数据壁垒不在「量」,在「质」和「闭环速度」。
其一,我们的数据全部源自真实产线:我们联合富临精工、英特尔等伙伴深耕产线超一年,沉淀了深度的工程化交付及标准化产品的know-how;
其二,真机数据成本高、周期长是行业普遍痛点。我们依托SimLab仿真平台与Helios打造了安努独有的工业长尾数据生成管线,以远低于行业的成本生成物理一致的合成数据,再经真机回流校验,形成「合成-真机校验-再合成」的正向飞轮;
其三,Nexus部署系统是数据飞轮的核心入口:机器人部署越多,回流数据越丰富,模型精度越高,后续部署越高效,形成滚雪球式正向循环,先发者将占据全量优势。
Q4:你们团队这么小,同时推进这么多重研发模块,执行力怎么保证?
答:我们不是每个模块都从零自研,而是精准卡位+生态借力+端侧应用轻研发:
世界模型基座 → 采用本体厂商开源/授权版本; 3D视频生成 → 联合北大、字节、Canva共同研发; ActiWorld → 与香港科技大学(广州)共同研发; 强化学习框架 → 联合重庆大学及香港大学。
安努将研发攻坚集中锚定两大核心:AnuVerse 0.5端侧垂直小模型与Nexus端到端部署系统。前者是工业垂直场景的核心执行能力,后者是客户真正的付费价值所在。
正因坚持应用端轻量化研发路线,安努团队无需臃肿配置,也没有巨额算力投入,既不追逐论文的学术热度,也不跟风布局通用AGI赛道。场景和任务足够聚焦,团队的执行效率才会更高。
Q5:目前有实际订单吗?客户付费意愿到底怎么样?
答:有,而且不是POC(概念验证)。富临精工绵阳工厂的料箱搬运场景,已经是批量订单在跑了。
制造业客户付费逻辑很直接——算ROI。我们的机器人一机多岗靠Nexus调度,换线不重新示教(RoHIL零额外交互),单班回本周期能压到12-18个月,比传统工业机器人便宜40%以上。
Q6:Cosmos 3这类通用世界模型加上ICL技术继续发展,对安努到底是冲击还是机会?
答:Cosmos 3+ICL的发展对通用模型公司也许是杀估值的事,但对安努的部署态则是效益放大的杠杆,而不会是威胁。
通用基座越强,越能把「通用推理」变成水电煤一样的基础设施。武器免费了,扣扳机的人和靶场就会变成稀缺资产。
安努的壁垒从来都不是「再造一个世界模型」,而是在工业现场的真机数据飞轮、工艺约束建模、以及从仿真到产线365天不停转的部署能力。
Cosmos再强,也解决不了「这个工位敢不敢用、稳不稳、停机一小时赔八万谁担责」的问题。
所以我们的叙事不是「我们也有世界模型」,而是「我们把世界模型接进了工厂,保证它真的能用、敢用、持续用」。
长期看,具身智能的竞争将从「谁的模型更聪明」转向「谁在真实产线里跑得更久、ROI更高」。
而后者,正是我们过去两年在富临精工等客户现场已经被真实工业产线验证过的核心壁垒。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标


VIP复盘网