一句话讲清楚 阿里 Token Hub 联合北京通用人工智能研究院、清华、南大、北大发布 HappyWorld-Bench ,给世界模型评测定了一套从感知到通用的六级标准,把视频、空间、机器人三类模型放进同一套题目里,结论是当前卡住大家的已经从画面质量转到交互:模型能不能在交互中保住世界状态,能不能对动作和规则改动做出正确响应。

论文标题:HappyWorld-Bench
论文链接:https://arxiv.org/abs/2609.24308
项目链接:https://skyeval.com/sla/arena/happyworld
让模型生成一段第一人称视角的视频,画面里有人推开门、有鱼在游、有落叶贴在车窗上,这些现在都能做到。麻烦出在后面。镜头转回同一个房间,墙角位置变了。提示要求夹出筐里的纸团,模型夹起的是筐外纸巾。提示里写「把重力调低」,生成结果和正常重力没有任何可见差别。
上面三个例子都来自这篇论文的评测集,分别是场景重回、动作指向错误、规则改动失效。它们有一个共同点:世界模型能不能当作环境来用。一个世界模型有用,前提是它预测的东西在交互下仍然成立。可现有的评测是割裂的,视频模型比视频质量,三维重建比重建质量,机器人模型比动作条件下的画面逼真度,三套接口、三套评分标准,谁也没法回答「这个世界在交互下靠不靠谱」。
论文给出的六级能力示意。从 W1 凭一张图构造连贯世界,到 W6 在不同世界之间迁移泛化,每一级都配了对应的提示和交互输入。 W1 没有交互输入,只让世界自己演化。
六级标尺:从看得见到靠得住
论文的第一件事是定义什么叫可靠。它把世界模型的能力拆成六个递进的层级,每升一级就多一个要求。
W1 感知世界:凭一张图或一段文字,生成一个内容说得通、布局不乱、短时间内不会崩掉的世界。
W2 交互世界:预测你做完某个动作之后,画面里的人、物体和环境会怎么变,同时保持局部的几何、物理和因果关系。
W3 持久世界:长时间交互、换视角、被挡住又绕回来之后,全局布局还在,之前看到的还是同一件东西,积累的状态不丢。
W4 可编程世界:允许对物体、事件、行为甚至世界规则下明确指令,改了的东西按因果关系跟着变,没被改的部分保持原样。
W5 可扩展世界:世界可以一直延伸,并被多个机器人或虚拟角色共享,支持互相通信、同步、配合与冲突处理,每个角色只能看到自己那部分画面。
W6 通用世界:把生成、模拟、状态记忆、交互和规划放进一个系统,换个环境、换个任务、换种输入方式、换一副身体也照样能用。
W1–W6 的正式定义。 W6 被定为长期目标,本次评测不评分;有实际得分的是 W1–W5 。
这六级的意义在于把「世界模型」这个词拆成可检查的条目。一个模型能生成好看的视频,说明它到了 W1 ;要把它当环境用,得看 W2 之后的表现,因为低层得分高并不保证高层也能拿分。
三条赛道,各测什么
同一套标尺落到三种模型形态上,就成了三条赛道。
视频世界模型赛道测的是没在输入里给过的那部分画面在空间和时间上是否自洽。给定首帧和一段按时间标注的操作,看生成的后续画面是否守住世界。空间世界模型赛道测的是导出的场景能不能被实际使用,输出可能是网格,也可能是用 3D 高斯点云表示的场景,也就是一堆带着位置和外观参数的三维点;评测直接在导出的几何上做导航和物理操作。机器人世界模型赛道(论文里叫具身世界模型)测的是模型能否从第一人称视角,预测机器人自己、周围场景和被操作的物体在动作下怎么变。
三条赛道的数据规模分别是:视频 1,138 条提示,空间 300 个场景,机器人 254 个测试用例,合计 1,692 个实例。场景横跨机器人、城市与室内、自然、交通、游戏世界、日常生活、工业、幻想、材料九个领域,生成时长从几秒到 60 秒,首帧分辨率从不足 1 百万像素到超过 8 百万像素。
数据集构成。左环是能力分布:感知与表征、一致性与状态保持、因果与因果推演、可控交互与反事实、多主体配合五个维度,下分 74 个细分能力点。中间两栏是应用领域和 W 级覆盖,右侧是生成时长与首帧分辨率分布。
数据的构造方式值得看一眼,它决定了这份评测到底在测什么。
数据处理流程四步:表示与采集(每个用例含首帧、场景与主体描述、按时间标注的控制序列)、按目标能力设计任务、人工质检、生成逐用例评分清单。
第一步采集的用例里有真实照片、渲染图和生成图三类首帧。第二步按目标能力设计任务,控制序列只给方向和时长(比如「向前 3 秒」),不给目标坐标,因为同一段输入在不同模型上对应的实际位移差别很大。第三步人工质检,剔除评测目标含糊、控制不可执行、证据不足的用例。第四步为每个用例生成专属评分清单。右边那个例子很典型:一条低重力干预的用例被拆成三段, 3 秒到 8 秒看动作有没有跟上前后指令, 15 秒到 30 秒看低重力响应以及重力恢复后能不能稳住,全程看地板和窗帘有没有变样。本来就不该管的条目,不算进平均分。
这一步解决的是评测里最难缠的问题:如果评分标准不分时间段和对象,模型只要把画面做糊,或者让东西一动不动,就能混过评分。
怎么打分:自动指标加人类对战
三条赛道都用两套互补的打分方式。所有能力分都归一到 0 到 100 ,越高越好。
自动指标负责细粒度,把分数拆成几块,每块回答一个问题。视频赛道拆成四块:画面好不好(画质、感知偏好、成像稳定性)、动得够不够(动态程度)、前后是不是同一个世界(背景、几何、纹理、状态、主体五项一致性)、听不听话(指令跟随、轨迹准确度、动作执行)。最后一类到了需要干预的 W4 会换成另外两项:改动有没有真的落地,没被改的部分有没有被带着变。空间赛道按 W1 到 W5 分组,用渲染画质、能不能走进去、物体跨视角是否还是同一件、编辑执行与保留、扩展与保留来打分。机器人赛道有 17 个指标分成四组:感知 4 个、一致性 5 个、因果 3 个、可控 5 个,四组按 20%、 20%、 30%、 30% 加权。
人类偏好负责整体。三条赛道都开了 HappyWorld-Arena ,把两个匿名生成结果并排放给评分者选一个,再按两两对战积分算模型级 Elo ,所有模型的平均分固定为 1000 ,分数只表示相对强弱。机器人赛道的积分来自 62,592 次盲选投票。
Elo 的算法里有一个细节。只看人类投票,一个干脆不支持某项能力的模型反而占便宜,因为评分者只会在它支持的项目上给它投票。所以论文额外补齐了比较:对每一条提示、每一对模型,只要有一方不支持被测能力,就按两种展示顺序各补一次,支持的一方判胜;两边都不支持则记为「都不好」,各得半分。补进来的比较和一次人类投票权重相同。
结果是空间赛道的积分既反映做得好不好,也反映覆盖得全不全。 FlashWorld 只能渲染出画面,几乎没有可以走进去的区域,在这套补齐规则下积分只有 743 ; Lyra 2.0 和 Lyra 1.0 分别是 729 和 728 ,都远低于 Marble 的 1308 。
视频赛道:状态一致性掉得最快
先看总表。 14 个交互式视频世界模型加上 5 个视频生成基线,两两对战积分最高的是 HappyOyster ( 1263 ),其次是 Genie 3 ( 1206 )。
视频赛道总表。积分来自人类对战, W1–W4 是分级能力得分( 0–100 )。只有 HappyOyster 与 Lingbot-World-v2 支持 W4 需要的干预接口,其余模型该项记「-」。
分开看各能力级,排名会换位置: Genie 3 的 W1 得分最高( 82.8 ), HappyOyster 紧跟( 82.4 ),但 W2 和 W3 都是 HappyOyster 领先( 78.0 和 76.8 )。 W4 只有两个模型能测, HappyOyster 66.7 、 Lingbot-World-v2 59.3 。
在 HappyOyster 自己的四级得分里, W4 的 66.7 是各级里最低的一档;另一个唯一能测 W4 的 Lingbot-World-v2 更低,只有 59.3 。让模型按自然语言指令修改世界规则,是这批模型目前最不擅长的一项。
四组定性对比,每级左右各一个系统。 W1 鱼缸: Genie 3 保住鱼和水草, Lingbot-World-v2 让鱼游出了缸。 W2 镜子: HappyOyster 手与倒影同步, Genie 3 手型错位、反射脱节。 W3 落叶: Genie 3 再次回到车窗时位置一致, JoyAI-Echo 几何漂移。 W4 医疗兵: HappyOyster 让人移动并靠近目标, Lingbot-World-v2 把人拍到画面外,还凭空生出一个提箱。
这张图对应的是四个层级各自的典型失分方式: W1 物体跑出合理范围, W2 交互对象之间的物理关联断掉, W3 再次回到同一处时几何对不上, W4 提示里说的改动没落地,反而多出不该有的东西。
有一个数字特别容易被误读。 Lyra 2.0 在 W1 的动态程度只有 4.50 ,几乎不产生可观测运动,却拿到了全表最高的几何一致性 99.44 ,状态一致性 96.42 也是这一列里的最高值。同表的 MatrixGame-2.0 动态程度是 0.00 ,状态一致性只有 27.98 。两个模型的动态度都接近零,一致性却差了近 70 分,论文没有单独解释这个差别。
能确定的是:读一致性分数时要把动态度并排看。画面不动确实能让一致性显得很好,但不动本身就是一种失败。论文没有把这两项合成一个分数,这一点在看榜时得自己补上。
空间赛道:渲染质量与可用性分家
空间赛道评的是从图片或场景描述构造出来的可渲染环境,输入和任务都做了专门的标注。
四类专项标注:环绕视角一致性评估的目标物体、用于放置测试的支撑面、编辑指令示例(把长椅改成白色、把天气改成下雨)、可用于空间扩展的开放场景。因为现有方法都做不到既建模空间又随时间变化,这条赛道只收静态场景。
结果里最重要的一条是:渲染质量最好的系统,未必是能用的系统。
空间赛道总表。积分已按「能力是否支持」做过补齐比较, W1–W5 是分级得分, W5 只有四个系统支持。
按补齐后的积分, Marble 1308 排第一, GPT-6-Astra 1252 、 HYWorld-2.0 1230 紧随。但看分级成绩,走势完全不同: Marble 在 W1 拿到 79.10 ,到 W5 只剩 45.44 ; GPT-6-Astra 的 W1 只有 63.72 ,却在 W3 、 W4 、 W5 上全面领先( 68.80 、 82.09 、 63.10 )。
这个反差是这条赛道最有价值的发现。 GPT-6-Astra 的场景看起来偏合成,表面干净、几何细节少、材质真实感弱,但导出的环境能导航、物体转一圈还能认出来、编辑能落到指定目标上、扩展能把已有区域留住。渲染最漂亮的几个系统在这些项目上都不占优。
物理可用性最能说明问题。评测在导出的几何上做两件事:算有多大比例的区域能连续走过去,以及在标注好的支撑面上放盘子能不能放稳。
WorldGen 的可导航比例 68.83%,和最高的 GPT-6-Astra ( 69.05%)几乎持平,放稳盘子的成功率却只有 51.39%,不到 HYWorld-2.0 的 70.14%。能走和能放东西中间差着一层。 FlashWorld 和 Lyra 系列导出的几何破洞太多,两项都接近零,画面能渲染出来,但构不成一个可以走进去的空间。
上面这张表是节选,省掉的四级系统分别是: GPT-6-Astra (可导航 69.05%、放置 61.81%)、 HYWorld-1.0 ( 51.90%、 66.90%)、 Matrix-3D ( 64.09%、 48.61%)、 Lyra 1.0 ( 2.72%、 0.00%)。
编辑和扩展也是同样的分化。 HYWorld-2.0 的编辑执行率最高( 73.33%),但 GPT-6-Astra 在「有没有乱改」这一侧更好。评测把编辑是否达成和保留度合成一个编辑联合分: GPT-6-Astra 49.57 , Marble 35.08 ,满分 100 。这个分整体偏低,说明改得动和只改该改的地方要同时做到仍然很难。 GPT-6-Astra 的强项正在后一半:编辑目标物体时背景颜色像素一点没变,改完之后几何也没塌,深度一致性 99.57 。
扩展更明显。 GPT-6-Astra 的空间面积得分 39.71 、旧区与新区接缝处的完整度 67.48 、原有区域保持不变的程度 52.54 、连接路径保留 83.20 ,四项都是最高。 Matrix-3D 的面积得分比 HYWorld-2.0 和 Marble 都高,但扩出来的新区质量只有 22.78 、旧区保留 22.57 ,是全部系统里最低。扩得多,不代表扩出来的地方可信。
五级定性对比,每级左右各一个系统。 W1 渲染画质; W2 放盘子( Marble 6 次全成, WorldGen 只成 1 次); W3 环绕视角下的物体完整性( WorldGen 的柱子和台面已经碎掉); W4 全局编辑( GPT-6-Astra 把晴天改成雨雾, HYWorld-2.0 几乎没变); W5 空间扩展。图中这一例 GPT-6-Astra 把面积扩到 2.45 倍、 HYWorld-2.0 只有 1.07 倍,模型级平均面积得分则是 39.71 和 5.70 。
机器人赛道:动作看着对了,事情没发生
这条赛道的输入只有一张第一人称参考图和一段用自然语言写的动作提示,模型要生成的是一段视频:,其中 是动作前的参考图, 是动作提示, 是生成出来的 帧。换句话说,模型只需要看一张图和一句话,就往下演。这个设定足够宽松,任何能生成动作条件视频的模型都能参加,不需要仿真器、动作解码器或者真机。
254 个用例分成三级: W2 单步原子动作 62 个( 5 秒), W3 有序多步序列 100 个( 12 秒), W4 从同一初始状态出发的成对干预 92 组(每组两条 5 秒片段, 40 组改动作条件、 52 组改物理规则)。所有视频统一成每秒 24 帧,再每隔 6 帧取 1 帧来评分。
机器人赛道总表。积分来自 62,592 次盲选投票, W2–W4 是三个级别的综合能力分( 0–100 )。
MiniMax-H3 在三个级别上都是第一( 93.60 、 91.42 、 88.62 ),积分也最高( 1060 )。 Cosmos 3 和 Sora 2 在三个级别上都不到 75 分。
先看 W2 。这一级的失分跟画质无关,场景保真度、主体保真度、帧级画质在所有模型上都很高,感知不是瓶颈。问题出在动作、接触和结果之间的因果链断掉了,论文归成三类。
W2 三类失败。上行:要求两个夹爪夹住砧板两侧竖着抬起,实际是夹爪在砧板旁边的空气里反复开合,砧板始终没离桌。中行:要求夹出网筐里的纸团,实际夹起的是筐外的纸巾。下行:要求把托盘和上面的东西往前推,结果原本空着的托盘凭空多出盘子和餐具,视角也脱离了固定的相机位置。
三类分别是:该建立的接触从没建立、交互打到了别的物体上、场景或视角出现没有原因的变化。还有一类更隐蔽,动作和物体反应看起来都合理,最终该达到的结果却被违反,比如抬起的物体被放到目标容器外面,或者滑动后的物体停在一个不稳的姿态。
论文在这里给了一条判据:一次成功的生成要构成完整链条,动作之后出现对应接触,接触带来一致的物体反应,物体最后停在规定位置。只看动作像不像,会漏掉大多数真正的问题。
W3 的毛病出在状态传递。
W3 三类失败。上行:要求先开马桶盖再擦,盖子全程没开,机械臂却在关闭的盖子上完成了擦拭动作,最后毛巾也没放回去。中行:要求把衣架从杆上取下、平移到左边空位再挂上,实际只是取下来一直握着,另一只手还抓起一个空衣架举在半空。下行:要求抖开 T 恤后放进右边的条纹篮子,最后衣服挂在篮沿上,只有一角垂进篮子。
三类失败分别是:初始状态没建立,后面所有阶段失去前提;中间状态没传给下一阶段,后一步对着空状态或错误物体继续做;累积到最后没达到规定位置。共同的毛病是顺序、传递、累积这条链断了,动作看着一步步做了,前一步的结果却没有留给下一步,最后什么状态都没攒下来。
W4 的问题最直接:模型对编辑不响应。
W4 成对干预。上行一组:两条分支都要求夹起易拉罐,下方那条额外规定材质是软橡胶,结果两条分支的形变完全一样,规则改动没留下痕迹。下行一组:上方要求夹起咖啡机右侧的奶壶并提起,下方要求接触同一个奶壶并沿桌面向左推。结果下方奶壶确实向左移动了,但方式是夹住手柄拖过去,不是规定的推动接触。
物理规则这一类的响应几乎为零。材质、重力、摩擦怎么改,生成结果都一样。动作条件这一类只有部分响应:方向和目标大致对上了,交互方式却不对,要求推的变成了抓住拖。论文的判断是,模型没有把提示里写明的条件当成约束。
数字上有个细节值得单看。 Cosmos 3 在 W2 的物理合理性得分是 99.46 ,看起来物理完全没问题,但同一行的时序与因果顺序只有 45.16 、最终位置达成 50.00 、原子动作符合度 46.77 、功能交互成功 48.39 。 Sora 2 的结构类似:物理合理性 90.86 ,最终位置达成 37.10 。画面里的物理看起来都对,因为动作本身就没发生。论文把感知、一致性、因果、可控拆成四条轴分开打分,正是为了让这两种失败不混成一类。
这套评测现在还测不了什么
论文自己列出的限制很清楚。 W6 只作为框架里的一个设想存在,三条赛道都没有为它评分; W5 只有视频和空间两条赛道上有部分实例。空间赛道因为现有方法都做不到既建模空间又随时间变化,只能收静态场景,筛选时还排除了含人像或可见肢体(手、腿)的首帧。机器人赛道的动作条件目前只有自然语言提示一种形式,论文说接口可以扩展成离散的机器人动作,但现在还不是。
指标侧的依赖也值得留意。物理因果、画面内容的因果关系、物体穿模、编辑有没有达成这些关键判断,由视觉语言模型按清单打分;空间赛道的几何与轨迹一致性依赖深度估计模型;状态一致性和主体一致性依赖分割与视觉特征模型。这些模型本身的误差会进入分数,论文用固定不变的判断标准和固定版本的评测模型来压低波动,但没有给出这些上游误差的量级。
三条赛道一共评了 31 个系统。视频赛道积分第一的 HappyOyster ,在论文里的署名机构就是 Alibaba Token Hub ,和 HappyWorld-Bench 排在第一位的机构是同一家;名单里还有阿里云的 Wan 3.0 ,命名同源的 HappyHorse 1.1 也在其中。其余多是外部团队的模型,跨赛道的交互短板另有多条独立证据指向,这个结论本身站得住。差别在于对比自研系统和外部系统的分数时,读者可以多留一分心。
判断
这份工作最实际的贡献是把「什么叫可靠」拆成了几条能逐条打勾的检查项:接触有没有建立、状态有没有传递、再次回到同一处对不对得上、改了规则会不会变。按这几条看,当前所有系统都停在同一个位置,生成能力远快于交互能力,而交互能力里最弱的一环,是按指令改变世界并让改动持续生效。
如果你的工作是把世界模型当环境用,这份评测里优先看的是各级的失败模式分类,总分排在后面。论文展示的失败案例里,规定成软橡胶的罐子和硬罐子形变一模一样,材质、重力、摩擦这类规则改动在这批模型上几乎不会留下痕迹。这才是最该先补的一块。


VIP复盘网