返回首页
[ 行业新闻 ] 2026-08-29 15:50

自变量发布WALL-SS世界模型:机器人连续推演60秒,虚实迁移准确率89%

自变量发布WALL-SS世界模型:机器人连续推演60秒,虚实迁移准确率89%

自变量机器人在8月27日推出了WALL-SS下一尺度自回归世界模型。这个模型用“由粗到细”的预测思路,再加上长时记忆模块,专门来解决机器人世界模型里三个老大难问题:因果不一致、推演撑不久、虚拟和真实脱节。实测下来,动作跟随得分0.29,能连续推演60秒,虚实任务成功率相关系数0.926。

WALL-SS 到底解决了机器人世界模型的什么难题?

机器人世界模型一直有三大坑:动作和结果对不上、推演撑不了太久、虚拟里跑得通真机上却翻车。WALL-SS 就是冲着这三个坑来的。

  • 动作和结果因果一致:模型得知道“做了什么,会导致什么”,不能画面变了但动作没变。
  • 长时间连续推演:推演不是几帧就行,而是几十秒内画面不崩、逻辑不乱。
  • 虚拟和真实一致:虚拟测试的结论,得能反映真机上的真实表现。

它不是简单生成视频,而是用“下一尺度自回归”的方式,先从粗动作推演,再逐步细化,配上长时记忆模块,让模型记住前面的状态,再预测后面会发生什么。这套思路和单纯拼视频生成不一样。通用视频模型看的是“像不像”,机器人世界模型看的是“准不准”。WALL-SS 在动作跟随测试里拿到 0.29 分,轨迹准确率 0.539。相比之下,英伟达 Cosmos3-Nano 的动作跟随得分只有 0.044,其余测试模型直接挂零。这意味着 WALL-SS 预测的不只是画面,而是真正能对应到动作的结果。

连续推演 60 秒:画面不崩的秘密

做过视频预测的人都知道,模型推演几秒钟还行,一长就乱。物体消失、形变、动作漂移,都是常见毛病。WALL-SS 能连续推演最长 60 秒,画面保持稳定。其他通用视频模型大概在 20 到 30 秒后就开始出问题,物体凭空消失也算家常便饭。

这个能力来自两个设计:由粗到细的预测,和长时记忆。粗尺度先决定整体走向,细尺度再补细节;长时记忆让模型不需要每次从零开始推,而是像人一样“记得前面发生了什么”。

虚实迁移成绩单:相关 0.926,排序准确 89%

虚拟环境里练出来的机器人,能不能直接用在真机上?这是具身智能商业化的关键问题。自变量做了 600 组虚实配对实验,结果 WALL-SS 在虚拟环境中的任务成功率,与真实机器人上的成功率相关系数达到 0.926。用这个模型来评估不同策略的好坏,排序准确率也有 89%。

简单说,如果 WALL-SS 在虚拟世界里说“这个方案行”,那真机上大概率也行。这个分数意味着企业可以先用世界模型做大量低成本筛选,再把最好的策略搬到物理世界,省掉不少真机测试的时间。

它离“完全可靠”还差多远?

WALL-SS 也有自己的边界。当前动作输入只包括机械臂末端位置、朝向和夹爪开合,不包含完整关节状态、力和力矩。也就是说,对于需要精细接触、多指灵巧手操作的场景,它能不能给出足够细的预测,还需要更多验证。

这不是说 WALL-SS 不行,而是机器人操作的复杂度太高。抓杯子、开门、插线,这些动作看起来简单,真做起来涉及很多物理细节。模型能把 60 秒的动作框架稳住,已经很能打,但离“手到擒来”还有距离。

从 WALL-OSS 到 WALL-SS:一条越走越清楚的路

WALL-SS 不是突然冒出来的。自变量团队之前已经发布过 WALL-OSS、WALL-OSS-0.5、WALL-WM 和 X-Tokenizer 等模型。这几代模型一直在做同一件事:把世界模型和机器人动作统一到一个建模框架里。WALL-WM 更像早期探索,X-Tokenizer 解决视觉和动作的编码,到 WALL-SS 才把长时预测和虚实一致性串起来。

这条路线背后是整个行业的动向。英伟达一直在更新 Cosmos,把生成式世界模型往机器人控制上引;Meta 的 V-JEPA 2 也尝试让机器人通过预测物理变化来完成任务。世界模型已经成了具身智能的主流方向之一,只是各家解法不太一样。

世界模型越热,算力越绕不开

世界模型的训练和推理都吃算力,尤其是长时间推演,对显存和计算资源要求不低。创业团队如果什么都自己搭,机器还没跑起来,钱先烧完了。更实际的做法,是把训练和推理放到云上,按需租用 易枫顺 - 阿里云官方旗舰级代理商 提供的云服务器ECS,或者利用阿里云代金券来抵扣前期成本。通过阿里云代理商还能拿到更灵活的阿里云优惠方案,把企业上云的成本控制在一个可预测的范围里。

说到底,WALL-SS 这样的模型给机器人行业提供了一种新可能:先在虚拟世界里把动作“想明白”,再让真机去执行。这个过程离不开能看懂状态变化的视觉编码,也离不开能扛住长时推演的算力底座。对正在做具身智能的团队来说,模型和云服务,两头都得抓。

FAQ

Q: WALL-SS 和通用视频生成模型有什么不同?

A: 通用视频生成模型追求画面连贯、好看,但动作和因果关系经常对不上;WALL-SS 是机器人世界模型,它得保证“动了哪个关节,就会产生什么结果”。测试里 WALL-SS 的动作跟随得分 0.29,轨迹准确率 0.539,其他通用模型要么很低要么直接为 0,差别很明显。

Q: 0.926 的相关系数意味着什么?

A: 这是自变量在 600 组虚实配对实验里算出来的:WALL-SS 在虚拟环境里的任务成功率,和真实机器人上的成功率高度相关。简单说,虚拟测试的结果可以用来预判真机表现,排序准确率 89% 也说明它能帮研发提前筛掉不靠谱的策略。

Q: WALL-SS 现在有什么限制?

A: 它的动作输入目前只有机械臂末端位置、朝向和夹爪开合,没有完整关节状态、力和力矩。所以像多指灵巧手操作、需要精细力控的活儿,它能不能给出足够准确的预测,还得再看后续验证。

Q: 训练和部署这类世界模型,要用什么样的云资源?

A: 长时间推演对显存和计算要求很高。用云服务器ECS按需扩容,比一开始就买一堆硬件划算。云资源按量付费,适合快速迭代的具身智能团队。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:极客公园

微信扫码咨询

微信二维码