自变量发布WALL-SS自回归世界模型
IT时代网8月27日消息,自变量机器人今日正式发布WALL-SS,即下一尺度自回归世界模型。
世界模型已经成了具身智能的重要技术范式。它要做的事,是构建一个符合物理规律的“虚拟世界”,当作机器人动作的训练场,让机器人提前看到某个动作会带来什么结果,再决定该不该执行。
现有世界模型卡在三个地方。一是模型更习惯照着视觉画面“猜”未来,反而忽略动作指令;二是推演时间一长画面就崩,物体变形、位置错乱;三是虚拟世界里跑通的动作策略,到真实物理世界复现不出来,世界模型因此当不成可靠的评测环境。
WALL-SS没有沿用扩散模型那种单片段生成视频的方式,改用“下一尺度自回归”架构:像画家作画,先勾粗尺度轮廓,再逐层细化画面与物理细节,以此换来更稳定、更精细的未来预测。
官方给出的三项突破,分别对应上面三个瓶颈。预测锚定动作——生成的未来严格遵循动作指令;长时间稳定——推演较长时间仍能保持画面和物体状态连贯;可验证性——虚拟世界里验证过的动作,能作为真实世界的有效参考。
动作控制这一环,问题出在敏感度上。以机械臂抓杯子举例,手指位置差1毫米,物理世界里可能就是“成功抓起”和“撞翻杯子”两种结果,但两种情况在视觉上几乎一样,模型很容易忽略这1毫米,凭视觉惯性直接生成“稳稳抓住”的假结果。WALL-SS的做法是“尺度对齐的动作条件注入”,把动作指令严格对齐到不同生成尺度中,让动作从辅助信号变成必须遵循的核心条件:粗尺度决定机器人大致位置,精尺度决定手指是否合拢。同时统一时间轴和坐标系,靠多摄像头信息协同,保证动作、视角与画面状态一致。测试里,WALL-SS的“动作跟随”得分0.29,是所有对比模型中唯一不为零的;生成视频与给定动作轨迹指令的重合度从0.251提升到0.539,涨了115%。
长时间稳定靠的是分层记忆。预测崩溃的根源在于模型必须把历史画面当上下文,留太少容易“忘事”,留太多则上下文长度和内存开销飙升。WALL-SS提出“尺度压缩的长时间跨度记忆”:越近的记忆保留得越精细,越久远的压缩成更粗的粒度——几秒前“用左手抓住了杯子”记清楚,几十秒前“移动到桌子旁边”记个大概,更早的只留“场景中有桌子和杯子”这种概括。这样一来,推演多久内存占用都恒定。模型还会记住“是什么动作导致了这个画面”,压缩视觉信息时同步压缩动作历史,让因果关系保持清晰。训练阶段另有“尺度级梦境强迫”,故意喂错题,让模型学会从错误中恢复。流式推演测试中,WALL-SS稳定推演60秒画面依然清晰、物体位置准确,而只保留最近几帧信息的模型在20到30秒后就出现明显崩坏,通用视频模型约30秒后物体消失。
虚实一致性这块,WALL-SS用的是“视觉动力学的在线策略对齐”:让模型在自己预测的轨迹上通过强化学习练手,再由两个裁判反馈修正——一个查动作对不对,即画面预测是否遵循指令;另一个查长期一致性,即不同时间尺度下画面是否连贯。在“闭环策略一致性”测试中,自变量在6个任务、5个训练阶段分别测试,同一策略在虚拟世界和真实世界的任务成功率吻合度达到93%。

注:本文中包含AI辅助创作的内容。