OpenWAM 是一个开放的世界行动建模框架,能够通过提供一个共同的因果机器人视频基础来比较预测和控制中的设计选择。它基于 Wan2.2-5B 构建,在超过 10,000 小时的视频(334 万条轨迹)上进行因果预训练,并通过混合变换器架构集成一个动作专家,支持联合、顺序和解耦生成模式。
该框架在四个 LIBERO 套件和真实世界双手任务上实现了高成功率,通过因果适应,VTA 成功率从 68.4% 提高到 97.8%。当只有视频预测器适应新任务时,在反事实数据上训练的冻结局部上下文逆动力学模型在四个保留的 LIBERO-90 任务上实现了 84.0% 的平均成功率。
对于前向动力学,反事实监督将 RGB 预测误差降低了 34.5%,并在 16 个相同状态结果中将结果识别率从 21.1% 提高到 71.3%。预训练数据集包括 Open X-Embodiment(1,300,749 条轨迹)、Agi Bot World Beta 和其他数据,总计 14,640 小时的源视频。
关键实体:公司:Open X-Embodiment,Intern Data-A1
来源: Hacker News · 由HeadlinesBriefing整理摘要