OpenWAM は、共通の因果ロボットビデオ基盤を提供することにより、予測と制御における設計選択の比較を可能にするオープンワールドアクションモデリングフレームワークです。Wan2.2-5B から構築され、10,000 時間以上のビデオ(334 万軌跡)に対して因果事前学習を行い、ミクスチャー・オブ・トランスフォーマー アーキテクチャを通じてアクション エキスパートを統合し、結合、順次、および分離生成モードをサポートします。
このフレームワークは、4 つの LIBERO スイートと実際の二手作業において高い成功率を達成し、因果適応により VTA の成功率が 68.4% から 97.8% に向上します。ビデオ予測器のみが新しいタスクに適応する場合、反事実データで訓練された凍結されたローカルコンテキスト逆動力学モデルは、保持された 4 つの LIBERO-90 タスクにおいて平均 84.0% の成功率を達成します。
前方動力学については、反事実監督により RGB 予測誤差が 34.5% 減少し、16 の同一状態の結果における結果識別が 21.1% から 71.3% に向上します。事前学習データセットには、Open X-Embodiment(1,300,749 軌跡)、Agi Bot World Beta、およびその他のデータが含まれ、ソースビデオの合計は 14,640 時間です。
主要なエンティティ: 企業: Open X-Embodiment, Intern Data-A1
出典: Hacker News · 要約:HeadlinesBriefing