OpenWAM: An Open Framework for Composable World-Action Models
🇬🇧 English
OpenWAM is an open world-action modeling framework that enables comparison of design choices in prediction and control by providing a common causal robot-video foundation. Built from Wan2.2-5B, it performs causal pretraining on over 10,000 hours of video (3.34 million trajectories) and integrates an action expert via Mixture-of-Transformers architecture supporting joint, sequential, and decoupled generation modes.
The framework achieves high success rates on four LIBERO suites and real-world bimanual tasks, with VTA success improving from 68.4% to 97.8% through causal adaptation. When only the video predictor adapts to new tasks, a frozen local-context inverse dynamics model trained on counterfactual data achieves 84.0% mean success across four held-out LIBERO-90 tasks.
For forward dynamics, counterfactual supervision reduces RGB prediction error by 34.5% and raises outcome identification from 21.1% to 71.3% among 16 same-state outcomes. Pretraining datasets include Open X-Embodiment (1,300,749 trajectories), Agi Bot World Beta, and others totaling 14,640 hours of source video.
🇸🇦 العربية
OpenWAM: إطار مفتوح لنماذج العالم-الإجراء
OpenWAM هو إطار نمذجة عالم-إجراء مفتوح يتيح مقارنة خيارات التصميم في التنبؤ والتحكم من خلال توفير أساس مشترك للفيديو الروبوت السببي. مبني من Wan2.2-5B، فإنه يجري تدريبًا مسبقًا سببيًا على أكثر من 10,000 ساعة من الفيديو (3.34 مليون مسار) ويدمج خبير إجراء عبر هندسة مزج-المحولات التي تدعم أوضاع التوليد المشترك والمتسلسل والمنفصل.
يحقق الإطار معدلات نجاح عالية في أربع مجموعات LIBERO ومهام ثنائية اليد في العالم الحقيقي، مع تحسين نجاح VTA من 68.4% إلى 97.8% من خلال التكيف السببي. عندما يتكيف فقط مُتنبأ الفيديو مع المهام الجديدة، يحقق نموذج عكسي للديناميكا المحلية المتجمد تم تدريبه على بيانات مضادة للحقيقة نسبة نجاح متوسطة تبلغ 84.0% عبر أربع مهام LIBERO-90 محفوظة.
بالنسبة للديناميكا الأمامية، يقلل الإشراف المضاد للحقيقة من خطأ توقع RGB بنسبة 34.5% ويرفع تحديد النتيجة من 21.1% إلى 71.3% بين 16 نتيجة ذات نفس الحالة. تشمل مجموعات البيانات المسبقة التدريب Open X-Embodiment (1,300,749 مسار)، وAgi Bot World Beta، وغيرها بإجمالي 14,640 ساعة من فيديو المصدر.
الكيانات الرئيسية: الشركات: Open X-Embodiment، Intern Data-A1
ما هو OpenWAM وما المشكلات التي يحلها؟
OpenWAM هو إطار نمذجة عالم-إجراء مفتوح يوفر أساسًا مشتركًا لمقارنة مختلف هندسات التنبؤ والتحكم. يحل مشكلة الأنظمة غير القابلة للمقارنة من خلال توحيد عمود الفقري للفيديو، وهيكل التفاعل، وإجراءات التدريب، مما يمكّن الباحثين من عزل ودراسة خيارات التصميم المحددة في التحكم بالروبوت والتنبؤ بالمستقبل.
🇧🇩 বাংলা
OpenWAM: বিশ্ব-কর্ম মডেলের জন্য খোলা ফ্রেমওয়ার্ক
OpenWAM একটি খোলা বিশ্ব-কর্ম মডেলিং ফ্রেমওয়ার্ক যা একটি সাধারণ কারণীয় রোবট-ভিডিও ভিত্তি প্রদান করে ভবিষ্যদ্বাণী এবং নিয়ন্ত্রণে ডিজাইন পছন্দের তুলনা করতে সক্ষম করে। এটি Wan2.2-5B থেকে তৈরি করা হয়েছে, এটি 10,000 ঘন্টা से अधिक ভিডিও (3.34 মিলিয়ন ট্র্যাজেক্টরি) पर因果 पूर्व-প্রশিক্ষণ করে এবং মিশ্রিত-ট্রান্সফর্মার আর্কিটেকচারের মাধ্যমে একটি কর্ম বিশেষজ্ঞকে একীভূত করে যা সমবেত, ক্রমিক এবং বিচ্ছিন্ন উৎপাদন মোডকে সমর্থন করে।
এই ফ্রেমওয়ার্ক চারটি LIBERO স্যুট এবং বাস্তব বিশ্বের দুহাতু কাজে উচ্চ সাফল্য হার অর্জন করে, যেখানে কারণীয় অনুগতির মাধ্যমে VTA সাফল্য 68.4% থেকে বাড়ে 97.8% হয়ে যায়। যখন শুধুমাত্র ভিডিও ভবিষ্যদ্বক্তা নতুন কাজের জন্য অনুগত হয়, তখন প্রতিকূল ডেটায় প্রশিক্ষিত একটি ঠব্বত স্থানীয়-সন্দर्भ উল্টা গতিবিদ্যা মডেল চারটি ধারিত LIBERO-90 কাজে 84.0% গড় সাফল্য অর্জন করে।
অগ্রিম গতিবিদ্যা জন্য, প্রতিকূল নिगরানী RGB ভবিষ্যদ্বাণী ত্রুটিকে 34.5% হ্রাস করে এবং 16টি সমতল-অবস্থা ফলকে ফল চিহ্নীকরণকে 21.1% থেকে বাড়িয়ে 71.3% করে। পূর্ব-প্রশিক্ষণ ডেটাসেটে Open X-Embodiment (1,300,749 ট্র্যাজেক্টরি), Agi Bot World বেটা এবং অন্যান্য অন্তর্ভুক্ত থাকে, যা মোট 14,640 ঘন্টা উৎস ভিডিও তৈরি করে।
মुख্য entidades: কোম্পানিগুলো: Open X-Embodiment, Intern Data-A1
OpenWAM কি এবং এটি কোন সমস্যা সমাধান করে?
OpenWAM একটি খোলা বিশ্ব-কর্ম মডেলিং ফ্রেমওয়ার্ক যা ভবিষ্যদ্বাণী এবং নিয়ন্ত্রণের বিভিন্ন আর্কিটেকচার তুলনা করার জন্য একটি সাধারণ ভিত্তি প্রদান করে। এটি ভিডিও ব্যাকবোন, ইন্টারঅ্যাকশন কাঠামো এবং প্রশিক্ষণ পদ্ধতিগুলিকে মানकीকৃত করে অসমঞ্জস্যপূর্ণ সিস্টেমের সমস্যা সমাধান করে, যা গবেষকদের রোবট নিয়ন্ত্রণ এবং ভবিষ্যৎ অনুমানে নির্দিষ্ট ডিজাইন পছন্দকে আলাদা করে অধ্যয়ন করতে সক্ষম করে।
🇩🇪 Deutsch
OpenWAM: Offenes Framework für Welt-Aktions-Modelle
OpenWAM ist ein offenes Welt-Aktions-Modellierungs-Framework, das durch Bereitstellung einer gemeinsamen kausalen Robotervideo-Grundlage den Vergleich von Entwurfswahlen in Vorhersage und Steuerung ermöglicht. Ausgehend von Wan2.2-5B führt es ein kausales Vortraining auf über 10.000 Stunden Video (3,34 Millionen Trajektorien) durch und integriert einen Aktionsexperten über eine Mixture-of-Transformers-Architektur, die gemeinsame, sequentielle und entkoppelte Generierungsmodi unterstützt.
Das Framework erreicht hohe Erfolgsraten bei vier LIBERO-Suites und realen bimanualen Aufgaben, wobei der VTA-Erfolg durch kausale Anpassung von 68,4 % auf 97,8 % steigt. Wenn nur der Videovorhersager sich an neue Aufgaben anpasst, erreicht ein eingefrorenes lokales Kontext-Inversdynamik-Modell, das auf kontrafaktuelle Daten trainiert wurde, eine durchschnittliche Erfolgsrate von 84,0 % bei vier gehaltenen LIBERO-90-Aufgaben.
Für die Vorwärtsdynamik reduziert kontrafaktuelle Supervision den RGB-Vorhersagefehler um 34,5 % und erhöht die Ergebniserkennung von 21,1 % auf 71,3 % unter 16 gleichzuständigen Ergebnissen. Die Vortrainingsdatensätze umfassen Open X-Embodiment (1.300.749 Trajektorien), Agi Bot World Beta und andere, insgesamt 14.640 Stunden Quellvideo.
Wesentliche Entitäten: Unternehmen: Open X-Embodiment, Intern Data-A1
Was ist OpenWAM und welche Probleme löst es?
OpenWAM ist ein offenes Welt-Aktions-Modellierungs-Framework, das eine gemeinsame Grundlage für den Vergleich verschiedener Vorhersage- und Steuerungsarchitekturen bietet. Es löst das Problem unvergleichbarer Systeme durch die Standardisierung des Videobackbones, der Interaktionsstruktur und der Trainingsverfahren, wodurch Forschern ermöglicht wird, spezifische Entwurfswahlen in der Robotiksteuerung und zukünftigen Vorhersage zu isolieren und zu untersuchen.
🇪🇸 Español
OpenWAM: Marco Abierto para Modelos de Mundo-Acción
OpenWAM es un marco de modelado de mundo-acción abierto que permite comparar opciones de diseño en predicción y control al proporcionar una base común de video-robot causal. Construido a partir de Wan2.2-5B, realiza un preentrenamiento causal en más de 10,000 horas de video (3,34 millones de trayectorias) e integra un experto en acciones mediante una arquitectura de Mezcla-de-Transformadores que admite modos de generación conjuntos, secuenciales y desacoplados.
El marco logra altas tasas de éxito en cuatro suites LIBERO y tareas bimanuales del mundo real, con el éxito de VTA mejorando de 68.4% a 97.8% mediante adaptación causal. Cuando solo el predictor de video se adapta a nuevas tareas, un modelo inverso de dinámica local congelado entrenado en datos contrafactuales logra un 84.0% de éxito medio en cuatro tareas LIBERO-90 retenidas.
Para la dinámica hacia adelante, la supervisión contrafactual reduce el error de predicción RGB en un 34.5% y aumenta la identificación de resultados del 21.1% al 71.3% entre 16 resultados del mismo estado. Los conjuntos de datos de preentrenamiento incluyen Open X-Embodiment (1,300,749 trayectorias), Agi Bot World Beta y otros, totalizando 14,640 horas de video de origen.
Entidades clave: Empresas: Open X-Embodiment, Intern Data-A1
¿Qué es OpenWAM y qué problemas resuelve?
OpenWAM es un marco de modelado de mundo-acción abierto que proporciona una base común para comparar diferentes arquitecturas de predicción y control. Resuelve el problema de sistemas incomparables al estandarizar la columna vertebral de video, la estructura de interacción y los procedimientos de entrenamiento, permitiendo a los investigadores aislar y estudiar opciones de diseño específicas en el control de robots y la predicción futura.
🇫🇷 Français
OpenWAM : Cadre ouvert pour les modèles monde-action
OpenWAM est un cadre de modélisation monde-action ouvert permettant de comparer les choix de conception en prédiction et contrôle grâce à une base commune de vidéo-robot causale. Construit à partir de Wan2.2-5B, il effectue un pré-entraînement causal sur plus de 10 000 heures de vidéo (3,34 millions de trajectoires) et intègre un expert en action via une architecture en Mélange-de-Transformateurs prenant en charge les modes de génération conjoints, séquentiels et découplés.
Le cadre atteint des taux de réussite élevés sur quatre suites LIBERO et des tâches bimanuelles du monde réel, avec une amélioration du succès VTA de 68,4 % à 97,8 % grâce à l'adaptation causale. Lorsque seul le prédicteur vidéo s'adapte à de nouvelles tâches, un modèle inverse de dynamique locale gelé entraîné sur des données contrefactuelles atteint un taux de réussite moyen de 84,0 % sur quatre tâches LIBERO-90 retenues.
Pour la dynamique directe, la supervision contrefactuelle réduit l'erreur de prédiction RGB de 34,5 % et augmente l'identification des résultats de 21,1 % à 71,3 % parmi 16 résultats du même état. Les jeux de données de pré-entraînement incluent Open X-Embodiment (1 300 749 trajectoires), Agi Bot World Beta et autres, totalisant 14 640 heures de vidéo source.
Entités clés : Entreprises : Open X-Embodiment, Intern Data-A1
Qu'est-ce qu'OpenWAM et quels problèmes résout-il ?
OpenWAM est un cadre de modélisation monde-action ouvert qui fournit une base commune pour comparer différentes architectures de prédiction et de contrôle. Il résout le problème des systèmes incomparables en standardisant l'épine dorsale vidéo, la structure d'interaction et les procédures d'entraînement, permettant aux chercheurs d'isoler et d'étudier des choix de conception spécifiques dans le contrôle des robots et la prédiction future.
🇮🇳 हिन्दी
OpenWAM: विश्व-कार्य मॉडल के लिए खुला फ्रेमवर्क
OpenWAM एक खुला विश्व-कार्य मॉडलिंग फ्रेमवर्क है जो एक सामान्य कारणात्मक रोबोट-वीडियो आधार प्रदान करके भविष्यवाणी और नियंत्रण में डिजाइन विकल्पों की तुलना करने में सक्षम बनाता है। इसे Wan2.2-5B से बनाया गया है, यह 10,000 घंटे से अधिक वीडियो (3.34 मिलियन ट्रैजेक्टरी) पर कारणात्मक पूर्व-प्रशिक्षण करता है और मिश्रित-ट्रांसफॉर्मर आर्किटेक्चर के माध्यम से एक क्रिया विशेषज्ञ को एकीकृत करता है जो संयुक्त, क्रमिक और अलग-थलग उत्पादन मोड का समर्थन करता है।
यह फ्रेमवर्क चार LIBERO सुइट्स और वास्तविक दुनिया के द्विहस्त कार्यों पर उच्च सफलता दर हासिल करता है, जहां कारणात्मक अनुकूलन के माध्यम से VTA सफलता 68.4% से बढ़कर 97.8% हो जाती है। जब केवल वीडियो भविष्यवक्ता नए कार्यों के लिए अनुकूलित होता है, तो प्रतिकूल डेटा पर प्रशिक्षित एक स्थिर स्थानीय-संदर्भ उल्टा गतिकी मॉडल चार धारित LIBERO-90 कार्यों पर 84.0% औसत सफलता हासिल करता है।
अग्रिम गतिकी के लिए, प्रतिकूल पर्यवेक्षण RGB भविष्यवाणी त्रुटि को 34.5% तक कम करता है और 16 समान-स्थिति परिणामों में परिणाम पहचान को 21.1% से बढ़ाकर 71.3% कर देता है। पूर्व-प्रशिक्षण डेटासेट में Open X-Embodiment (1,300,749 ट्रैजेक्टरी), Agi Bot World बीटा और अन्य शामिल हैं, जो मिलकर स्रोत वीडियो के 14,640 घंटे बनते हैं।
मुख्य संस्थाएं: कंपनियां: Open X-Embodiment, Intern Data-A1
OpenWAM क्या है और यह कौन सी समस्याओं को हल करता है?
OpenWAM एक खुला विश्व-कार्य मॉडलिंग फ्रेमवर्क है जो विभिन्न भविष्यवाणी और नियंत्रण आर्किटेक्चर की तुलना करने के लिए एक सामान्य आधार प्रदान करता है। यह वीडियो बैकबोन, इंटरैक्शन संरचना और प्रशिक्षण प्रक्रियाओं को मानकीकृत करके असमान्य प्रणालियों की समस्या को हल करता है, जिससे शोधकर्ता रोबोट नियंत्रण और भविष्य की भविष्यवाणी में विशिष्ट डिजाइन विकल्पों को अलग करके उनका अध्ययन कर सकते हैं।
🇮🇩 Bahasa Indonesia
OpenWAM: Kerangka Terbuka untuk Model Dunia-Tindakan
OpenWAM adalah kerangka pemodelan dunia-tindakan terbuka yang memungkinkan perbandingan pilihan desain dalam prediksi dan kontrol dengan menyediakan dasar video-robot kausal yang sama. Dibangun dari Wan2.2-5B, ia melakukan pra-pelatihan kausal pada lebih dari 10.000 jam video (3,34 juta lintasan) dan mengintegrasikan ahli tindakan melalui arsitektur Mixture-of-Transformers yang mendukung mode pembuatan bersama, berurutan, dan terpisah.
Kerangka ini mencapai tingkat sukses tinggi pada empat suite LIBERO dan tugas bimanual dunia nyata, dengan sukses VTA meningkat dari 68,4% menjadi 97,8% melalui adaptasi kausal. Ketika hanya prediktor video yang beradaptasi dengan tugas baru, model dinamika invers konteks lokal yang beku yang dilatih pada data kontrafaktual mencapai tingkat sukses rata-rata 84,0% pada empat tugas LIBERO-90 yang ditahan.
Untuk dinamika maju, supervisi kontrafaktual mengurangi kesalahan prediksi RGB sebesar 34,5% dan meningkatkan identifikasi hasil dari 21,1% menjadi 71,3% di antara 16 hasil dengan kondisi yang sama. Set data pra-pelatihan mencakup Open X-Embodiment (1.300.749 lintasan), Agi Bot World Beta, dan lainnya dengan total 14.640 jam video sumber.
Entitas Utama: Perusahaan: Open X-Embodiment, Intern Data-A1
Apa itu OpenWAM dan masalah apa yang diselesaikannya?
OpenWAM adalah kerangka pemodelan dunia-tindakan terbuka yang memberikan dasar umum untuk membandingkan berbagai arsitektur prediksi dan kontrol. Ia menyelesaikan masalah sistem yang tidak dapat dibandingkan dengan cara menyamakan tulang punggung video, struktur interaksi, dan prosedur pelatihan, memungkinkan peneliti untuk mengisolasi dan mempelajari pilihan desain tertentu dalam kontrol robot dan prediksi masa depan.
🇯🇵 日本語
OpenWAM: 世界行動モデルのためのオープンフレームワーク
OpenWAM は、共通の因果ロボットビデオ基盤を提供することにより、予測と制御における設計選択の比較を可能にするオープンワールドアクションモデリングフレームワークです。Wan2.2-5B から構築され、10,000 時間以上のビデオ(334 万軌跡)に対して因果事前学習を行い、ミクスチャー・オブ・トランスフォーマー アーキテクチャを通じてアクション エキスパートを統合し、結合、順次、および分離生成モードをサポートします。
このフレームワークは、4 つの LIBERO スイートと実際の二手作業において高い成功率を達成し、因果適応により VTA の成功率が 68.4% から 97.8% に向上します。ビデオ予測器のみが新しいタスクに適応する場合、反事実データで訓練された凍結されたローカルコンテキスト逆動力学モデルは、保持された 4 つの LIBERO-90 タスクにおいて平均 84.0% の成功率を達成します。
前方動力学については、反事実監督により RGB 予測誤差が 34.5% 減少し、16 の同一状態の結果における結果識別が 21.1% から 71.3% に向上します。事前学習データセットには、Open X-Embodiment(1,300,749 軌跡)、Agi Bot World Beta、およびその他のデータが含まれ、ソースビデオの合計は 14,640 時間です。
主要なエンティティ: 企業: Open X-Embodiment, Intern Data-A1
OpenWAM とは何で、どのような問題を解決しますか?
OpenWAM は、異なる予測および制御アーキテクチャを比較するための共通の基盤を提供するオープンワールドアクションモデリングフレームワークです。ビデオバックボーン、相互作用構造、およびトレーニング手順を標準化することにより、比較不可能なシステムの問題を解決し、研究者がロボット制御および将来の予測における特定の設計選択を分離して研究できるようにします。
🇧🇷 Português
OpenWAM: Framework Aberto para Modelos Mundo-Ação
OpenWAM é um framework de modelagem mundo-ação aberto que permite comparar escolhas de design em previsão e controle fornecendo uma base comum de vídeo-robô causal. Construído a partir do Wan2.2-5B, ele realiza pré-treinamento causal em mais de 10.000 horas de vídeo (3,34 milhões de trajetórias) e integra um especialista em ação através da arquitetura Mixture-of-Transformers que suporta modos de geração conjunta, sequencial e desacoplada.
O framework alcança altas taxas de sucesso em quatro suítes LIBERO e tarefas bimanuais do mundo real, com o sucesso de VTA melhorando de 68,4% para 97,8% através da adaptação causal. Quando apenas o preditor de vídeo se adapta a novas tarefas, um modelo inverso de dinâmica local congelado treinado em dados contrafatuais alcança 84,0% de sucesso médio em quatro tarefas LIBERO-90 retidas.
Para a dinâmica direta, a supervisão contrafactual reduz o erro de previsão RGB em 34,5% e aumenta a identificação de resultados de 21,1% para 71,3% entre 16 resultados do mesmo estado. Os conjuntos de dados de pré-treinamento incluem Open X-Embodiment (1.300.749 trajetórias), Agi Bot World Beta e outros, totalizando 14.640 horas de vídeo de origem.
Entidades-chave: Empresas: Open X-Embodiment, Intern Data-A1
O que é o OpenWAM e quais problemas ele resolve?
O OpenWAM é um framework de modelagem mundo-ação aberto que fornece uma base comum para comparar diferentes arquiteturas de previsão e controle. Ele resolve o problema de sistemas incomparáveis padronizando a espinha dorsal de vídeo, a estrutura de interação e os procedimentos de treinamento, permitindo que os pesquisadores isolem e estudem escolhas de design específicas no controle de robôs e na previsão futura.
🇷🇺 Русский
OpenWAM: Открытая структура для моделей мир-действие
OpenWAM — это открытая структура моделирования мир-действие, которая позволяет сравнивать варианты проектирования в предсказании и управлении, предоставляя общую причинно-следственную основу робот-видео. Построенная на основе Wan2.2-5B, она проводит причинно-следственное предобучение на более чем 10 000 часов видео (3,34 миллиона траекторий) и интегрирует эксперта по действиям через архитектуру Смесь-трансформеров, поддерживающую совместное, последовательное и раздельное генерирование.
Структура достигает высоких показателей успеха в четырех наборах LIBERO и реальных двуручных задачах, при этом успех VTA улучшается с 68,4% до 97,8% благодаря причинно-следственной адаптации. Когда только предиктор видео адаптируется к новым задачам, замороженная модель обратной локальной динамики, обученная на контрфактуальных данных, достигает среднего показателя успеха 84,0% на четырех удержанных задачах LIBERO-90.
Для прямой динамики контрфактуальное наблюдение снижает ошибку предсказания RGB на 34,5% и повышает идентификацию результатов с 21,1% до 71,3% среди 16 результатов одного состояния. Наборы данных для предобучения включают Open X-Embodiment (1 300 749 траекторий), Agi Bot World Beta и другие, в сумме составляющие 14 640 часов исходного видео.
Ключевые сущности: Компании: Open X-Embodiment, Intern Data-A1
Что такое OpenWAM и какие проблемы он решает?
OpenWAM — это открытая структура моделирования мир-действие, которая предоставляет общую основу для сравнения различных архитектур предсказания и управления. Она решает проблему несравнимых систем за счет стандартизации видеокаркаса, структуры взаимодействия и процедур обучения, позволяя исследователям изолировать и изучать конкретные выборы проектирования в управлении роботами и прогнозировании будущего.
🇨🇳 简体中文
OpenWAM:开放的世界行动模型框架
OpenWAM 是一个开放的世界行动建模框架,能够通过提供一个共同的因果机器人视频基础来比较预测和控制中的设计选择。它基于 Wan2.2-5B 构建,在超过 10,000 小时的视频(334 万条轨迹)上进行因果预训练,并通过混合变换器架构集成一个动作专家,支持联合、顺序和解耦生成模式。
该框架在四个 LIBERO 套件和真实世界双手任务上实现了高成功率,通过因果适应,VTA 成功率从 68.4% 提高到 97.8%。当只有视频预测器适应新任务时,在反事实数据上训练的冻结局部上下文逆动力学模型在四个保留的 LIBERO-90 任务上实现了 84.0% 的平均成功率。
对于前向动力学,反事实监督将 RGB 预测误差降低了 34.5%,并在 16 个相同状态结果中将结果识别率从 21.1% 提高到 71.3%。预训练数据集包括 Open X-Embodiment(1,300,749 条轨迹)、Agi Bot World Beta 和其他数据,总计 14,640 小时的源视频。
关键实体:公司:Open X-Embodiment,Intern Data-A1
什么是 OpenWAM 以及它解决了什么问题?
OpenWAM 是一个开放的世界行动建模框架,为比较不同的预测和控制架构提供了一个共同的基础。它通过标准化视频骨干、交互结构和训练程序来解决系统不可比较的问题,使研究人员能够隔离和研究机器人控制和未来预测中的特定设计选择。