OpenWAM هو إطار نمذجة عالم-إجراء مفتوح يتيح مقارنة خيارات التصميم في التنبؤ والتحكم من خلال توفير أساس مشترك للفيديو الروبوت السببي. مبني من Wan2.2-5B، فإنه يجري تدريبًا مسبقًا سببيًا على أكثر من 10,000 ساعة من الفيديو (3.34 مليون مسار) ويدمج خبير إجراء عبر هندسة مزج-المحولات التي تدعم أوضاع التوليد المشترك والمتسلسل والمنفصل.
يحقق الإطار معدلات نجاح عالية في أربع مجموعات LIBERO ومهام ثنائية اليد في العالم الحقيقي، مع تحسين نجاح VTA من 68.4% إلى 97.8% من خلال التكيف السببي. عندما يتكيف فقط مُتنبأ الفيديو مع المهام الجديدة، يحقق نموذج عكسي للديناميكا المحلية المتجمد تم تدريبه على بيانات مضادة للحقيقة نسبة نجاح متوسطة تبلغ 84.0% عبر أربع مهام LIBERO-90 محفوظة.
بالنسبة للديناميكا الأمامية، يقلل الإشراف المضاد للحقيقة من خطأ توقع RGB بنسبة 34.5% ويرفع تحديد النتيجة من 21.1% إلى 71.3% بين 16 نتيجة ذات نفس الحالة. تشمل مجموعات البيانات المسبقة التدريب Open X-Embodiment (1,300,749 مسار)، وAgi Bot World Beta، وغيرها بإجمالي 14,640 ساعة من فيديو المصدر.
الكيانات الرئيسية: الشركات: Open X-Embodiment، Intern Data-A1
المصدر: Hacker News · لخّصه HeadlinesBriefing