HeadlinesBriefing favicon HeadlinesBriefing.com

World Labs Atlas: نموذج عالمي للذكاء المكاني

Hacker News •
×

تقدم World Labs نموذج Atlas، وهو نموذج عالمي من الجيل التالي مصمم للذكاء المكاني. Atlas هو نموذج شامل تم تدريبه مسبقًا من الصفر للعمل أصليًا على النصوص والصور والفيديو والثلاثي الأبعاد. إنه محول انتشار ذاتي التراجع متعدد الوسائط يجمع جميع المدخلات في سياق مكاني مشترك لتوليد ما يأتي بعد ذلك مع البقاء متسقًا في الثلاثي الأبعاد وتخيل ما يتجاوز البيانات المرصودة. يتوسع Atlas مع زيادة حوسبة التدريب ويدعم توليد العوالم وإعادة بنائها ومحاكاتها. تشمل القدرات الرئيسية: التوليد المتحكم به بالكاميرا، لإنتاج ما يصل إلى دقيقة واحدة من فيديو 1440p من صورة أو أكثر مع تحكم مثالي بالكاميرا على مستوى البكسل؛ إعادة البناء المكاني، لتوليد مناظر جديدة ومخرجات ثلاثية الأبعاد صريحة من صور الإدخال، متفوقًا على نماذج الثلاثي الأبعاد الحديثة؛ محاكاة الزمان والمكان، لتمكين سير عمل Real-to-Sim للروبوتات من خلال نمذجة الزمان والمكان من مقاطع الفيديو؛ وتوليد الصور، لإنشاء صور وبانوراما 360 درجة من النصوص مع الالتزام بالمطالبات المعقدة وأنماط بصرية متنوعة. سيشغل Atlas الإصدارات المستقبلية من Marble ومنتجات World Labs الأخرى. يستخدم النموذج هندسة الكاميرا الدقيقة كمدخل أصلي، مما يسمح بتأطير اللقطات بدقة والتحكم في الحركة. من خلال تأسيس كل صورة في موضع ثلاثي الأبعاد في الفضاء، يشكل Atlas سياقًا مكانيًا يمكّن التحكم الإبداعي، مثل وضع صور غير ذات صلة في الفضاء ثلاثي الأبعاد لتوليد استيفاءات سلسة تتخيل المداخل والممرات والانتقالات. بالنسبة لمقاطع الفيديو الطويلة، يجمع Atlas بين حركة الكاميرا وإدارة السياق المكاني، مما يضع المستخدمين في مقعد المخرج لتنظيم المشهد بالكامل.