HeadlinesBriefing favicon HeadlinesBriefing.com

World Labs Atlas: Weltmodell für räumliche Intelligenz

Hacker News •
×

World Labs stellt Atlas vor, ein Weltmodell der nächsten Generation, das für räumliche Intelligenz entwickelt wurde. Atlas ist ein Omni-Modell, das von Grund auf vortrainiert wurde, um nativ auf Text, Bilder, Video und 3D zu operieren. Es ist ein multimodaler autoregressiver Diffusions-Transformer, der alle Eingaben in einen gemeinsamen räumlichen Kontext kombiniert, um das Nächste zu generieren, während er in 3D konsistent bleibt und über beobachtete Daten hinaus imaginiert.

Atlas skaliert mit erhöhtem Trainings-Compute und unterstützt Weltgenerierung, Rekonstruktion und Simulation. Zu den Hauptfunktionen gehören: Kameragesteuerte Generierung, die bis zu 1 Minute 1440p-Video aus einem oder mehreren Bildern mit pixelgenauer Kamerasteuerung erzeugt; Räumliche Rekonstruktion, die neue Ansichten und explizite 3D-Ausgaben aus Eingabebildern generiert und State-of-the-Art-3D-Modelle übertrifft; Raum-Zeit-Simulation, die Real-to-Sim-Workflows für Robotik ermöglicht, indem sie Raum und Zeit aus Videos modelliert; und Bildgenerierung, die Bilder und 360-Panoramen aus Text mit komplexer Prompt-Befolgung und vielfältigen visuellen Stilen erstellt. Atlas wird zukünftige Versionen von Marble und andere World Labs-Produkte antreiben.

Das Modell verwendet präzise Kamerageometrie als nativen Input, was exaktes Shot-Framing und Bewegungssteuerung ermöglicht. Indem es jedes Bild an einer 3D-Position im Raum verankert, bildet Atlas einen räumlichen Kontext, der kreative Kontrolle ermöglicht, wie das Platzieren unverwandter Bilder im 3D-Raum, um sanfte Interpolationen zu generieren, die Türen, Flure und Übergänge imaginieren. Für lange Videos kombiniert Atlas Kamerabewegung und räumliches Kontextmanagement und setzt die Nutzer auf den Regiestuhl für vollständiges Scene-Staging.