HeadlinesBriefing favicon HeadlinesBriefing.com

World Labs Atlas:空間知能ワールドモデル

Hacker News •
×

World Labsは、空間知能のために設計された次世代ワールドモデル「Atlas」を発表しました。Atlasは、テキスト、画像、動画、3Dをネイティブに操作するためにゼロから事前訓練されたオムニモデルです。すべての入力を共有空間コンテキストに統合し、3Dでの一貫性を保ちながら観測データを超えた想像により次に来るものを生成する、マルチモーダル自己回帰拡散Transformerです。Atlasはトレーニング計算量の増加に伴いスケールし、ワールド生成、再構築、シミュレーションをサポートします。主な機能には、カメラ制御生成(1枚以上の画像からピクセルパーフェクトなカメラ制御で最大1分の1440p動画を生成)、空間再構築(入力画像から新規ビューと明示的な3D出力を生成、最先端の3Dモデルを上回る性能)、時空間シミュレーション(動画から空間と時間をモデリングし、ロボティクスのReal-to-Simワークフローを実現)、画像生成(複雑なプロンプト遵守と多様なビジュアルスタイルでテキストから画像と360度パノラマを作成)があります。Atlasは、Marbleの将来のバージョンや他のWorld Labs製品を支えることになります。このモデルは正確なカメラ幾何学をネイティブ入力として使用し、正確なショットフレーミングとモーション制御を可能にします。各画像を空間内の3D位置にグラウンディングすることで、Atlasは空間コンテキストを形成し、無関係な画像を3D空間に配置してドアウェイ、廊下、トランジションを想像する滑らかな補間を生成するなどのクリエイティブな制御を可能にします。長い動画では、Atlasはカメラの動きと空間コンテキスト管理を組み合わせ、ユーザーをディレクターの椅子に座らせ、完全なシーン構成を可能にします。