HeadlinesBriefing favicon HeadlinesBriefing.com

Agent Hands: Interaktive Gesten für XR

Google AI Blog •
×

Während KI-Assistenten von einfachen Textoberflächen zu multimodalen Begleitern werden, sehen wir eine Verschiebung hin zu proaktiverer und situierter Unterstützung. Jüngste Innovationen wie Project Astra und Gemini 3.1 Flash Live ermöglichen es Benutzern bereits, ihre physische Umgebung in Echtzeit zu besprechen, oft mit visuellen Bounding-Box-Overlays, um Objekte in einem Kamerafeed zu identifizieren. Obwohl diese Overlays für 2D-Bildschirme sehr effektiv sind, stellt der Übergang zu immersiven Plattformen wie Android XR eine besondere Herausforderung dar: Wie können wir über die flache UI hinausgehen, um einen wirklich verkörperten, räumlich bewussten Dialog zu schaffen?

Um diese Lücke zu schließen, stellen wir Agent Hands vor, veröffentlicht auf CHI 2026, ein Forschungsprototyp, der die Kraft von Co-Speech-Gesten in die 3D-Welt bringt. In der menschlichen Kommunikation tun unsere Hände mehr als nur zeigen; sie beschreiben Formen, imitieren Aktionen und betonen Punkte, alles synchron mit unserer Stimme. Durch die Nutzung der räumlichen Verständnisfähigkeiten von Extended Reality (XR) repliziert Agent Hands diese natürliche Synergie.

Im Anschluss an unsere frühere Forschung in Human I/O und Sensible Agent stattet Agent Hands KI-Agenten mit ausdrucksstarken, synchronisierten Handgesten aus, die abstrakte verbale Anweisungen in intuitive physische Demonstrationen verwandeln. Die Kerninnovation ist die Fähigkeit, das High-Level-Reasoning von LLMs in präzise, Echtzeit-Physische Bewegungen zu übertragen, die der "Stimme" des Agenten und der XR-Umgebung des Benutzers entsprechen. Der Workflow umfasst Umgebungsbewusstsein, eine Bibliothek für Handgesten-Ereignisse, gestenintegriertes Reasoning und synchronisierte XR-Ausführung.

Durch die Integration dieser Module schafft Agent Hands eine nahtlose Brücke zwischen sprachlicher Absicht und physischer Aktion. Das System verwandelt die Standardausgabe eines LLM in eine reichhaltige multimodale Performance, bei der die generierten Antworten des Agenten sowohl durch Sprache als auch durch räumlich präzise Bewegung manifestiert werden.