HeadlinesBriefing favicon HeadlinesBriefing.com

Agent Hands : Gestes interactifs pour XR

Google AI Blog •
×

Alors que les assistants IA évoluent de simples interfaces textuelles vers des compagnons multimodaux, nous assistons à un passage vers une assistance plus proactive et située. Des innovations récentes comme Project Astra et Gemini 3.1 Flash Live permettent déjà aux utilisateurs de discuter de leur environnement physique en temps réel, souvent en utilisant des superpositions de boîtes englobantes visuelles pour identifier des objets dans un flux de caméra. Bien que ces superpositions soient très efficaces pour les écrans 2D, la transition vers des plateformes immersives comme Android XR présente un défi unique : comment dépasser l'interface plate pour créer un dialogue véritablement incarné et spatialement conscient ?

Pour combler cette lacune, nous introduisons Agent Hands, publié à CHI 2026, un prototype de recherche qui apporte la puissance des gestes co-verbaux au monde 3D. Dans la communication humaine, nos mains ne font pas que pointer ; elles décrivent des formes, imitent des actions et soulignent des points, tout en synchronisation avec notre voix. En exploitant les capacités de compréhension spatiale de la réalité étendue (XR), Agent Hands réplique cette synergie naturelle.

Suite à nos recherches précédentes sur Human I/O et Sensible Agent, Agent Hands équipe davantage les agents IA avec des gestes expressifs et synchronisés qui transforment des instructions verbales abstraites en démonstrations physiques intuitives. L'innovation centrale est sa capacité à mapper le raisonnement de haut niveau des LLM en mouvements physiques précis et en temps réel qui correspondent à la "voix" de l'agent et à l'environnement XR de l'utilisateur. Le flux de travail comprend la conscience de l'environnement, une bibliothèque d'événements de gestes, un raisonnement intégré aux gestes et une exécution XR synchronisée.

En intégrant ces modules, Agent Hands crée un pont transparent entre l'intention linguistique et l'action physique. Le système transforme la sortie standard d'un LLM en une performance multimodale riche où les réponses générées par l'agent se manifestent à la fois par la parole et par un mouvement spatialement précis.