HeadlinesBriefing favicon HeadlinesBriefing.com

Agent Hands:XRエージェントのジェスチャー

Google AI Blog •
×

AIアシスタントが単純なテキストインターフェースからマルチモーダルなコンパニオンへと進化するにつれて、よりプロアクティブで状況に応じた支援への移行が見られます。Project AstraやGemini 3.1 Flash Liveなどの最近のイノベーションにより、ユーザーはすでにカメラフィード内のオブジェクトを識別するための視覚的なバウンディングボックスオーバーレイを使用して、物理的な環境をリアルタイムで議論できます。これらのオーバーレイは2D画面には非常に効果的ですが、Android XRのような没入型プラットフォームへの移行は独自の課題を提示します:フラットなUIを超えて、真に具現化された空間認識のある対話をどのように作成するか?

このギャップを埋めるために、CHI 2026で発表されたAgent Handsを紹介します。これは、共話ジェスチャーの力を3D世界にもたらす研究プロトタイプです。人間のコミュニケーションでは、手は指すだけでなく、形を説明し、動作を模倣し、ポイントを強調します。これらすべてが音声と同期しています。拡張現実(XR)の空間理解能力を活用することで、Agent Handsはこの自然な相乗効果を再現します。

Human I/OとSensible Agentでの以前の研究に続き、Agent HandsはAIエージェントに表現力豊かで同期した手のジェスチャーを装備し、抽象的な口頭指示を直感的な物理的デモンストレーションに変換します。中心的な革新は、LLMの高レベルの推論を、エージェントの「声」とユーザーのXR環境に一致する正確なリアルタイムの物理的動作にマッピングする能力です。ワークフローには、環境認識、手のジェスチャーイベントライブラリ、ジェスチャー埋め込み推論、同期されたXR実行が含まれます。

これらのモジュールを統合することで、Agent Handsは言語的な意図と物理的な行動の間にシームレスな橋を築きます。システムは標準的なLLM出力を、エージェントの生成された応答が音声と空間的に正確な動きの両方で表現される豊かなマルチモーダルパフォーマンスに変換します。