HeadlinesBriefing HeadlinesBriefing.com

ChatGPTのビジョンと音声機能

OpenAI Blog •
×

OpenAIは、ChatGPTのビジョンと音声の機能がチームのマルチモーダル入力への対応や、より自然なコミュニケーションをどのように支えるかを説明する記事を公開しました。

記事は、これらの機能の実用的な側面に焦点を当てています。ビジョンではユーザーが画像を共有し、ChatGPTにその内容を解釈させることができ、音声では入力したテキストの代わりに会話で話しかけることができます。この2つのモードを組み合わせることで、ユーザーは1つのセッションの中で、文字、視覚、音声の入力を行き来できます。

チームにとっての魅力は、異なる種類の情報を組み合わせられる点にあります。ユーザーは図表、ホワイトボード、書類を撮影して内容について質問し、その後は音声で議論を続けることができます。これにより、支援を受ける前に視覚的な資料をテキストに変換する手間が減ります。

この発表は、これらの機能によってAIとの協働をより自然に感じられるようにする取り組みとして位置づけられています。人々が職場で既に使っているコミュニケーションの形式に対応することで、ChatGPTが日々の業務の流れにより自然に溶け込むことを目指しています。

出典: OpenAI Blog · 要約:HeadlinesBriefing