A OpenAI publicou um post explicando como os recursos de visão e voz do ChatGPT ajudam equipes a trabalhar com entradas multimodais e a se comunicar de forma mais natural.
O post se concentra no lado prático desses recursos. A visão permite que os usuários compartilhem imagens e peçam ao ChatGPT que as interprete, enquanto a voz possibilita uma conversa falada em vez de texto digitado. Juntos, os dois modos permitem que as pessoas alternem entre entradas escritas, visuais e faladas dentro de uma mesma sessão.
Para as equipes, o atrativo está em combinar diferentes tipos de informação. Um usuário pode fotografar um diagrama, um quadro branco ou um documento e fazer perguntas sobre ele, depois continuar a discussão falando. Isso reduz a dificuldade de transformar material visual em texto antes de receber ajuda.
O anúncio posiciona esses recursos como uma forma de tornar a colaboração com a IA mais natural. Ao oferecer suporte às formas de comunicação que as pessoas já usam no trabalho, o ChatGPT busca se encaixar com mais fluidez nos fluxos de trabalho do dia a dia.
Fonte: OpenAI Blog · Resumido por HeadlinesBriefing