OpenAI ha publicado un artículo que explica cómo las capacidades de visión y voz de ChatGPT ayudan a los equipos a trabajar con entradas multimodales y a comunicarse de forma más natural.
El artículo se centra en el lado práctico de estas funciones. La visión permite a los usuarios compartir imágenes y hacer que ChatGPT las interprete, mientras que la voz habilita una conversación hablada en lugar de texto escrito. En conjunto, ambos modos permiten pasar de la entrada escrita a la visual y a la hablada dentro de una misma sesión.
Para los equipos, el atractivo está en combinar distintos tipos de información. Un usuario puede fotografiar un diagrama, una pizarra o un documento y hacer preguntas sobre él, y luego continuar la conversación hablando. Esto reduce la fricción de tener que convertir el material visual en texto antes de recibir ayuda.
El anuncio presenta estas funciones como una forma de que la colaboración con la IA resulte más natural. Al admitir las formas de comunicación que las personas ya usan en el trabajo, ChatGPT pretende integrarse con más fluidez en los flujos de trabajo cotidianos.
Fuente: OpenAI Blog · Resumido por HeadlinesBriefing