HeadlinesBriefing favicon HeadlinesBriefing.com

Como a OpenAI construiu o GPT-Live

ByteByteGo •
×

Como você otimiza a IA quando o desempenho importa? E como você pode aplicar a IA para tornar o desempenho melhor (e mais fácil) do que nunca? É isso que 30K engenheiros vão explorar na P99 CONF. Aqui está uma amostra das palestras que você pode esperar: Sandboxmaxxing na Lovable: cada prompt ganha um sandbox em < 1s; O agente autônomo de desempenho: uma história de produção da Netflix; Lições aprendidas ao construir infraestrutura de código aberto extremamente rápida para agentes de IA; Dê um cluster ao agente: IA eficaz para engenharia de desempenho em escala; Gerenciando 500 bilhões+ arquivos para cargas de trabalho de IA; Como melhorar seu algoritmo de cache usando IA. PEGUE SEU INGRESSO GRÁTIS. Bônus: os inscritos recebem acesso imediato de 30 dias à biblioteca completa da O'Reilly, e os participantes podem concorrer a 1 dos 500 pacotes de brindes grátis.

Se você já usou assistentes de voz antes, provavelmente já experimentou interrupções inesperadas. Você fala com o sistema, e no momento em que faz uma breve pausa para pensar no termo certo, ele começa a falar. Então você o interrompe para poder continuar. Essa é uma frustração comum, porque a maioria dos modelos de voz pode ouvir ou falar, mas não ambos ao mesmo tempo.

Modelos de voz mais recentes, como o GPT-Live-1 da OpenAI, mudam isso ao ouvir e falar ao mesmo tempo. O modelo decide constantemente se deve ficar quieto, interromper ou começar a falar. Isso faz a conversa parecer mais natural com menos interrupções não intencionais. Nos bastidores, esses sistemas combinam uma nova geração de arquitetura de modelo de voz com um sistema de serviço otimizado para baixa latência. Para entender como tudo funciona de ponta a ponta, nos reunimos com engenheiros da equipe GPT Voice, Zahan Malkani e Justin Uberti (que criou o WebRTC). Agradecemos a ambos por compartilhar os detalhes conosco.

Neste artigo, você aprenderá: as três gerações de sistemas de voz, incluindo pipelines em cascata, modelos ponta a ponta baseados em turnos e modelos full-duplex; delegar o pensamento da fala, a ideia central por trás do GPT-Live; a engenharia por trás do sistema de serviço, incluindo os caminhos ao vivo e assíncronos; como a avaliação é diferente em sistemas de voz full-duplex; e lições de engenharia para construir sistemas em tempo real e o que vem a seguir para a voz.

Entidades principais: Empresas: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Pessoas: Zahan Malkani, Justin Uberti