HeadlinesBriefing favicon HeadlinesBriefing.com

Как OpenAI создала GPT-Live

ByteByteGo •
×

Как оптимизировать ИИ, когда производительность имеет значение? И как можно применить ИИ, чтобы сделать производительность лучше (и проще), чем когда-либо? Именно это 30K инженеров будут исследовать на P99 CONF. Вот небольшой обзор докладов, которые вас ждут: Sandboxmaxxing в Lovable: каждый промпт получает песочницу менее чем за 1 секунду; Автономный агент производительности: история производства Netflix; Уроки, извлечённые из создания сверхбыстрой инфраструктуры с открытым исходным кодом для ИИ-агентов; Дайте агенту кластер: эффективный ИИ для инженерии производительности в масштабе; Управление 500 миллиардами+ файлов для рабочих нагрузок ИИ; Как улучшить ваш алгоритм кэширования с помощью ИИ. ПОЛУЧИТЕ БЕСПЛАТНЫЙ БИЛЕТ. Бонус: зарегистрировавшиеся получают немедленный 30-дневный доступ к полной библиотеке O'Reilly, а участники могут принять участие в розыгрыше 1 из 500 бесплатных наборов мерча.

Если вы раньше пользовались голосовыми помощниками, вы, вероятно, сталкивались с неожиданными перебиваниями. Вы говорите с системой, и в тот момент, когда вы ненадолго замолкаете, чтобы подумать над нужным словом, она начинает говорить. Затем вы перебиваете её, чтобы продолжить. Это распространённое разочарование, потому что большинство голосовых моделей могут либо слушать, либо говорить, но не то и другое одновременно.

Более новые голосовые модели, такие как GPT-Live-1 от OpenAI, меняют это, слушая и говоря одновременно. Модель постоянно решает, должна ли она молчать, перебить или начать говорить. Это делает разговор более естественным с меньшим количеством непреднамеренных перебиваний. Под капотом эти системы сочетают новое поколение архитектуры голосовых моделей с системой обслуживания, оптимизированной для низкой задержки. Чтобы понять, как всё работает от начала до конца, мы встретились с инженерами команды GPT Voice, Zahan Malkani и Justin Uberti (создателем WebRTC). Мы благодарим обоих за то, что они поделились с нами деталями.

В этой статье вы узнаете: три поколения голосовых систем, включая каскадные конвейеры, поочерёдные сквозные модели и полнодуплексные модели; делегирование мышления от говорения — основную идею GPT-Live; инженерию системы обслуживания, включая живые и асинхронные пути; чем отличается оценка в полнодуплексных голосовых системах; и инженерные уроки для создания систем реального времени и что дальше ждёт голосовые технологии.

Ключевые сущности: Компании: OpenAI, ByteByteGo, Lovable, Netflix, O'Reilly, Lang Chain | Люди: Zahan Malkani, Justin Uberti