HeadlinesBriefing HeadlinesBriefing.com

Whistle: открытое распознавание речи, 16,9 МБ

Hacker News •
×

Сегодня мы выпускаем Whistle — открытую модель распознавания речи, созданную для мобильных устройств, носимой электроники, роботов, устройств умного дома, автомобильных систем и микроконтроллеров. Это один файл размером 16,9 МБ, который работает на CPU без каких-либо зависимостей. Он загружается в тот же C++-движок, что и Needle, используя общий контейнер и квантование, поэтому один бинарный файл может превратить записанный фрагмент речи непосредственно в вызовы инструментов.

Whistle выполняет три задачи полностью на устройстве. Он транскрибирует до 30 секунд монофонического аудио с частотой 16 кГц на английском, немецком, французском, испанском, итальянском, нидерландском и польском языках, автоматически определяя язык, если он не указан. Он формирует временные метки для каждого слова с началом, концом и вероятностью, выравненные по вниманию декодера. Также модель может выдавать речевое вложение — одну строку на каждый кадр длительностью 80 мс — без декодирования транскрипции. Модель выдаёт первый токен за 11 мс.

Архитектура состоит из двух частей. Фронтенд преобразует аудио в 80 лог-мел полос и с помощью свёрточного блока сокращает 30 секунд до 375 кадров. Энкодер затем применяет восемь блоков Simple Attention, общих с Needle, с некаузальным вниманием, поэтому кадр на 3-й секунде может обращаться к кадру на 12-й секунде. Декодер использует восемь блоков Laddered Simple Attention шириной 512 с gated cross attention в каждом слое, который считывает выход энкодера. Эти проекции вычисляются один раз на фрагмент, поэтому пять путей лучевого поиска требуют лишь пяти коротких кэшей транскрипции, а не пяти проходов по аудио.

Декодирование использует пять лучей, оцениваемых по нормализованной по длине логарифмической вероятности. Смещение по ключевым словам работает через автомат Ахо — Корасик по фразам, которые передаёт пользователь, повышая их вероятность по мере продвижения поиска. Словарь содержит 8 192 текстовых фрагмента и семь языковых токенов, а транскрипция ограничена 320 токенами.

Модель также доступна в браузерной песочнице, где аудио никогда не покидает устройство.

Источник: Hacker News · Сводку подготовил HeadlinesBriefing