HeadlinesBriefing HeadlinesBriefing.com

Whistle: Offene Spracherkennung in 16,9 MB

Hacker News •
×

Heute veröffentlichen wir Whistle, ein offenes Spracherkennungsmodell für Mobilgeräte, Wearables, Roboter, Smart-Home-Geräte, Automotive-Systeme und Mikrocontroller. Es handelt sich um eine einzige Datei mit 16,9 MB, die ohne Abhängigkeiten auf der CPU läuft. Sie wird in dieselbe C++-Engine geladen wie Needle und teilt sich deren Container und Quantisierung, sodass ein einziges Binary einen gesprochenen Clip direkt in Tool-Aufrufe umwandeln kann.

Whistle erledigt drei Aufgaben vollständig auf dem Gerät. Es transkribiert bis zu 30 Sekunden Mono-Audio mit 16 kHz in Englisch, Deutsch, Französisch, Spanisch, Italienisch, Niederländisch und Polnisch, wobei die Sprache automatisch erkannt wird, sofern keine angegeben ist. Es erzeugt Wort-Zeitstempel mit Start, Ende und Wahrscheinlichkeit für jedes Wort, die aus der Aufmerksamkeit des Decoders abgeleitet werden. Außerdem kann es eine Sprach-Einbettung ausgeben, eine Zeile pro 80-ms-Frame, ohne ein Transkript zu decodieren. Das Modell erreicht das erste Token in 11 ms.

Die Architektur besteht aus zwei Hälften. Das Frontend wandelt Audio in 80 Log-Mel-Bänder um und nutzt einen konvolutionalen Stem, um 30 Sekunden auf 375 Frames zu reduzieren. Der Encoder wendet dann acht Simple-Attention-Blöcke an, die sich Needle teilt, mit nicht-kausaler Aufmerksamkeit, sodass ein Frame bei 3 Sekunden auf einen Frame bei 12 Sekunden achten kann. Der Decoder verwendet acht Laddered-Simple-Attention-Blöcke mit einer Breite von 512 und in jeder Schicht eine gegatete Cross-Attention, die die Encoder-Ausgabe liest. Diese Projektionen werden einmal pro Clip berechnet, sodass fünf Beam-Search-Pfade nur fünf kurze Transkript-Caches kosten statt fünf Durchläufe über das Audio.

Die Dekodierung nutzt fünf Beams, bewertet nach der längennormalisierten logarithmischen Wahrscheinlichkeit. Keyword-Biasing läuft über einen Aho-Corasick-Automaten mit den vom Nutzer übergebenen Phrasen und erhöht deren Wahrscheinlichkeit, während die Suche voranschreitet. Das Vokabular umfasst 8.192 Textstücke plus sieben Sprach-Token, und Transkripte sind auf 320 Token begrenzt.

Das Modell ist außerdem in einer Browser-Sandbox verfügbar, in der das Audio das Gerät niemals verlässt.

Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing