HeadlinesBriefing favicon HeadlinesBriefing.com

LLM 3x schneller: spekulative Dekodierung

ByteByteGo •
×

Jeder Agent führt bereits eine Schleife aus. Schleifen-Engineering fügt eine Schleife um den Agenten selbst hinzu, die es ihm ermöglicht, seine Ausgabe zu bewerten, es erneut zu versuchen, wenn die Arbeit nicht ausreicht, und seine Anweisungen zu verfeinern, wenn dieselben Fehler erneut auftreten. Heute übernehmen Sie diese Rolle: die Arbeit überprüfen, diagnostizieren, was schief gelaufen ist, und den Agenten erneut auffordern. Dieser Artikel zeigt, wie man diesen Prozess mit einem funktionierenden Beispiel automatisiert, und untersucht, wo menschliches Urteilsvermögen weiterhin erforderlich ist.

Ein Modell mit 70 Milliarden Parametern erfordert das Lesen von etwa 140 GB Gewichten aus dem GPU-Speicher. Auf einer modernen Rechenzentrums-GPU kann diese Übertragung Dutzende von Millisekunden dauern. Die tatsächliche Berechnung, die auf diese Gewichte angewendet wird, dauert nur einen Bruchteil dieser Zeit. Das bedeutet, dass die Mathematik-Einheiten des Prozessors die meiste Zeit, die der Token-Generierungsschritt benötigt, ungenutzt bleiben. Spekulative Dekodierung ist eine Technik, die diese ungenutzte Kapazität in Ausgabe umwandelt.

Ein zweites, viel kleineres Modell erzeugt im Voraus mehrere Kandidaten-Token. Das große Modell bewertet alle in einem einzigen Vorwärtsdurchgang statt eines Durchgangs pro Token, was zu einer 2-3-mal schnelleren Generierung führt. Um es besser zu machen, bleibt der erzeugte Text statistisch identisch mit der Ausgabe des großen Modells, das allein läuft.

Die Textgenerierung funktioniert ein Token nach dem anderen. Das Modell liest alles, was bisher erzeugt wurde, berechnet eine Wahrscheinlichkeitsverteilung über seinen Wortschatz, wählt das nächste Token aus, fügt dieses Token zur Eingabe hinzu und wiederholt den Zyklus. Jeder Zyklus wird als Vorwärtsdurchgang bezeichnet, und jeder Vorwärtsdurchgang führt die Eingabe durch alle Schichten des Modells. Moderne Inferenzsysteme verwenden einen KV-Cache, der den Aufmerksamkeitszustand für bereits verarbeitete Token speichert und die Arbeit innerhalb jedes Durchgangs reduziert, obwohl die Anforderung eines Durchgangs pro Token weiterhin besteht.

Wichtige Entitäten: Unternehmen: ByteByteGo