HeadlinesBriefing favicon HeadlinesBriefing.com

LLM 3倍高速化:投機的デコーディング

ByteByteGo •
×

すべてのエージェントはすでにループを実行しています。ループエンジニアリングは、エージェント自体の周りにループを追加し、出力を評価し、作業が不十分な場合に再試行し、同じ間違いが繰り返される場合に指示を改良できるようにします。今日、あなたはその役割を果たしています:作業をレビューし、何が問題だったかを診断し、エージェントに再度プロンプトを送ります。この記事では、実際の例を使ってそのプロセスを自動化する方法を示し、人間の判断が依然として必要な場所を探ります。

700億パラメータのモデルは、GPUメモリから約140 GBの重みを読み取る必要があります。最新のデータセンターGPUでは、この転送に数十ミリ秒かかる場合があります。これらの重みに適用される実際の計算は、その時間のほんの一部しかかかりません。これは、プロセッサの数学ユニットがトークン生成ステップにかかる時間の大部分で使用されていないことを意味します。投機的デコーディングは、この未使用の容量を出力に変換する技術です。

2番目の、はるかに小さいモデルが、事前に複数の候補トークンを生成します。大きなモデルは、トークンごとに1回のパスではなく、単一のフォワードパスでそれらすべてを評価し、生成が2〜3倍高速になります。さらに良いことに、生成されるテキストは、単独で実行される大きなモデルの出力と統計的に同一のままです。

テキスト生成は一度に1トークンずつ機能します。モデルはこれまでに生成されたすべてを読み取り、語彙に対する確率分布を計算し、次のトークンを選択し、そのトークンを入力に追加して、サイクルを繰り返します。各サイクルはフォワードパスと呼ばれ、各フォワードパスは入力をモデルのすべてのレイヤーに通します。最新の推論システムはKVキャッシュを使用します。これは、すでに処理されたトークンのアテンション状態を保存し、各パス内の作業を削減しますが、トークンごとに1回のパスが必要という要件は依然として残ります。

主要エンティティ:企業:ByteByteGo