HeadlinesBriefing favicon HeadlinesBriefing.com

LLM注意可視化:コピー&ペーストの仕組み

Hacker News •
×

TransformerベースのLLMは生成中に任意の以前のトークンから情報を引き出すことができますが、選択的である必要があります。このメカニズムは、生成されたトークンをタップまたはホバーして、どの過去のトークンが影響を与えたかを確認することで可視化できます。

可視化では、値ベクトルの大きさでスケーリングされた注意重みを計算し、ヘッドとレイヤー全体で集約してから、以前のトークンの不透明度を制御します。単純化にもかかわらず、興味深いパターンが現れます。たとえば、「Office Move Summary」プロンプトでは、アドレスや日付などのコピーされたテキストが際立ちます。生成されたトークンがソースデータから強く引き出しているためです。

これは謎に対処します:LLMが確率的にトークンを予測するなら、なぜコピー&ペーストがこれほど得意なのでしょうか?このメカニズムは、モデルが限られた内部状態からシーケンス全体を予測するのではなく、すべての過去のトークンにアクセスし、どれから引き出すかを決定して、エラー確率を減らすことを示しています。

別の例では、「remain」にホバーすると、「work」と「stay the same」から引き出していることがわかり、異なるフレーズからの情報を組み合わせています。可視化はTransformers.jsを使用したReactアプリを使用していますが、内部値を公開するために.onnxファイルの変更が必要で、即時表示用に事前生成されたプロンプトも必要でした。