HeadlinesBriefing favicon HeadlinesBriefing.com

AIウォーターマークと幻覚チェック

Towards Data Science •
×

AI安全性には味方撃ちの問題があります。AIテキストの出所を証明する技術が、それが真実かどうかをチェックする技術を弱めています。ウォーターマーク、つまり生成テキストに隠し署名を埋め込むことは、AIアプリケーションの透明性を高めるために使用されます(欧州のEU AI法第50条、中国のAIラベリング規制)。さらに、幻覚検出は、モデルが作り出した回答の部分をフラグ付けしようとします。規制当局は両方を推進していますが、AIモデル内部には透明性と責任の間に隠れた衝突が存在します。

LLMは次のトークンに対する確率分布を計算します。時にはその分布は鋭く、「フランスの首都は」の後では「パリ」が強制されます。時には平坦で、複数の続きが同様に妥当です。その平坦さはエントロピーと呼ばれます。両方の技術は高エントロピー位置に存在します。テキストウォーターマークは、Kirchenbauerらによる2023年のスキームのように、秘密鍵を使用してコイントスを偏らせ、語彙を緑と赤のリストに分割します。テキストは自然に読めますが、より多くの緑トークンを含みます。

鍵を持つ検出器は緑トークンを数え、非確率を計算します。Google DeepMindのSynth ID-Textは、Geminiモデルでトーナメントサンプリングを使用します。歪みのないスキームは、出力分布が平均的に変わらないようにバイアスを調整します。しかし、ウォーターマークは余地がある場所でしか押せません。低エントロピー位置では、バイアスは誤った単語と品質の崩壊を意味します。衝突はモデル内部に隠されていますが、AI安全性に実際の結果をもたらします。

主要エンティティ:企業:Google DeepMind | 人物:Kirchenbauer