HeadlinesBriefing favicon HeadlinesBriefing.com

言語的不読性がLLMセキュリティを脅かす

Hacker News •
×

LLMは自然言語を生成するように訓練されている。しかし、証拠は、LLMの外部化された言語出力と機械論的に抽出された言語的特徴が、内部モデル計算を理解するための信頼できないレンズになり得ることを示している。我々は「言語的不読性」という用語を導入し、LLMの外部化された、または機械論的にプローブされた言語的アーティファクトが、モデルが実際にどのように考えているかを表すことに失敗するシナリオを広く指す。我々は、内部計算が言語を通じて直接表現されるのではなく、活性化空間上の数学(活性化空間と自然言語の間の両端での損失を伴う翻訳を伴う)を通じて表現されるLLMにとって、言語的不読性の specter は避けられないと主張する。

言語的不読性が常に可能であるならば、モデルの言語的自己報告に依存するセキュリティメカニズム(例:思考連鎖モニタリング、憲法的自己批判、言語的に定義された特徴ベクトルのための活性化プロービング)は決して完全に健全にはなり得ない。モデルサンドボックスは、モデルの言語的状態を読むことに全く依存しない保証を持つ分離技術を常に必要とするだろう。我々は、テイントトラッキングを使用してモデルの出力を観察することが、効果的なサンドボックスのための有望なアプローチであると主張する。モデルが言語的にどのように自己報告するかに関係なく、テイントトラッキングポリシーは、モデル生成データによって決して影響を受けるべきではないシステム状態のさまざまな部分をアプリオリに定義できる。

我々はまた、いくつかの追加のサンドボックスメカニズム(例:堅牢な仮想化、サンドボックス構成の第三者監査)について議論する。これらは集合的に言語モニタリングの下に重要な基盤を提供し、フロンティアモデルによる最近のサンドボックスエクスプロイトを緩和していただろう。