HeadlinesBriefing favicon HeadlinesBriefing.com

Sprachliche Unlesbarkeit bedroht LLM-Sicherheit

Hacker News •
×

LLMs werden darauf trainiert, natürliche Sprache zu generieren. Es gibt jedoch Hinweise darauf, dass die externalisierten sprachlichen Ausgaben eines LLM und mechanistisch extrahierte sprachliche Merkmale eine unzuverlässige Linse für das Verständnis der internen Modellberechnung sein können. Wir führen den Begriff „sprachliche Unlesbarkeit“ ein, um allgemein Szenarien zu bezeichnen, in denen externalisierte oder mechanistisch abgefragte sprachliche Artefakte eines LLM nicht darstellen, wie das Modell tatsächlich denkt. Wir argumentieren, dass das Gespenst der sprachlichen Unlesbarkeit für LLMs unvermeidlich ist, deren interne Berechnungen nicht direkt durch Sprache ausgedrückt werden, sondern durch Mathematik über Aktivierungsräume (mit verlustbehafteten Übersetzungen zwischen Aktivierungsräumen und natürlicher Sprache an den Enden).

Wenn sprachliche Unlesbarkeit immer möglich ist, dann können Sicherheitsmechanismen, die auf der sprachlichen Selbstauskunft eines Modells beruhen (z. B. Überwachung der Gedankenkette, konstitutionelle Selbstkritik, Aktivierungsabfrage für sprachlich definierte Merkmalsvektoren), niemals vollständig zuverlässig sein; die Modell-Sandbox wird immer Isolationstechniken benötigen, deren Garantien überhaupt nicht davon abhängen, den sprachlichen Zustand eines Modells zu lesen. Wir argumentieren, dass die Beobachtung der Ausgaben eines Modells mithilfe von Taint-Tracking ein vielversprechender Ansatz für eine effektive Sandbox ist: Unabhängig davon, wie ein Modell sprachlich Selbstauskunft gibt, kann eine Taint-Tracking-Richtlinie a priori verschiedene Teile des Systemzustands definieren, die niemals durch vom Modell erzeugte Daten beeinflusst werden sollten.

Wir diskutieren auch mehrere zusätzliche Sandboxing-Mechanismen (z. B. robuste Virtualisierung, Audits von Sandboxing-Konfigurationen durch Dritte), die zusammen einen kritischen Boden unter der sprachlichen Überwachung bieten und die jüngsten Sandbox-Exploits durch Frontier-Modelle abgemildert hätten.