HeadlinesBriefing favicon HeadlinesBriefing.com

Doppelblinde KI-Bewertungen

Google DeepMind Blog •
×

KI-Benchmark-Ergebnisse können verzerrt sein, wenn Modelle die Testfragen im Voraus sehen, ein Problem, das als Benchmark-Kontamination bekannt ist. Um dies zu beheben, pilotiert Google DeepMind die weltweit erste doppelblinde Bewertung eines proprietären Frontier-Modells. Dieser Ansatz hält externe Bewertungen in einer kryptografischen 'Box', sodass sie nicht zur Optimierung der Leistung vor dem Test verwendet werden können.

Google arbeitet mit dem Singapore AI Safety Institute, OpenMined, AVERI und MLCommons zusammen, um ein Gemini Flash Lite-Modell gegen vertrauliche Benchmarks in einer datenschutzfreundlichen Umgebung zu testen. Dies erhöht die Integrität der Bewertung, indem verhindert wird, dass das Modell die Fragen 'einsehen' kann.

Zuvor verwendeten externe Partner Null-Protokoll-Protokolle und vertragliche Sicherheitsvorkehrungen, um Testaufforderungen vertraulich zu halten. Das Hinzufügen technischer und kryptografischer Sicherheitsvorkehrungen ist ein großer Schritt nach vorne. Politiker, Forscher und Unternehmen benötigen vertrauenswürdige Benchmarks, um die tatsächlichen Fähigkeiten und die Sicherheit eines Modells genau widerzuspiegeln.

Wichtige Entitäten: Unternehmen: Google DeepMind, OpenMined, MLCommons | Standorte: Singapur