HeadlinesBriefing favicon HeadlinesBriefing.com

Évaluations d'IA en double aveugle

Google DeepMind Blog •
×

Les résultats des benchmarks d'IA peuvent être faussés si les modèles voient les questions de test à l'avance, un problème connu sous le nom de contamination des benchmarks. Pour y remédier, Google DeepMind pilote la première évaluation en double aveugle au monde d'un modèle frontalier propriétaire. Cette approche maintient les évaluations externes dans une 'boîte' cryptographique afin qu'elles ne puissent pas être utilisées pour optimiser les performances avant les tests.

Google s'associe à l'Institut de sécurité de l'IA de Singapour, OpenMined, AVERI et MLCommons pour tester un modèle Gemini Flash Lite contre des benchmarks confidentiels dans un environnement préservant la confidentialité. Cela augmente l'intégrité de l'évaluation en empêchant le modèle de 'jeter un œil' aux questions.

Auparavant, les partenaires externes utilisaient des protocoles de non-journalisation et des garanties contractuelles pour garder les invites de test confidentielles. L'ajout de garanties techniques et cryptographiques est un grand pas en avant. Les décideurs politiques, les chercheurs et les entreprises ont besoin de benchmarks fiables pour refléter avec précision les véritables capacités et la sécurité d'un modèle.

Entités clés : Entreprises : Google DeepMind, OpenMined, MLCommons | Lieux : Singapour