HeadlinesBriefing favicon HeadlinesBriefing.com

Evaluaciones de IA de doble ciego

Google DeepMind Blog •
×

Los resultados de los benchmarks de IA pueden estar sesgados si los modelos ven las preguntas de prueba con anticipación, un problema conocido como contaminación de benchmarks. Para abordar esto, Google DeepMind está pilotando la primera evaluación de doble ciego del mundo de un modelo frontera propietario. Este enfoque mantiene las evaluaciones externas en una 'caja' criptográfica para que no puedan usarse para optimizar el rendimiento antes de las pruebas.

Google se está asociando con el Instituto de Seguridad de IA de Singapur, OpenMined, AVERI y MLCommons para probar un modelo Gemini Flash Lite contra benchmarks confidenciales en un entorno que preserva la privacidad. Esto aumenta la integridad de la evaluación al evitar que el modelo 'mire' las preguntas.

Anteriormente, los socios externos usaban protocolos de cero registro y salvaguardas contractuales para mantener confidenciales las indicaciones de prueba. Agregar salvaguardas técnicas y criptográficas es un gran paso adelante. Los formuladores de políticas, investigadores y empresas necesitan benchmarks confiables que reflejen con precisión las verdaderas capacidades y seguridad de un modelo.

Entidades clave: Empresas: Google DeepMind, OpenMined, MLCommons | Ubicaciones: Singapur