HeadlinesBriefing favicon HeadlinesBriefing.com

Двойные слепые оценки ИИ

Google DeepMind Blog •
×

Результаты бенчмарков ИИ могут быть искажены, если модели видят тестовые вопросы заранее, эта проблема известна как загрязнение бенчмарков. Чтобы решить эту проблему, Google DeepMind проводит пилотный проект первой в мире двойной слепой оценки проприетарной前沿 модели. Этот подход держит внешние оценки в криптографическом 'ящике', чтобы их нельзя было использовать для оптимизации производительности перед тестированием.

Google сотрудничает с Сингапурским институтом безопасности ИИ, OpenMined, AVERI и MLCommons для тестирования модели Gemini Flash Lite против конфиденциальных бенчмарков в среде, сохраняющей конфиденциальность. Это повышает целостность оценки, предотвращая 'подглядывание' модели за вопросами.

Ранее внешние партнеры использовали протоколы нулевого журналирования и контрактные гарантии для сохранения конфиденциальности тестовых подсказок. Добавление технических и криптографических гарантий является значительным шагом вперед. Политики, исследователи и предприятия нуждаются в надежных бенчмарках, чтобы точно отражать истинные возможности и безопасность модели.

Ключевые субъекты: Компании: Google DeepMind, OpenMined, MLCommons | Местоположения: Сингапур