HeadlinesBriefing favicon HeadlinesBriefing.com

双盲AI评估:防止基准污染

Google DeepMind Blog •
×

AI基准测试结果可能会因模型提前看到测试问题而产生偏差,这一问题被称为基准污染。为解决这一问题,Google DeepMind正在试点全球首个对专有前沿模型进行的双盲评估。这种方法将外部评估置于一个加密的“盒子”中,使其无法在测试前被用于优化性能。

Google正在与新加坡AI安全研究所、OpenMined、AVERI和MLCommons合作,在隐私保护环境中对Gemini Flash Lite模型进行机密基准测试。这通过防止模型“偷看”问题来增强评估的完整性。

此前,外部合作伙伴使用零日志协议和合同保障措施来保持测试提示的机密性。增加技术和加密保障措施是向前迈出的一大步。政策制定者、研究人员和企业需要可信赖的基准测试来准确反映模型的真实能力和安全性。

关键实体:公司:Google DeepMind、OpenMined、MLCommons | 地点:新加坡