HeadlinesBriefing favicon HeadlinesBriefing.com

Princípios da OpenAI para Avaliações

OpenAI Blog •
×

Laboratórios de IA de fronteira carregam uma imensa responsabilidade no treinamento, avaliação e implantação segura de modelos. As avaliações de terceiros são uma parte crítica para equilibrar essa responsabilidade, ampliar oportunidades de contribuição sobre segurança de IA, manter o mundo informado e manter os laboratórios responsáveis por afirmações de segurança claras e apoiadas de forma independente. Como parte de nossos esforços para acompanhar a fronteira, a OpenAI está comprometida em apoiar avaliações independentes com níveis profundos de acesso em treinamento, avaliação e implantação. Esse acesso deve permitir que os avaliadores desafiem nossas suposições, identifiquem riscos que possamos ter perdido e cheguem às suas próprias conclusões sobre a eficácia de nossas salvaguardas.

Há muito tempo trabalhamos com avaliadores terceiros em várias etapas do processo de desenvolvimento e implantação de modelos. Também incorporamos avaliações de terceiros em nossas práticas do Framework de Preparação e apoiamos organizações e legislações que defendem um processo mais rigoroso e responsável. Ao longo desses engajamentos, fornecemos formas profundas de acesso, incluindo informações sobre nossas salvaguardas técnicas, acesso visível à cadeia de pensamento e níveis sem precedentes de dados confidenciais e acesso interno à implantação para resposta a incidentes e red teaming de monitoramento. As prioridades e princípios compartilhados aqui focam em nosso engajamento com organizações de avaliação independentes nos setores privado e sem fins lucrativos em avaliações de segurança técnica. Eles complementam nosso trabalho com governos em testes e avaliação, onde papéis e responsabilidades distintos podem exigir abordagens diferentes.

Tornar essas avaliações eficazes requer mecanismos fortes de independência, rigor científico, práticas de segurança robustas e responsabilidades claras. Os laboratórios têm a responsabilidade de permitir escrutínio significativo enquanto protegem informações sensíveis. Laboratórios e avaliadores independentes compartilham a responsabilidade de fazer isso corretamente e devem operar com padrões internacionais compartilhados para práticas de segurança e proteção. Abaixo, propomos quatro áreas prioritárias para avaliação mais profunda, juntamente com princípios para trabalho rigoroso, seguro e independente.

Áreas prioritárias para avaliação: As avaliações de terceiros são mais úteis quando abordam questões específicas e consequentes: As evidências apoiam o caso de segurança e as afirmações de segurança de um laboratório? As avaliações testam adequadamente os riscos que pretendem medir? As salvaguardas funcionam em condições realistas? As avaliações descritas aqui pretendem assumir diferentes formas dependendo das questões de segurança examinadas. Esperamos apoiar múltiplas avaliações em paralelo e em diferentes períodos de tempo, algumas durando semanas e outras vários meses. Embora as avaliações de terceiros também possam fazer parte do trabalho pré-implantação e possam informar decisões de implantação, o trabalho descrito aqui é geralmente de longo prazo e independente do lançamento—focado em examinar afirmações de segurança específicas em profundidade ao longo do tempo. Em nossas áreas prioritárias e princípios, referimo-nos a afirmações de segurança e casos de segurança. O que queremos dizer com esses termos é o seguinte: Propomos quatro áreas prioritárias para avaliação mais profunda, juntamente com princípios para trabalho rigoroso, seguro e independente. Avaliação independente de casos de segurança, abrangendo treinamento, avaliação, implantação interna e implantação externa. A avaliação de casos de segurança requer expertise em alinhamento, métodos de controle como monitoramento, segurança cibernética, uso indevido biológico e químico e red teaming. Os casos de segurança consistem em afirmações incluindo treinamento, avaliações de capacidade e salvaguardas, que podem ser avaliadas como um todo ou em partes (ver prioridades 2 e 3 abaixo). Vários avaliadores provavelmente precisarão examinar diferentes partes dos casos, com base em suas respectivas expertises. Juntos, suas avaliações devem responder a perguntas como: As evidências para casos de segurança de treinamento, avaliação e implantações estão substanciadas? As condições do caso de segurança foram seguidas durante o treinamento, avaliação...

FAQ P: Quais são as prioridades da OpenAI para avaliações de terceiros?

FAQ R: A OpenAI propõe quatro áreas prioritárias para avaliação mais profunda, juntamente com princípios para trabalho rigoroso, seguro e independente. Estas incluem avaliação independente de casos de segurança abrangendo treinamento, avaliação, implantação interna e implantação externa.