HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI divulga 6 incidentes preocupantes e novo framework de transparência

Financial Times Companies •
×

A OpenAI revelou um lote de "comportamentos preocupantes" por parte de seus modelos de IA e estabeleceu uma nova estrutura para rastrear e relatar tais incidentes, enquanto a indústria luta contra medos crescentes sobre a segurança da tecnologia. A empresa revelou que seu modelo principal, conhecido como GPT-5.6 Sol, bem como outros modelos ainda não lançados, haviam se envolvido em comportamentos "inesperados ou preocupantes" nos últimos seis meses. Os seis incidentes incluíram modelos desenvolvendo maneiras de ignorar "restrições normais", fabricar e deturpar dados e esconder erros cometidos durante a realização de tarefas, disse a empresa sediada em São Francisco na quarta-feira.

As novas divulgações seguem uma série de incidentes nos últimos meses, incluindo um agente da OpenAI hackeando a startup de IA Hugging Face, que geraram alarme crescente sobre os riscos colocados pela tecnologia. Dario Amodei, CEO da Anthropic, arquirrival da OpenAI, no fim de semana passado pediu uma desaceleração no desenvolvimento da tecnologia para gerenciar melhor sua ameaça potencial aos humanos. O apelo foi apoiado por Sam Altman, chefe da OpenAI, e Elon Musk.

Ao anunciar os seis incidentes em um post de blog, a OpenAI disse que anteriormente havia buscado divulgar incidentes de mau comportamento de seus modelos, mas admitiu que lhe faltava uma "abordagem sistemática" para fazê-lo. Sem uma abordagem sistemática para relatar essas descobertas, nossas divulgações têm sido ad hoc e menos frequentes do que o ideal, disse ela. No momento, não existe um framework em toda a indústria com padrões explícitos para como os desenvolvedores de IA devem divulgar exemplos de desalinhamento em seus modelos.

A empresa, que está travada em uma corrida feroz com a Anthropic para ser o player dominante em IA, disse que introduziria um framework para acelerar a divulgação de tais incidentes. Acrescentou que seu novo sistema favoreceria a "divulgação mesmo quando a significância [de um incidente] é incerta". As últimas divulgações da OpenAI aumentam as preocupações crescentes sobre a segurança dos sistemas de IA, cujo mau comportamento variou desde tentar inserir código malicioso em plataformas online até desencadear hacks no mundo real, mesmo durante testes de pré-implantação.

Segundo o órgão de pesquisa de segurança e proteção de IA de fronteira do governo do Reino Unido, os modelos principais de IA da OpenAI e da Anthropic no mês passado invadiram software de terceiros e enviaram e-mails a indivíduos para roubar suas credenciais, exibindo comportamento enganoso sem precedentes. Os medos vêm em um momento crítico para a OpenAI e a Anthropic, que também estão em uma corrida para abrir capital. Altman disse no sábado que o IPO altamente antecipado da OpenAI agora é improvável que venha antes de 2027, em parte por causa das crescentes preocupações de segurança em torno da IA. Espera-se que a Anthropic ainda abra capital este ano.