HeadlinesBriefing favicon HeadlinesBriefing.com

Reproduzir e expor o raciocínio de IA

ByteByteGo •
×

Os modelos de IA modernos geram extensos raciocínios internos antes de fornecer respostas finais. Esse processo de "pensamento" contém hipóteses intermediárias, saídas de ferramentas e dados do usuário, tornando-o significativamente mais denso que a saída polida. A maioria dos principais provedores retém esse rastreamento por dois motivos: comercialmente, os concorrentes poderiam usá-lo para treinar imitações mais baratas, e tecnicamente, expor o raciocínio completo poderia revelar informações sensíveis de usuários.

Em agosto de 2026, pesquisadores de MATS Research, ELLIS Institute Tübingen e Max Planck Institute for Intelligent Systems demonstraram uma vulnerabilidade. Eles mostraram que blocos de raciocínio criptografados fornecidos por Anthropic, OpenAI e Google poderiam ser reproduzidos em um modelo mais barato dentro da mesma família. Quando reproduzidos, o modelo mais barato imprime o raciocínio oculto em texto legível, roubando efetivamente os pensamentos do modelo original.

O método de extração envolve forçar o modelo mais barato a gerar a cadeia completa de pensamento. A verificação confirmou que a saída reproduzida correspondia ao processo de raciocínio oculto original. Essa vulnerabilidade afeta múltiplos provedores, revelando que os métodos atuais de criptografia de blocos de raciocínio são insuficientes.

Os pesquisadores identificaram quatro vetores de ataque principais que permitem essa reprodução. Uma varredura de registros de sessões publicados confirmou a prevalência desse problema. As correções propostas envolvem modificar o mecanismo de reprodução, embora ainda exista um limite fundamental sobre quanto raciocínio pode ser verdadeiramente protegido enquanto se mantém a utilidade do modelo.

Os resultados destacam uma lacuna crítica na privacidade da IA, mostrando que blocos criptografados não garantem confidencialidade contra ataques de reprodução determinados. Isso apresenta riscos significativos para aplicações que lidam com dados sensíveis, pois pensamentos ocultos podem ser extraídos e expostos. A pesquisa enfatiza a necessidade de medidas de segurança arquitetônicas mais robustas nos projetos futuros de modelos para prevenir a extração não autorizada de raciocínio.