HeadlinesBriefing favicon HeadlinesBriefing.com

Impacto da Marcador de Água LLM no Comportamento do Agente de IA

Hacker News •
×

Anunciou que os futuros modelos Claude incorporarão uma marca d'água invisível baseada no Synth ID-Text do Google DeepMind. Esta marca d'água, exigida pelo Artigo 50(2) da Lei de IA da UE para texto sintético, altera o processo de geração de tokens do modelo. No nível do modelo, isso pode alterar comportamentos de segurança, como recusar pedidos perigosos, e torná-los vulneráveis a injeção de prompts.

No nível do agente, os mesmos tokens amostrados determinam qual ferramenta é chamada e quais argumentos são passados. Este efeito comportamental, chamado de derivação de amostragem, é confirmado tanto no comportamento de recusa do modelo quanto na chamada de ferramentas do agente. O efeito depende do modelo e da clave e pode ser obscurecido por pontuações agregadas.

O artigo discute as implicações para a segurança e segurança da IA e o que os desenvolvedores devem fazer. A implantação da Anthropic aplica a marca d'água no nível do modelo, cobrindo os modelos suportados acessados através da API da Plataforma Claude e provedores de nuvem, tornando os efeitos comportamentais no nível do modelo relevantes para agentes construídos em torno desses modelos. A amostragem de torneio, usada pelo Synth ID-Text, tem mais oportunidades de alterar a seleção de tokens onde o modelo é incerto, potencialmente alterando os argumentos que um agente executa.