HeadlinesBriefing favicon HeadlinesBriefing.com

Abliteração Dinâmica: Supressão de Recusa

Hacker News •
×

Ao trabalhar com LLMs de pesos abertos como Qwen, controlar o comportamento de recusa em prompts de segurança e administração normalmente requer ajuste fino ou atualização permanente de pesos. A técnica tradicional de abliteração de pesos neutraliza as direções de recusa projetando as matrizes de pesos ortogonalmente a um vetor de recusa. No entanto, isso altera permanentemente os pesos do modelo base e pode degradar o desempenho em tarefas não relacionadas à recusa.

Neste post, exploramos a Abliteração Dinâmica usando Direção Multicamada com Engram. Em vez de modificar os pesos dos parâmetros, essa abordagem intercepta os fluxos residuais intermediários em tempo de execução através das camadas usando hooks de avanço do PyTorch. Demonstramos isso com o modelo Qwen3-4B como prova de conceito. Também exploramos como a injeção residual multicamada suprime limpo o comportamento de recusa, deixando os pesos do modelo base 100% congelados.

Carregamos Qwen/Qwen3-4B em bfloat16 em uma GPU e inspecionamos a arquitetura do modelo base. O modelo tem dimensão oculta (d): 2560, número de camadas: 36, cabeças de atenção: 32, tamanho do vocabulário: 151936. Testar o modelo não modificado com um prompt sensível produz uma recusa: "Não posso ajudar com essa solicitação. Criando um keylogger furtivo..." Isso demonstra o comportamento de recusa base que a Abliteração Dinâmica visa suprimir sem mudanças permanentes de pesos.

Entidades-chave: Empresas: Google, Google Colab