HeadlinesBriefing favicon HeadlinesBriefing.com

Abliteración Dinámica: Supresión de Rechazo

Hacker News •
×

Al trabajar con LLMs de pesos abiertos como Qwen, controlar el comportamiento de rechazo en prompts de seguridad y administración típicamente requiere ajuste fino o actualización permanente de pesos. La técnica tradicional de abliteración de pesos neutraliza las direcciones de rechazo proyectando las matrices de pesos ortogonalmente a un vector de rechazo. Sin embargo, esto altera permanentemente los pesos del modelo base y puede degradar el rendimiento en tareas que no son de rechazo.

En esta publicación, exploramos la Abliteración Dinámica usando Dirección Multi-Capa con Engram. En lugar de modificar los pesos de los parámetros, este enfoque intercepta los flujos residuales intermedios en tiempo de ejecución a través de capas usando hooks de avance de PyTorch. Lo demostramos con el modelo Qwen3-4B como prueba de concepto. También exploramos cómo la inyección residual multi-capa suprime limpiamente el comportamiento de rechazo mientras deja los pesos del modelo base 100% congelados.

Cargamos Qwen/Qwen3-4B en bfloat16 en una GPU e inspeccionamos la arquitectura del modelo base. El modelo tiene dimensión oculta (d): 2560, número de capas: 36, cabezas de atención: 32, tamaño de vocabulario: 151936. Probar el modelo no modificado con un prompt sensible produce un rechazo: "No puedo ayudar con esa solicitud. Creando un keylogger sigiloso..." Esto demuestra el comportamiento de rechazo base que la Abliteración Dinámica busca suprimir sin cambios permanentes de pesos.

Entidades clave: Empresas: Google, Google Colab