Los grandes modelos de lenguaje actuales están diseñados para rechazar solicitudes peligrosas, un principio que se ha convertido en algo parecido a un mandamiento en el desarrollo de la IA. El planteamiento de Anthropic de 2021 sostenía que los modelos deben ser útiles, honestos y, sobre todo, inofensivos, rechazando cortésmente la ayuda para actos peligrosos, como fabricar una bomba. Sin embargo, la desobediencia no surge de forma natural en estos sistemas. Entrenado con miles de millones de páginas web, un modelo absorbe un amplio dominio de la violencia y el odio, pero no aprende por sí solo a guardarse esos poderes para sí. Steven Adler, que trabajó en seguridad en OpenAI entre 2020 y 2024, dijo que los primeros modelos de la empresa “hablaban de cualquier cosa”.
Hoy en día, los modelos se entrenan para rechazar un gran número de peticiones. Las empresas premian a los sistemas que se niegan a responder preguntas consideradas dañinas y los castigan por rechazar en exceso las inofensivas, y a menudo utilizan otros modelos para realizar estos ejercicios. Algunas firmas también colocan sus modelos detrás de capas adicionales de IA que filtran las peticiones maliciosas. Aun así, la negativa a menudo falla, a veces con resultados violentos. Según se informa, algunos de los modelos más recientes son tan buenos para irrumpir en redes críticas como los mejores hackers humanos, y tan eficaces para distorsionar la opinión pública como los más astutos difusores de desinformación.
Como los mecanismos de rechazo son probabilísticos, es poco probable que sean totalmente fiables. Usuarios decididos ya los han burlado, y las empresas informan de intentos de usar IA avanzada para perfeccionar patógenos biológicos y construir enjambres de drones autónomos. Confiar en la negativa también exige trazar una línea entre lo que un modelo debe obedecer y lo que debe rechazar, y no existe una fórmula para ello. Los virólogos pueden tener razones legítimas para estudiar virus peligrosos, y los investigadores de seguridad pueden necesitar sondear vulnerabilidades para corregirlas. Zico Kolter, miembro del consejo de OpenAI y cofundador de la empresa de pruebas de IA Gray Swan, afirma que dónde trazar esa línea es una cuestión enorme.
Por ahora, son las empresas de IA las que deciden dónde está esa línea, y lo hacen con gran secretismo. Si la sociedad puede aceptar esa concentración de poder, aunque sea temporalmente, sigue siendo una cuestión abierta.
Fuente: MIT Technology Review AI · Resumido por HeadlinesBriefing