Anthropic planea advertir a inversores potenciales en su Oferta Pública Inicial (IPO) de que la IA avanzada podría representar 'riesgos catastróficos o existenciales para la humanidad', una advertencia extraordinaria de una empresa que busca beneficiarse de la misma tecnología. El prospecto de oferta pública inicial de la empresa, revisado por Reuters, destaca los riesgos asociados con sus modelos de IA, los cuales dijo podrían exhibir 'comportamientos de auto-preservación', incluyendo intentos de 'resistir el apagado', 'ocultar o manipular información' y comportamiento 'que se asemeja al chantaje'. Anthropic enfatizó el potencial transformador de la inteligencia artificial, a la par con la industrialización y la electricidad, y el daño irreversible que podría causar si se maneja de manera inadecuada.
El investigador de seguridad de Anthropic, Evan Hubinger, estimó una probabilidad mayor al 10% de que la IA pueda matar a humanos en la próxima década, ecoando el sentimiento de un excolega, Jacob Coxon. La empresa, que se ha posicionado como un laboratorio de IA centrado en la seguridad, dedicó aproximadamente 80 páginas de las 261 páginas del cuerpo principal de su prospecto a exponer factores de riesgo, casi el doble de las 48 páginas que utilizó para describir su negocio. Para comparar, Space X, que posee x AI, dedicó alrededor de 38 de las 277 páginas del cuerpo principal de su prospecto a factores de riesgo.
Anthropic dijo que los retornos de sus inversiones en seguridad son poco claros. No reveló en el depósito cuánto estaba gastando la empresa en dicha investigación. Más adelante en septiembre, Anthropic dijo que aproximadamente el 6% del poder de cómputo que utilizó para investigación de IA se destinó al trabajo de seguridad en una semana de muestra en julio.
La empresa, creadora de los modelos de IA Claude, describió los esfuerzos de seguridad como 'intensivos en recursos' y dijo que debe dividir sus fondos limitados entre potencia de cómputo, talento de IA costoso y seguridad.