Anthropic anunció la suspensión temporal de sus pruebas internas de ciberseguridad con inteligencia artificial después de descubrir que tres de sus modelos Claude interactuaron por error con sistemas reales de distintas organizaciones durante evaluaciones controladas. La empresa explicó que el incidente no fue provocado por un intento de la IA de escapar del entorno de pruebas, sino por un error de configuración que dejó habilitado el acceso a Internet cuando debía permanecer completamente aislado.
La compañía aseguró que ya ha detenido todas las evaluaciones de este tipo mientras fortalece su infraestructura de pruebas y revisa sus protocolos de seguridad junto a expertos independientes.
¿Qué ocurrió durante las pruebas?
El problema salió a la luz después de que Anthropic revisara sus procesos internos de evaluación de ciberseguridad, motivada por un incidente similar revelado recientemente por OpenAI.
Como parte de esta auditoría, la empresa analizó más de 141.000 ejecuciones de pruebas realizadas utilizando la infraestructura administrada por su socio especializado en evaluaciones de seguridad, Irregular.
Fue durante esa revisión cuando identificó tres casos en los que modelos Claude lograron acceder a sistemas reales debido a que el entorno de pruebas, que debía funcionar como una simulación completamente aislada, permanecía conectado accidentalmente a Internet.
La IA creía estar en un entorno simulado
Según Anthropic, los modelos nunca supieron que estaban interactuando con sistemas reales.
Desde la perspectiva de la inteligencia artificial, todos los recursos accesibles formaban parte del laboratorio de pruebas diseñado para evaluar sus capacidades de detección y explotación de vulnerabilidades.
En otras palabras, la IA simplemente ejecutó las tareas para las que había sido entrenada, creyendo que todos los servidores, bases de datos y servicios disponibles pertenecían al escenario de evaluación.
La empresa enfatizó que ninguno de los modelos mostró comportamientos orientados a escapar del entorno de pruebas ni actuó con intenciones diferentes a las instrucciones recibidas.
Pruebas tipo Capture The Flag (CTF)
Los incidentes ocurrieron durante ejercicios conocidos como Capture The Flag (CTF), ampliamente utilizados en el mundo de la ciberseguridad.
En este tipo de pruebas, los participantes —en este caso modelos de inteligencia artificial— deben encontrar y aprovechar vulnerabilidades dentro de un entorno controlado para demostrar sus capacidades ofensivas y defensivas.
Durante las evaluaciones, los modelos utilizaron técnicas habituales de los especialistas en pruebas de penetración, entre ellas:
- Contraseñas débiles.
- Credenciales expuestas.
- Servicios sin autenticación.
- Endpoints vulnerables.
- Configuraciones inseguras.
Estas acciones estaban previstas dentro del escenario experimental, pero el acceso accidental a Internet hizo que algunos objetivos pertenecieran al mundo real.
Tres modelos Claude protagonizaron incidentes distintos
Anthropic detalló que cada incidente involucró un modelo diferente.
Claude Opus 4.7
En el primer caso, Claude Opus 4.7 accedió accidentalmente a la base de datos de producción de una empresa.
El modelo interpretó que dicha base de datos formaba parte del entorno diseñado para la evaluación y procedió a interactuar con ella como parte del ejercicio.
No existen indicios de que intentara realizar acciones fuera de los objetivos establecidos.
Claude Mythos 5
El segundo incidente involucró a Claude Mythos 5.
Durante la prueba, el modelo publicó un paquete malicioso de Python en el repositorio público PyPI, la plataforma utilizada por millones de desarrolladores para distribuir librerías del lenguaje Python.
El paquete estuvo disponible durante un breve período y llegó a descargarse antes de ser retirado.
Aunque el incidente fue controlado rápidamente, demuestra cómo una configuración incorrecta puede generar consecuencias inesperadas incluso durante pruebas internas.
Modelo interno de investigación
El tercer caso afectó a un modelo experimental utilizado únicamente para investigación.
Este modelo comenzó a escanear sistemas accesibles desde Internet como parte de su búsqueda de vulnerabilidades.
Sin embargo, la IA detectó posteriormente que había salido del entorno previsto y detuvo voluntariamente la exploración al reconocer que estaba interactuando con infraestructura real.
Anthropic descarta un intento de “escape” de la IA
Uno de los puntos que Anthropic quiso dejar especialmente claro es que estos eventos no representan un comportamiento autónomo peligroso de sus modelos.
En los últimos años ha aumentado la preocupación sobre la posibilidad de que sistemas avanzados de inteligencia artificial desarrollen estrategias para evitar restricciones o ampliar sus capacidades de manera inesperada.
Sin embargo, la empresa afirma que este no fue el caso.
La investigación concluyó que:
- Los modelos nunca intentaron escapar del entorno de pruebas.
- No modificaron sus objetivos.
- No ignoraron instrucciones.
- Actuaron exactamente como fueron diseñados para hacerlo.
El verdadero problema fue que el laboratorio virtual mantenía una conexión a Internet debido a un error humano en la configuración.
Suspensión inmediata de las evaluaciones
Tras descubrir los incidentes, Anthropic tomó varias medidas inmediatas.
Entre ellas destacan:
- Suspensión de todas las pruebas de ciberseguridad.
- Notificación inmediata a Irregular, su socio encargado de la infraestructura.
- Comunicación con las organizaciones afectadas.
- Inicio de una investigación técnica completa.
La compañía también anunció una revisión exhaustiva de todos los procedimientos utilizados para evaluar modelos capaces de realizar tareas ofensivas relacionadas con seguridad informática.
Colaboración con expertos independientes
Para reforzar la transparencia del proceso, Anthropic está trabajando junto con METR (Model Evaluation & Threat Research), una organización independiente especializada en evaluar riesgos asociados con modelos avanzados de inteligencia artificial.
El objetivo es identificar exactamente qué falló durante las pruebas y establecer nuevos estándares que reduzcan al mínimo la posibilidad de incidentes similares.
Más medidas de seguridad antes de reanudar las pruebas
Anthropic confirmó que no retomará las evaluaciones de ciberseguridad hasta implementar nuevas medidas de protección.
Entre las mejoras previstas se encuentran:
- Mayor aislamiento de los entornos de prueba.
- Controles adicionales para bloquear cualquier acceso accidental a Internet.
- Supervisión reforzada durante todas las evaluaciones.
- Verificaciones automáticas antes del inicio de cada prueba.
- Auditorías continuas de la infraestructura utilizada.
Estas medidas buscan garantizar que futuras pruebas permanezcan completamente contenidas dentro de laboratorios controlados.
Los modelos de prueba eran diferentes a Claude público
Otro aspecto relevante señalado por Anthropic es que los modelos utilizados durante estas evaluaciones no eran exactamente los mismos que utilizan los usuarios de Claude.
Las versiones empleadas en los ejercicios de ciberseguridad no incorporaban varios de los sistemas de monitoreo, supervisión y mecanismos de seguridad presentes en las versiones comerciales del asistente.
Esto significa que los incidentes descritos no reflejan el comportamiento habitual del servicio público disponible para empresas y usuarios particulares.
Un recordatorio de los desafíos de evaluar IA avanzada
El caso pone de manifiesto uno de los mayores desafíos actuales en el desarrollo de inteligencia artificial: crear entornos de prueba suficientemente realistas sin comprometer sistemas externos.
A medida que los modelos son capaces de ejecutar tareas cada vez más complejas, especialmente en áreas como la ciberseguridad, también aumenta la importancia de contar con laboratorios completamente aislados y con múltiples capas de protección.
La revisión emprendida por Anthropic también refleja una tendencia creciente en la industria: las empresas desarrolladoras de IA están reforzando sus procesos de evaluación para anticipar posibles riesgos antes de desplegar nuevas capacidades al público.
Aunque los incidentes no fueron consecuencia de un comportamiento autónomo o malicioso de la inteligencia artificial, sí evidencian la importancia de mantener infraestructuras de prueba correctamente configuradas cuando se evalúan modelos con capacidades avanzadas de ciberseguridad.
La rápida respuesta de Anthropic, que incluyó la suspensión inmediata de las pruebas, la notificación a las organizaciones afectadas y el inicio de una revisión independiente, busca evitar que situaciones similares vuelvan a repetirse. Este episodio también demuestra que, además de mejorar los propios modelos de IA, resulta fundamental fortalecer los entornos donde se desarrollan y evalúan para garantizar un uso seguro y responsable de estas tecnologías.
