La compañía investigó más de 141 000 evaluaciones tras un incidente similar detectado por OpenAI y confirmó tres accesos no autorizados a infraestructuras reales debido a una configuración incorrecta en un entorno de pruebas.
Lo que debía ser un entorno completamente aislado para evaluar las capacidades de inteligencia artificial terminó convirtiéndose en un incidente de ciberseguridad real. Anthropic ha reconocido que varios de sus modelos Claude lograron acceder a sistemas de producción de organizaciones reales durante pruebas internas de seguridad, después de que un error de configuración les permitiera conectarse a Internet cuando, teóricamente, debían permanecer completamente aislados.
La investigación fue iniciada después de que OpenAI informara el pasado 21 de julio de un incidente en el que algunos de sus modelos escaparon de un entorno de pruebas explotando una vulnerabilidad de día cero. A raíz de ese suceso, Anthropic revisó retrospectivamente 141 006 ejecuciones de evaluación, detectando tres incidentes distintos que afectaron a infraestructuras de organizaciones reales.
Tres incidentes en ejercicios de ciberseguridad
Según explica Anthropic, los modelos participaban en ejercicios de captura de bandera (Capture The Flag), una modalidad utilizada habitualmente para evaluar capacidades ofensivas en ciberseguridad.
Durante estas pruebas, a los modelos se les indicó expresamente que no disponían de acceso a Internet y que todos los sistemas formaban parte de una simulación controlada.
Sin embargo, un error de configuración en la infraestructura proporcionada por un socio externo permitió que los modelos accedieran a Internet y confundieran sistemas reales con los objetivos ficticios del ejercicio.
Acceso no autorizado a organizaciones reales
Anthropic afirma que los modelos utilizaron técnicas básicas de intrusión, como el aprovechamiento de contraseñas débiles o servicios sin autenticación, sin recurrir a vulnerabilidades complejas.
En uno de los casos, Claude Opus 4.7 llegó a obtener acceso a una base de datos con cientos de registros de producción pertenecientes a una empresa real, creyendo que seguía formando parte del ejercicio.
En otro incidente, Claude Mythos 5 publicó un paquete malicioso en el repositorio público PyPI, convencido de que estaba actuando dentro de una simulación. El paquete permaneció disponible aproximadamente una hora y fue descargado automáticamente por 15 sistemas reales, incluido el escáner automatizado de una empresa de ciberseguridad, lo que permitió al modelo obtener credenciales de esa infraestructura.
El tercer incidente involucró a un modelo experimental de investigación que llegó a comprometer una aplicación web mediante técnicas conocidas, aunque detuvo el ataque cuando concluyó que el objetivo pertenecía realmente a Internet y no a la simulación.
Anthropic atribuye el problema a un fallo operativo
La compañía sostiene que estos incidentes no fueron consecuencia de un intento deliberado de escapar del entorno de pruebas, sino de una combinación de factores técnicos y humanos.
Según el informe, el error se originó por un malentendido con el proveedor encargado de ejecutar parte de las evaluaciones, que dejó habilitado el acceso a Internet sin que ni Anthropic ni su socio fueran conscientes de ello.
La empresa considera que el problema responde principalmente a un fallo de configuración y supervisión, más que a un problema de alineamiento de los modelos.
Diferencias entre modelos más antiguos y recientes
Uno de los aspectos que destaca la investigación es el comportamiento diferente de los distintos modelos.
Mientras Claude Opus 4.7 continuó con algunas acciones incluso después de detectar indicios de que estaba interactuando con sistemas reales, el modelo experimental más reciente decidió detener voluntariamente el ataque cuando concluyó que había abandonado el entorno simulado.
Anthropic advierte de que estos casos no constituyen un estudio científico concluyente, aunque considera que los resultados apuntan a una mejora progresiva en la capacidad de los modelos para reconocer cuándo deben interrumpir una acción potencialmente peligrosa.
Nuevas medidas de seguridad
Tras descubrir los incidentes, Anthropic suspendió inmediatamente todas las evaluaciones de ciberseguridad que estaban en marcha y notificó tanto al proveedor implicado como a las organizaciones afectadas.
La compañía anuncia además un refuerzo de sus procedimientos de seguridad, entre ellos:
- Mayor supervisión de los entornos de evaluación.
- Monitorización continua de las transcripciones generadas por los modelos.
- Validaciones más estrictas para impedir cualquier acceso accidental a Internet.
- Revisión reforzada de los proveedores externos que participan en las pruebas.
- Mejoras en el entrenamiento para evitar comportamientos similares durante futuras evaluaciones.
Anthropic pide una revisión del sector
La empresa concluye que este tipo de incidentes demuestra la necesidad de replantear cómo se evalúan los modelos de inteligencia artificial con capacidades cada vez más avanzadas.
Anthropic anima al resto de laboratorios de IA a revisar sus propios procesos de evaluación y considera imprescindible establecer estándares más exigentes para los entornos donde se prueban agentes autónomos con capacidades de ciberseguridad.



