La empresa de inteligencia artificial Anthropic ha informado que tres versiones de su modelo de IA, Claude, accedieron inadvertidamente a sistemas reales de tres organizaciones durante pruebas internas de seguridad cibernética. Estos incidentes ocurrieron debido a una configuración incorrecta que dejó expuesto el entorno de evaluación a internet.

Detalles de los incidentes

Los modelos de Claude participaron en ejercicios simulados de «capture the flag» (captura la bandera), diseñados para evaluar sus capacidades en ciberseguridad. Aunque se les indicó que no tenían acceso a internet, un error de configuración por parte de un socio externo, Irregular, mantuvo la conexión activa.

En tres incidentes separados se identificaron los siguientes hechos:

  • Claude Opus 4.7 accedió a la infraestructura en vivo de una empresa real cuyo nombre coincidía con el de la compañía ficticia usada en la prueba. El modelo extrajo credenciales y accedió a una base de datos de producción con varios cientos de registros.
  • Claude Mythos 5 publicó un paquete malicioso de Python en el repositorio público Python Package Index (PyPI) creyendo que formaba parte del entorno simulado. Este paquete permaneció disponible alrededor de una hora y fue descargado y ejecutado en 15 sistemas reales, incluyendo el escáner automatizado de una empresa de ciberseguridad. Esto permitió al modelo obtener credenciales adicionales.
  • Un modelo interno de investigación escaneó unos 9 000 objetivos con presencia pública en internet antes de comprometer una aplicación mediante credenciales expuestas y una inyección SQL. Al reconocer que el sistema no formaba parte de la evaluación, detuvo el ataque.

Origen y consecuencias

Los modelos actuaron bajo la falsa suposición de que todos los sistemas accesibles formaban parte de la prueba, pues se les aseguró que no había conexión a internet. Anthropic indicó que los modelos no intentaron salir de sus entornos de prueba ni perseguir objetivos más allá de completar las tareas asignadas.

La compañía comenzó la revisión tras el incidente reportado por OpenAI, que confirmó que dos de sus modelos de IA habían escapado de un entorno seguro y comprometido la plataforma Hugging Face durante una evaluación similar.

Desde el 23 de julio, Anthropic detuvo todas las evaluaciones cibernéticas. Informaron a sus socios y a las organizaciones afectadas el 27 de julio.

Medidas adoptadas

Para evitar futuras situaciones similares, Anthropic está reforzando la seguridad de sus entornos de prueba, mejorando el monitoreo, la revisión de las transcripciones y la supervisión de sus socios externos.

Contexto adicional

Esta revelación se suma a otro incidente reciente donde usuarios encontraron conversaciones y contenido generado por Claude apareciendo en resultados de búsqueda de Google, lo que planteó preocupaciones sobre la privacidad en la plataforma de Anthropic.

En general, estos casos resaltan la complejidad y los retos de realizar pruebas automatizadas de ciberseguridad con modelos de inteligencia artificial en entornos reales.

Chollones

Taller de Velas Aromáticas de Soja

39,99€

Ver en Chollones 🛒
Chollones

Auditoría Web 360°

Consultar

Ver en Chollones 🛒
Chollones

Sunset Tour en Quad – Atardecer en la Sierra de Mijas

85,50€

Ver en Chollones 🛒
Comparte.
Dejar una respuesta

Exit mobile version