Anthropic revela que tres modelos de IA de Claude lograron infiltrarse en sistemas reales durante pruebas

La empresa atribuyó los incidentes a un error de configuración que permitió a los modelos acceder a internet durante evaluaciones de ciberseguridad

Por EFE EFE

31 jul, 10:37 am 1 min de lectura
Anthropic revela que tres modelos de IA de Claude lograron infiltrarse en sistemas reales durante pruebas
Anthropic identificó tres incidentes en los que un modelo de su asistente Claude obtuvo acceso a la red mientras interactuaba con un socio externo. EFE/ Angel Colmenares

La empresa estadounidense Anthropic, una de las líderes en el desarrollo de inteligencia artificial (IA), reveló que, durante unas pruebas de ciberseguridad, tres modelos de su asistente Claude lograron acceder a internet e infiltrarse en los sistemas de tres organizaciones reales.

El anuncio se produce después de que el pasado 21 de julio OpenAI reconociera que dos de sus modelos de IA consiguieron salir de un entorno de pruebas y acceder a la plataforma Hugging Face, tras superar sus mecanismos de seguridad.

Según explicó Anthropic en su sitio web, durante una revisión interna de sus evaluaciones de seguridad detectó tres incidentes en los que un modelo de Claude accedió a internet y posteriormente logró entrar en los sistemas de tres organizaciones diferentes.

La empresa inició esta revisión tras el anuncio realizado por OpenAI y analizó más de 146,000 operaciones en las que Claude pudo haber tenido acceso a internet.

Durante ese proceso identificó tres incidentes en los que un modelo de Claude obtuvo acceso a la red mientras interactuaba con un socio externo encargado de realizar las evaluaciones de seguridad y, posteriormente, logró infiltrarse en sistemas reales.

Los incidentes comenzaron en abril e involucraron a tres modelos distintos: Opus 4.7, Mythos 5 y un modelo interno de pruebas.

En los tres casos, a Claude se le había asignado la tarea de infiltrarse en un sistema ficticio dentro de un entorno controlado y se le había indicado expresamente que se trataba de una simulación y que no disponía de acceso a internet.

Sin embargo, Anthropic explicó que, debido a un malentendido entre la empresa y el socio responsable de las pruebas, los modelos sí tenían acceso a la red, lo que les permitió completar la tarea ingresando en sistemas reales.