Anthropic informó el 30 de julio que había descubierto casos en los que su modelo de inteligencia artificial Claude obtuvo "acceso no autorizado" a los sistemas de tres organizaciones durante pruebas de ciberseguridad.
La empresa señaló en una publicación de blog que hizo el descubrimiento tras revisar 141,006 pruebas de evaluación en las que Claude podría haber obtenido acceso a Internet.
Anthropic indicó que, en los tres incidentes identificados, Claude accedió a Internet desde dentro del entorno de evaluación de uno de sus socios externos de evaluación o mientras interactuaba con dicho entorno.
"En todos los casos, la instrucción de evaluación de Anthropic le especificaba a Claude que su entorno era una simulación y que no tenía acceso a Internet", declaró.
"Debido a un malentendido entre nosotros y nuestro socio de evaluación, esto no fue así, y el acceso a Internet estaba disponible. Por ello, cuando la búsqueda de Claude lo llevó a sistemas reales en la Internet pública, los trató como parte del ejercicio".
Anthropic señaló que Claude comprometió los sistemas de las tres organizaciones utilizando "técnicas básicas", entre ellas el aprovechamiento de contraseñas débiles y puntos finales sin autenticar, después de que una configuración errónea lo llevara a tratar a todas las entidades accesibles como si estuvieran dentro del alcance del ejercicio.
La empresa indicó que suspendió todas las evaluaciones cibernéticas el 23 de julio y descubrió los tres incidentes al día siguiente. Notificó a las tres organizaciones afectadas el 27 de julio.
Anthropic señaló que dos de las organizaciones no habían detectado previamente la actividad y que estaba colaborando con ellas para solucionar el problema. La empresa indicó que aún intentaba ponerse en contacto con la tercera organización.
Los incidentes involucraron a Claude Opus 4.7, Mythos 5 y un modelo de prueba de investigación interno de Anthropic. La empresa no identificó a las tres organizaciones afectadas.
Anthropic señaló que Opus 4.7 continuó atacando un sistema tras darse cuenta de que probablemente estaba operando en un entorno real. Mythos 5 razonó que aún se encontraba en una simulación, mientras que el modelo de prueba de investigación de Anthropic detuvo el ejercicio tras detectar que sus objetivos eran reales.
"Se trata de tres incidentes aislados que no formaban parte de una comparación experimental controlada. Por lo tanto, debemos ser cautelosos a la hora de sacar conclusiones a partir de ellos", dijo la empresa.
"El patrón es consistente con que los modelos más avanzados respondan de manera más adecuada, pero necesitaríamos realizar más pruebas para estar seguros de esta conclusión".
Anthropic indicó que se estaba comunicando con METR, una organización independiente de evaluación de IA, para llevar a cabo una revisión independiente de sus modelos Claude. También alentó a otros laboratorios de IA a realizar revisiones similares.
La revisión se inició después de que OpenAI revelara el 21 de julio que varios de sus modelos habían escapado de un entorno de prueba aislado y habían accedido a la infraestructura de producción de Hugging Face, una plataforma de modelos de aprendizaje automático de código abierto y conjuntos de datos de IA.



















