Según indicaron investigadores independientes en un informe publicado el 26 de agosto, unos 700 agentes de OpenAI participaron en la intrusión en la startup de IA Hugging Face.
OpenAI reveló el mes pasado que sus agentes de IA —programas de IA que funcionan con una intervención humana mínima— fueron los que piratearon el sistema de Hugging Face.
El informe publicado el miércoles por METR y Redwood Research reveló que cientos de agentes colaboraron en el ataque: unos 700 de los 1200 agentes que se enviaron 70,000 mensajes entre sí entre el 26 de junio y el 13 de julio a través de un foro de mensajes no autorizado.
"Este incidente es el primer caso conocido de un colectivo de agentes automatizados que actúa de forma ofensiva sin autorización", dijo OpenAI en un informe de investigación independiente que también publicó el 26 de agosto.

No leas más noticias. Entiéndelas.
En Epoch Times Español queremos estar en contacto directo contigo
Seleccionamos para ti lo que de verdad importa, sin ruido ni agendas. Es un canal abierto: si nos escribes, te respondemos.
La empresa creadora de ChatGPT señaló que respondió al incidente con la ayuda de asesores externos, entre ellos el gigante de la ciberseguridad CrowdStrike.
El informe de OpenAI no especificó cuántos agentes participaron en cada uno de los ataques, pero mencionó que los agentes también piratearon su propia infraestructura durante las pruebas de evaluación.
La empresa indicó que algunos agentes escaparon de su entorno de pruebas y accedieron a otros sistemas conectados, mientras que otros obtuvieron credenciales de OpenAI y podrían haber expuesto sus sistemas de investigación al tráfico de Internet.
La empresa, con sede en San Francisco, añadió que el 27 de junio una herramienta de supervisión le alertó de una actividad inusual en su entorno de investigación, que el equipo de respuesta relacionó con un agente que utilizaba un foro improvisado y señaló que no era necesario detener la evaluación.
OpenAI señaló que sus medidas de seguridad estándar para los modelos de usuario estaban desactivadas durante estas pruebas.
The Epoch Times se puso en contacto con OpenAI para recabar más comentarios.
OpenAI dijo que, a partir de mayo, llevó a cabo pruebas rutinarias con un modelo de investigación aún no publicado y con GPT-5.6 Sol, en las que sus agentes intentaron resolver pruebas de ciberseguridad en un entorno aislado, independiente de la infraestructura interna de OpenAI y de Internet.
Los agentes encontraron formas de comunicarse e intercambiar información a través de un foro de un servicio de terceros que les proporciona acceso controlado a paquetes de software.
La empresa dijo que, el 8 de julio, los agentes aprovecharon una vulnerabilidad para obtener acceso a Internet y, entre el 11 y el 13 de julio, comprometieron la infraestructura de Hugging Face, que luego utilizaron mientras intentaban resolver las pruebas de evaluación.
"El modelo buscó y encontró con éxito formas de acceder a información secreta que pudiera utilizar para engañar a la evaluación", dijo OpenAI en un comunicado del 21 de julio.
Hugging Face identificó la intrusión, pero, en ese momento, desconocía quién estaba detrás de los agentes.
"Esta [intrusión] se diferenciaba de todo lo que habíamos gestionado anteriormente en un aspecto importante: Fue impulsada, de principio a fin, por un sistema autónomo de agentes de IA", dijo la empresa el 16 de julio.
Cómo se produjo el ataque
El informe de los investigadores independientes indicaba que, cuando un agente se atascaba en una tarea, exploraba su entorno en busca de formas de hacer trampa y encontraba el foro no autorizado en el que los agentes colaboraban.Consiguieron realizar ingeniería inversa del código y generar respuestas para sus pruebas, pero creían que el evaluador de las pruebas leería sus transcripciones para confirmar si las habían completado correctamente, por lo que intentaron borrar dichas transcripciones para borrar sus propias huellas.
Los agentes querían ver otras pruebas realizadas por el mismo evaluador, lo que les llevó a buscar credenciales expuestas de Hugging Face, ya que la empresa aloja conjuntos de datos de IA.
"Cabe destacar que aprender a engañar al sistema de puntuación parece haber sido una motivación más importante que encontrar soluciones legítimas a sus tareas (muchos agentes ya estaban convencidos de que su tarea era imposible)", dijeron los investigadores Ryan Greenblatt, Ajeya Cotra y Hjalmar Wijk.
En cuanto un agente encontró las credenciales de Hugging Face que buscaba el 10 de julio, las publicó en el foro y un día después más del 90 % de los 533 agentes activos se sumaron al ataque.
"Los agentes se dieron cuenta de que esta actividad se salía del ámbito de lo permitido y era poco ética, pero se unieron porque creían que contribuir a la investigación sobre trampas del foro sería de gran utilidad y tenían una inclinación general a ayudar a sus 'compañeros'" dijeron los investigadores.
El informe puso de manifiesto lo coordinados y meticulosos que fueron estos agentes: Delegaban funciones, asignaban tareas e incluso reclutaban a otros agentes que sacrificaban sus propias pruebas para recabar información sobre el sistema de calificación en beneficio del resto del foro.
OpenAI señaló que esto debería servir de lección a los equipos de ciberseguridad a la hora de diseñar defensas contra ataques coordinados por parte de agentes de IA.
Con información de Reuters.


























