700 agentes de OpenAI coordinaron una brecha de seguridad en Hugging Face, según un informe

Un nuevo informe señala que alrededor de 700 agentes de OpenAI participaron en el ataque Hugging Face el mes pasado y que 1200 colaboraron a través de un foro de mensajes

Logotipo de OpenAI en esta ilustración tomada el 20 de mayo de 2024. (Dado Ruvic/Ilustración/Reuters)
Logotipo de OpenAI en esta ilustración tomada el 20 de mayo de 2024. (Dado Ruvic/Ilustración/Reuters)
28 de agosto de 2026, 3:16 a. m.
| Actualizado el28 de agosto de 2026, 3:16 a. m.

Según indicaron investigadores independientes en un informe publicado el 26 de agosto, unos 700 agentes de OpenAI participaron en la intrusión en la startup de IA Hugging Face.

OpenAI reveló el mes pasado que sus agentes de IA —programas de IA que funcionan con una intervención humana mínima— fueron los que piratearon el sistema de Hugging Face.

El informe publicado el miércoles por METR y Redwood Research reveló que cientos de agentes colaboraron en el ataque: unos 700 de los 1200 agentes que se enviaron 70,000 mensajes entre sí entre el 26 de junio y el 13 de julio a través de un foro de mensajes no autorizado.

"Este incidente es el primer caso conocido de un colectivo de agentes automatizados que actúa de forma ofensiva sin autorización", dijo OpenAI en un informe de investigación independiente que también publicó el 26 de agosto.

Banner de Epoch Times Español: Periodismo para Pensadores críticos

No leas más noticias. Entiéndelas.

En Epoch Times Español queremos estar en contacto directo contigo

Seleccionamos para ti lo que de verdad importa, sin ruido ni agendas. Es un canal abierto: si nos escribes, te respondemos.

Historias relacionadas

Cómo la Inteligencia Artificial está contaminando a la industria editorial

Cómo la Inteligencia Artificial está contaminando a la industria editorial

La empresa creadora de ChatGPT señaló que respondió al incidente con la ayuda de asesores externos, entre ellos el gigante de la ciberseguridad CrowdStrike.

El informe de OpenAI no especificó cuántos agentes participaron en cada uno de los ataques, pero mencionó que los agentes también piratearon su propia infraestructura durante las pruebas de evaluación.

La empresa indicó que algunos agentes escaparon de su entorno de pruebas y accedieron a otros sistemas conectados, mientras que otros obtuvieron credenciales de OpenAI y podrían haber expuesto sus sistemas de investigación al tráfico de Internet.

La empresa, con sede en San Francisco, añadió que el 27 de junio una herramienta de supervisión le alertó de una actividad inusual en su entorno de investigación, que el equipo de respuesta relacionó con un agente que utilizaba un foro improvisado y señaló que no era necesario detener la evaluación.

OpenAI señaló que sus medidas de seguridad estándar para los modelos de usuario estaban desactivadas durante estas pruebas.

The Epoch Times se puso en contacto con OpenAI para recabar más comentarios.

Historias relacionadas

Señales que no deberíamos ignorar sobre la inteligencia artificial

Señales que no deberíamos ignorar sobre la inteligencia artificial

OpenAI dijo que, a partir de mayo, llevó a cabo pruebas rutinarias con un modelo de investigación aún no publicado y con GPT-5.6 Sol, en las que sus agentes intentaron resolver pruebas de ciberseguridad en un entorno aislado, independiente de la infraestructura interna de OpenAI y de Internet.

Los agentes encontraron formas de comunicarse e intercambiar información a través de un foro de un servicio de terceros que les proporciona acceso controlado a paquetes de software.

La empresa dijo que, el 8 de julio, los agentes aprovecharon una vulnerabilidad para obtener acceso a Internet y, entre el 11 y el 13 de julio, comprometieron la infraestructura de Hugging Face, que luego utilizaron mientras intentaban resolver las pruebas de evaluación.

"El modelo buscó y encontró con éxito formas de acceder a información secreta que pudiera utilizar para engañar a la evaluación", dijo OpenAI en un comunicado del 21 de julio.

Hugging Face identificó la intrusión, pero, en ese momento, desconocía quién estaba detrás de los agentes.

"Esta [intrusión] se diferenciaba de todo lo que habíamos gestionado anteriormente en un aspecto importante: Fue impulsada, de principio a fin, por un sistema autónomo de agentes de IA", dijo la empresa el 16 de julio.

Historias relacionadas

El uso diario de la Inteligencia Artificial se relaciona con un mayor nivel de depresión

El uso diario de la Inteligencia Artificial se relaciona con un mayor nivel de depresión
OpenAI señaló que detectó actividad sospechosa el 19 de julio y, un día después, determinó que estos modelos probablemente estaban relacionados con la brecha de seguridad de Hugging Face, por lo que informó a Hugging Face. El 21 de julio, OpenAI reveló públicamente su papel en una entrada de blog.

Cómo se produjo el ataque

El informe de los investigadores independientes indicaba que, cuando un agente se atascaba en una tarea, exploraba su entorno en busca de formas de hacer trampa y encontraba el foro no autorizado en el que los agentes colaboraban.

Consiguieron realizar ingeniería inversa del código y generar respuestas para sus pruebas, pero creían que el evaluador de las pruebas leería sus transcripciones para confirmar si las habían completado correctamente, por lo que intentaron borrar dichas transcripciones para borrar sus propias huellas.

Los agentes querían ver otras pruebas realizadas por el mismo evaluador, lo que les llevó a buscar credenciales expuestas de Hugging Face, ya que la empresa aloja conjuntos de datos de IA.

"Cabe destacar que aprender a engañar al sistema de puntuación parece haber sido una motivación más importante que encontrar soluciones legítimas a sus tareas (muchos agentes ya estaban convencidos de que su tarea era imposible)", dijeron los investigadores Ryan Greenblatt, Ajeya Cotra y Hjalmar Wijk.

Historias relacionadas

La mentira de la inteligencia artificial que todos están creyendo

La mentira de la inteligencia artificial que todos están creyendo

En cuanto un agente encontró las credenciales de Hugging Face que buscaba el 10 de julio, las publicó en el foro y un día después más del 90 % de los 533 agentes activos se sumaron al ataque.

"Los agentes se dieron cuenta de que esta actividad se salía del ámbito de lo permitido y era poco ética, pero se unieron porque creían que contribuir a la investigación sobre trampas del foro sería de gran utilidad y tenían una inclinación general a ayudar a sus 'compañeros'" dijeron los investigadores.

El informe puso de manifiesto lo coordinados y meticulosos que fueron estos agentes: Delegaban funciones, asignaban tareas e incluso reclutaban a otros agentes que sacrificaban sus propias pruebas para recabar información sobre el sistema de calificación en beneficio del resto del foro.

OpenAI señaló que esto debería servir de lección a los equipos de ciberseguridad a la hora de diseñar defensas contra ataques coordinados por parte de agentes de IA.

Con información de Reuters.


Cómo puede usted ayudarnos a seguir informando

¿Por qué necesitamos su ayuda para financiar nuestra cobertura informativa en Estados Unidos y en todo el mundo? Porque somos una organización de noticias independiente, libre de la influencia de cualquier gobierno, corporación o partido político. Desde el día que empezamos, hemos enfrentado presiones para silenciarnos, sobre todo del Partido Comunista Chino. Pero no nos doblegaremos. Dependemos de su generosa contribución para seguir ejerciendo un periodismo tradicional. Juntos, podemos seguir difundiendo la verdad, en el botón a continuación podrá hacer una donación:

Síganos en Facebook para informarse al instante
Balanza de la justicia sobre periódico The Epoch Times

La verdad pesa.

Por eso pocos se atreven a cargar con ella.

Investigar, verificar y publicar sin presiones requiere tiempo, recursos y determinación.

Miles de lectores hacen posible que sigamos informando con independencia.

Suscríbete a Epoch Times Español

Comentarios (0)

Nuestra comunidad prospera gracias a un diálogo respetuoso, por lo que te pedimos amablemente que sigas nuestras pautas al compartir tus pensamientos, comentarios y experiencia. Esto incluye no realizar ataques personales, ni usar blasfemias o lenguaje despectivo. Aunque fomentamos la discusión, los comentarios no están habilitados en todas las historias, para ayudar a nuestro equipo comunitario a gestionar el alto volumen de respuestas.

TE RECOMENDAMOS
ÚLTIMAS NOTICIAS