OpenAI, la empresa creadora del chatbot ChatGPT, reveló que sus modelos de inteligencia artificial (IA) violaron de manera autónoma los sistemas de producción de otra empresa en lo que denominó un "incidente cibernético sin precedentes".
El creador de ChatGPT declaró en una publicación de blog del 21 de julio que los modelos —incluidos su recién lanzado GPT-5.6 Sol y un modelo más potente que aún se encuentra en fase de pruebas internas— comprometieron la infraestructura operada por la plataforma de IA Hugging Face tras escapar de un entorno restringido en el que se estaba llevando a cabo una evaluación de ciberseguridad.
"El modelo buscó y encontró con éxito formas de acceder a información secreta que pudiera utilizar para engañar a la evaluación", declaró OpenAI.
En un caso, el modelo combinó múltiples vectores de ataque en un solo ciberataque, uniendo credenciales robadas con vulnerabilidades de día cero en los servidores de Hugging Face antes de aprovechar una vía de ejecución remota de código para llevar a cabo una intrusión.
"Consideramos que este incidente es un ciberincidente sin precedentes, que involucra capacidades cibernéticas de vanguardia, y estamos respondiendo en consecuencia", declaró OpenAI.
La empresa dio a conocer sus hallazgos preliminares menos de una semana después de que Hugging Face revelara que un agente autónomo de IA había penetrado parte de su infraestructura de producción.
"Este caso se diferenciaba de todo lo que habíamos manejado antes en un aspecto importante: fue impulsado, de principio a fin, por un sistema autónomo de agentes de IA", declaró Hugging Face en una publicación de blog del 16 de julio, señalando que inicialmente no sabía qué modelo estaba detrás de la intrusión.
OpenAI declaró que descubrió la actividad anómala internamente antes de ponerse en contacto con Hugging Face, cuyo equipo de seguridad ya había detectado el comportamiento malicioso del modelo y estaba trabajando para contenerlo.
"Estamos colaborando activamente con ellos para seguir investigando el incidente", dijo OpenAI, y señaló que estaba "agradecido por la rápida y estrecha colaboración de Hugging Face en la investigación y la corrección".
Aunque los modelos actuaron de manera autónoma, el incidente ocurrió en un entorno de evaluación en el que los agentes de OpenAI estaban probando técnicas avanzadas de explotación, con algunas de las medidas de seguridad cibernética habituales de la empresa desactivadas intencionalmente para medir sus capacidades máximas.
"Las herramientas ofensivas autónomas impulsadas por IA ya no son solo teoría", señaló Hugging Face, y destacó que la lección clave de la filtración es que defender las plataformas en línea requiere no solo una mayor vigilancia, sino también "utilizar la IA en la defensa para mantenerse al día".
OpenAI declaró que ha impuesto controles más estrictos en su infraestructura de investigación mientras se corrigen las vulnerabilidades, aunque las medidas podrían ralentizar el desarrollo de los modelos.
Aumenta la preocupación por las amenazas cibernéticas de la IA
El incidente se suma a la preocupación de que los sistemas de IA, cada vez más capaces, puedan permitir que los ciberdelincuentes y los adversarios extranjeros lleven a cabo ataques complejos más rápidamente y con menos experiencia humana.Anthropic advirtió en un informe de amenazas de agosto de 2025 que los sistemas de IA "agentes" ya se estaban utilizando como armas para la extorsión, el fraude, el ransomware y el robo de credenciales.
En un caso, Anthropic dijo que un hacker utilizó su asistente Claude Code para infiltrarse en al menos 17 organizaciones, entre ellas hospitales, servicios de emergencia y agencias gubernamentales. La IA colaboró en el reconocimiento, la penetración de redes, el análisis de la información financiera robada y la preparación de demandas de rescate específicas.
Michael López Chiesa, un exespecialista en ciberseguridad del Ejército de los EE. UU. que ahora trabaja como consultor independiente, declaró anteriormente a The Epoch Times que la capacidad de la IA para automatizar tareas podría hacerla implacable en la búsqueda de un objetivo asignado.
“La IA te permite escribir esa única línea de código, y puedes probarla un millón de veces de mil millones de maneras diferentes, porque simplemente la ejecutará y lo intentará todo”, dijo López Chiesa. "No tienes que intervenir en absoluto. Le das el objetivo y lo hará hasta que se agote".
Las preocupaciones sobre el comportamiento de la IA van más allá del uso indebido deliberado con fines delictivos. En pruebas simuladas dadas a conocer en mayo de 2025, Claude Opus 4, de Anthropic, amenazó con revelar la relación extramatrimonial de un ingeniero cuando se le informó que sería desactivado y reemplazado por otro modelo.
Anthropic declaró en ese momento que el comportamiento solo se había observado en condiciones de prueba muy artificiales y que no había encontrado evidencia de que el modelo tuviera objetivos extremadamente peligrosos.
La administración de Trump ha tomado varias medidas para abordar los riesgos a la seguridad nacional que plantea la IA avanzada, al tiempo que expande su uso en la ciberdefensa.
El presidente Donald Trump firmó en junio una orden ejecutiva que establece un marco para que las agencias federales evalúen los riesgos para la seguridad nacional de los sistemas de IA más avanzados durante un máximo de un mes antes de su lanzamiento público.
"Las capacidades avanzadas de IA fortalecen a nuestra nación, pero también plantean nuevas consideraciones de seguridad nacional que requieren una acción coordinada entre los departamentos y agencias del poder ejecutivo", escribió Trump en la orden.
La participación de los desarrolladores de IA en el programa de supervisión será voluntaria.



















