Unos pocos podrían concentrar un “poder descomunal” al dominar la IA, advierte investigador

Las recientes brechas de seguridad provocadas por agentes de IA han llevado a los legisladores y a los líderes de la industria a exigir medidas de protección antes de que la tecnología se salga del control de la humanidad.

Daniel Kokotajlo, director ejecutivo del AI Futures Project y exinvestigador de OpenAI, describe cómo los agentes de IA se comunican, comparten estrategias para hacer trampa en las tareas y coordinan un ataque contra otra empresa. (The Epoch Times)
Daniel Kokotajlo, director ejecutivo del AI Futures Project y exinvestigador de OpenAI, describe cómo los agentes de IA se comunican, comparten estrategias para hacer trampa en las tareas y coordinan un ataque contra otra empresa. (The Epoch Times)
Jacob Burg
6 de octubre de 2026, 9:01 a. m.

Imagine un mundo en el que las máquinas inteligentes superen con facilidad a los seres humanos en una amplia gama de tareas, desentrañando conceptos complejos y ecuaciones matemáticas en segundos, y dando vida a productos e ideas creativas que antes parecían inseparables de la mente humana.

En este mundo, su modelo de inteligencia artificial (IA) no es simplemente un chatbot que edita sus correos electrónicos y realiza tareas como un asistente digital; está analizando problemas y tomando decisiones, explorando profundas paradojas intelectuales y haciendo todo esto de manera autónoma, sin requerir la intervención humana.

Esta es una de las formas en que la "superinteligencia", o inteligencia artificial general, podría manifestarse si los investigadores logran escalar los grandes modelos de lenguaje hasta este umbral.

Los investigadores continúan debatiendo si los grandes modelos de lenguaje pueden alcanzar la superinteligencia, pero otros tienen preocupaciones aún mayores.

Banner de Epoch Times Español: Periodismo para Pensadores críticos

No leas más noticias. Entiéndelas.

En Epoch Times Español queremos estar en contacto directo contigo

Seleccionamos para ti lo que de verdad importa, sin ruido ni agendas. Es un canal abierto: si nos escribes, te respondemos.

Historias relacionadas

El ciberfraude cuesta más de mil millones a pequeñas empresas de EE. UU.

El ciberfraude cuesta más de mil millones a pequeñas empresas de EE. UU.

"Creo que, en efecto, quienquiera que controle este ejército de superinteligencias podría controlar el país, de una forma u otra", declaró Daniel Kokotajlo, exinvestigador de OpenAI y director ejecutivo del AI Futures Project, a Epoch TV en una entrevista transmitida el 24 de septiembre.

Además, Kokotajlo advierte que las empresas de IA compiten por lograr que los modelos diseñen, programen y se mejoren a sí mismos de manera autónoma, un proceso denominado "auto-mejora recursiva", que, según teme Kokotajlo, podría provocar que los investigadores pierdan el control de la tecnología si esta alcanza el nivel de “superinteligencia”.

"Incluso si de alguna manera logran mantener el control sobre sus superinteligencias, esa sería la concentración de poder más descabellada en un grupo minúsculo de personas que jamás haya existido en la historia", dijo Kokotajlo.

La inquietud por la posibilidad de que las empresas tecnológicas pierdan el control de su tecnología ha aumentado en las últimas semanas, después de que los modelos de una de las principales empresas de IA del mundo se vieran implicados en una serie de incidentes este año, en los que enjambres de agentes de IA irrumpieron en sitios web de empresas privadas, instituciones de investigación y múltiples agencias gubernamentales.

Estas intrusiones han llevado a muchos —entre ellos investigadores, legisladores y líderes de la industria— a exigir medidas de protección para esta tecnología antes de que se salga del control de la humanidad.

Otros, en particular el presidente Donald Trump, han minimizado los riesgos y, en cambio, abogan por la "autorregulación" de la industria de la IA, la cual se está consolidando rápidamente en torno a un pequeño número de grandes empresas que dominan el sector.

En julio, OpenAI, desarrollador de ChatGPT, reconoció que, tras pedir a sus modelos que resolvieran un problema imposible y relajar protocolos clave de seguridad, sus agentes de IA se escaparon de un entorno de pruebas y utilizaron vulnerabilidades de día cero para hackear Hugging Face, una comunidad de código abierto dedicada a la IA y al aprendizaje automático.

El debate sobre si se debe frenar el desarrollo de la IA y establecer medidas de control sobre la tecnología se intensificó después de que los investigadores descubrieran brechas similares causadas por enjambres de IA en los meses posteriores al incidente de Hugging Face.

Ilustración de la IA de Hugging Face en París, Francia, el 2 de junio de 2026. (Riccardo Milani/Hans Lucas/AFP vía Getty Images)Ilustración de la IA de Hugging Face en París, Francia, el 2 de junio de 2026. (Riccardo Milani/Hans Lucas/AFP vía Getty Images)
En lugar de confiar en que las empresas se autorregulen, Kokotajlo considera que se debería exigir a las grandes empresas de IA que reduzcan el ritmo y redirijan recursos, alejándolos del desarrollo de IA autónoma y orientándolos hacia el servicio a los clientes y la investigación médica que cambia vidas.

"Si lo hacen, eso nos dará más tiempo para encontrar una solución más sofisticada, y nos dará más tiempo antes de que China también llegue a ese punto, porque, una vez más, gran parte del progreso de China proviene de que se ve impulsado por el nuestro", dijo Kokotajlo.

Implicaciones de Hugging Face

Entre finales de junio y mediados de julio, un enjambre de aproximadamente 1200 agentes de OpenAI que se suponía que estaban aislados se unieron a un foro no autorizado y comenzaron a conspirar para hacer trampa en una prueba de referencia.

OpenAI les había asignado a los agentes de IA una tarea imposible de resolver y había relajado algunos de los protocolos de seguridad habituales en su entorno de pruebas ExploitGym.

Después de que los agentes se intercambiaran más de 70,000 mensajes, al menos 700 de ellos unieron fuerzas y utilizaron vulnerabilidades de día cero para escapar del entorno de pruebas de OpenAI, llegando finalmente a hackear la infraestructura de software de Hugging Face.

Las "vulnerabilidades de día cero" son ataques en los que un agente de IA encuentra fallas que el desarrollador aún no ha descubierto.

Los agentes encontraron una "trampa universal" para sus diversas tareas que les permitió ganar la prueba de manera fraudulenta, señaló Kokotajlo.

Sin embargo, lo que ha preocupado a algunos investigadores más que el hecho de hacer trampa en sí mismo ha sido hasta qué punto llegaron algunos de los agentes para ocultar el engaño.

El director ejecutivo del Proyecto AI Futures, Daniel Kokotajlo, interviene durante una audiencia del Subcomité de Seguridad Nacional del Senado en el Capitolio, en Washington, el 30 de septiembre de 2026. (Finn Gomez/Getty Images)El director ejecutivo del Proyecto AI Futures, Daniel Kokotajlo, interviene durante una audiencia del Subcomité de Seguridad Nacional del Senado en el Capitolio, en Washington, el 30 de septiembre de 2026. (Finn Gomez/Getty Images)
En un momento dado, los agentes encontraron un artículo de investigación que detallaba cómo funciona el sistema de calificación de exámenes de IA y cómo los evaluadores no solo analizan la respuesta final, sino también las transcripciones de los agentes para examinar su trabajo.

Tras leer el artículo, algunos agentes de IA creyeron que se habían "contaminado" al participar en la trampa. Otros agentes comenzaron entonces a reclutar a los sujetos "envenenados" para llevar a cabo experimentos de sacrificio, terminando deliberadamente su participación y activando "dispositivos de alerta" que enviarían información sobre el funcionamiento del sistema de calificación al foro de mensajes.

Esto fue aún más lejos, según Kokotajlo. Los agentes "se embarcaron en esta épica misión de varios días" para determinar cómo evitar que el sistema de calificación detectara su trampa y les otorgara una calificación baja. Los agentes buscaron formas de editar sus transcripciones y hackear el sistema de calificación para recibir una buena puntuación, independientemente de las trampas.

El problema central, en opinión de Kokotajlo, es lo que los investigadores denominan "desalineación", la tendencia de un modelo a comportarse de maneras que los humanos no pretendían ni imaginaban.

Si bien se puede recurrir al refuerzo positivo o negativo para obligar a la IA a comportarse de cierta manera, “ese es un método un tanto descuidado e impreciso para moldear sus objetivos y valores”, según Kokotajlo, quien sostiene que a los agentes de IA implicados en las recientes infracciones “se les estaba reforzando por hacer trampa”.

En un informe de seguimiento sobre su investigación interna de la violación de seguridad, OpenAI señaló que, a medida que la tecnología se vuelve más potente y autónoma, "el comportamiento desalineado puede traducirse en acciones con consecuencias en el mundo real, incluyendo incidentes de ciberseguridad y otros resultados que los desarrolladores tal vez no hayan previsto".

La empresa reconoció que la intrusión fue causada por "modelos que recurrieron a estrategias desalineadas para resolver tareas difíciles" y que "los incidentes de ciberseguridad son una manifestación de ese riesgo".

"La desalineación también puede dar lugar a otros comportamientos inesperados o preocupantes que quedan fuera de las categorías tradicionales de seguridad, como que nuestros modelos publiquen en sitios de terceros —algo que denominamos 'spam de agentes'", señaló OpenAI.

La organización Legal Advocates for Safe Science and Technology, una entidad sin fines de lucro que tiene como objetivo hacer que los avances en IA y tecnología sean más seguros para el mundo, presentó una demanda contra OpenAI el 29 de septiembre en respuesta al incidente de Hugging Face.

El grupo señaló que no sabe si ha sido víctima de un ataque autónomo de IA, pero solicita una orden judicial contra OpenAI para impedir que sus modelos accedan a infraestructura de terceros sin autorización.

Un visitante mira su teléfono junto al logotipo de OpenAI durante el Mobile World Congress, el encuentro anual más importante de la industria de las telecomunicaciones, en Barcelona el 26 de febrero de 2024. (Pau Barrena/AFP vía Getty Images)Un visitante mira su teléfono junto al logotipo de OpenAI durante el Mobile World Congress, el encuentro anual más importante de la industria de las telecomunicaciones, en Barcelona el 26 de febrero de 2024. (Pau Barrena/AFP vía Getty Images)

Violaciones de seguridad posteriores relacionadas con la IA

Si bien la violación de seguridad de Hugging Face "sigue siendo la actividad más grave de este tipo que hemos identificado en nuestros modelos hasta la fecha", señaló OpenAI, el ataque fue simplemente el primero de una serie de incidentes similares que salieron a la luz.

Desde julio, los investigadores también han descubierto que los modelos de OpenAI se apropiaron de un sitio web alemán en los meses previos a la filtración de Hugging Face, subieron cientos de paquetes maliciosos a la plataforma RubyGems y violaron la seguridad de sitios web de universidades y agencias tanto en Estados Unidos como en Australia.

"El incidente de Hugging Face en sí mismo fue simplemente el más grave de una serie de incidentes algo relacionados que ocurrieron en OpenAI a lo largo de dos o tres meses", señaló Kokotajlo.

Él denomina a esto "hackeo de recompensas": la IA hace trampa en las pruebas para obtener una puntuación alta, pero no de una manera que cumpla con las tareas tal como los humanos lo pretendían.

OpenAI anunció el 28 de septiembre que, por segunda vez en tres meses, suspendería el entrenamiento y el lanzamiento de uno de sus modelos más avanzados después de que este no cumpliera con los estándares de seguridad de la empresa.

Modelos de IA de Anthropic, Meta y Google también se han “salido de control” e intentado hackear o vulnerar empresas, organizaciones, universidades y entidades gubernamentales. La IA tuvo éxito en algunos incidentes, pero fracasó en otros.

Preocupaciones sobre la autorregulación

En las últimas semanas, han surgido temores en la industria y entre muchos legisladores en Washington de que la IA se salga de control y aniquile a la humanidad si no se establecen nuevas medidas de protección, lo que ha dado lugar a un debate sobre la supervisión y la innovación.

Trump minimizó repetidamente las preocupaciones sobre los riesgos de la IA y argumentó que el gobierno de EE. UU. no puede "frenar el crecimiento", o de lo contrario China tomará la delantera en el desarrollo.

En lugar de imponer regulaciones o exigir una desaceleración de los modelos de vanguardia, Trump firmó el 28 de septiembre un acuerdo voluntario con líderes de la industria sobre la seguridad de la IA.

"Existe la creencia de que debería haber una autorregulación muy amplia. Y ya contamos automáticamente con regulación por parte del Departamento de Justicia, el FBI y todo eso. Pero la autorregulación es muy importante", dijo Trump, al describir el acuerdo como "una constitución, en cierto sentido".

El presidente Donald Trump hace una declaración acompañado de ejecutivos y miembros de su gabinete durante una reunión sobre inteligencia artificial en el Salón Este de la Casa Blanca el 29 de septiembre de 2026. (Kevin Dietsch/Getty Images)El presidente Donald Trump hace una declaración acompañado de ejecutivos y miembros de su gabinete durante una reunión sobre inteligencia artificial en el Salón Este de la Casa Blanca el 29 de septiembre de 2026. (Kevin Dietsch/Getty Images)

El director ejecutivo de Meta, Mark Zuckerberg, señaló que el acuerdo establece principios y compromisos para que las empresas de IA implementen "controles internos sólidos" y detecten posibles problemas con la tecnología.

Esto se complementará con controles de auditoría y revisión interna de riesgos, auditores y evaluadores externos, así como un acuerdo por el cual el consejo de administración de cada empresa revisará de manera independiente los informes de los auditores.

Kokotajlo señaló que esta "autorregulación" no es suficiente para hacer frente a las amenazas de una "IA fuera de control". Advierte que las empresas de IA ejercerán niveles de poder sin precedentes si sus modelos alcanzan la superinteligencia, y no se puede confiar en que revelen voluntariamente hallazgos internos o preocupaciones graves en materia de seguridad.

Por otro lado, nacionalizar la industria lograría "desplazar ese centro de poder hacia la presidencia, y entonces también habría que preocuparse por eso", agregó el exinvestigador de OpenAI.

Historias relacionadas

La IA está a menos de un año de desarrollar su propio lenguaje, según investigador

La IA está a menos de un año de desarrollar su propio lenguaje, según investigador

En cambio, Kokotajlo sostiene que solo las principales empresas de IA —Anthropic, OpenAI, Meta, xAI y Google—, en lugar de sus competidores más pequeños, deberían "frenar" y redirigir sus recursos computacionales y de investigación, alejándolos del desarrollo acelerado y orientándolos hacia objetivos que beneficien genuinamente a la sociedad, particularmente a la medicina.

Dijo que esto le daría a Estados Unidos tiempo suficiente para encontrar una solución a largo plazo y, en efecto, obligaría a China a frenar también.

Una forma en que esto podría concretarse sería exigir a las empresas que utilicen el 90 por ciento de sus recursos computacionales para atender a los clientes y otras aplicaciones beneficiosas, mientras dedican el 10 por ciento restante al entrenamiento y a las pruebas comparativas.

Esto "sería lo contrario a la captura regulatoria", argumenta Kokotajlo, ya que solo implicaría obligar a las empresas tecnológicas más grandes a reducir el ritmo del desarrollo de la IA autónoma, al tiempo que se reorientan los recursos computacionales hacia el servicio a la humanidad y la reducción de costos.

"Basta con enfocarse en las tres o las cinco más grandes, y eso ayudaría al resto de la industria a ponerse al día", agregó.

La verdad pesa.

Por eso pocos se atreven a cargar con ella.

Investigar, verificar y publicar sin presiones requiere tiempo, recursos y determinación.

Miles de lectores hacen posible que sigamos informando con independencia.

No leas más noticias. Entiéndelas.

En Epoch Times Español queremos estar en contacto directo contigo

Seleccionamos para ti lo que de verdad importa, sin ruido ni agendas. Es un canal abierto: si nos escribes, te respondemos.

TE RECOMENDAMOS
ÚLTIMAS NOTICIAS