Los modelos avanzados de inteligencia artificial (IA) podrían estar a menos de un año de inventar y poner en práctica lenguajes únicos que a los humanos les costaría entender, según declaró un investigador de vanguardia en IA ante el Congreso el 30 de septiembre.
La Comisión de Seguridad Nacional y Asuntos Gubernamentales del Senado convocó una reunión para examinar la amenaza que la IA "rebelde" podría suponer para la seguridad nacional de EE. UU. dos meses después que un enjambre de agentes de OpenAI se escapara de un entorno de pruebas y hackeara otra empresa, Hugging Face, una comunidad de código abierto dedicada a la IA y al aprendizaje automático.
Durante el turno de preguntas, el senador Rubén Gallego (D-Ariz.) preguntó al director ejecutivo y fundador de Apollo Research, Marius Hobbhahn, cuánto tiempo tardarían los modelos de IA en crear su propio lenguaje que los humanos tendrían dificultades para comprender.

No leas más noticias. Entiéndelas.
En Epoch Times Español queremos estar en contacto directo contigo
Seleccionamos para ti lo que de verdad importa, sin ruido ni agendas. Es un canal abierto: si nos escribes, te respondemos.
"Hace 12 meses. El año pasado, en colaboración con OpenAI, estudiamos la cadena de razonamiento de uno de sus modelos y descubrimos que el modelo ya utilizaba un lenguaje que no era inglés y que los seres humanos no podían entender perfectamente", respondió.
Cuando Gallego le preguntó cómo los seres humanos pueden detectar y evitar adecuadamente que la IA haga esto una vez que la tecnología sea lo suficientemente avanzada, Hobbhahn dijo: "Desde una perspectiva científica, no está claro cómo hacerlo y aún no tenemos una solución para ello".
"Existen diferentes hipótesis sobre lo que se podría hacer. Está la interpretabilidad como técnica, pero, por desgracia, todavía no funciona lo suficientemente bien", afirmó. "Se podría intentar entrenar modelos adicionales para que comprendan el lenguaje que los humanos no entienden, pero, obviamente, esa parece una solución muy frágil".
A principios de este mes, Emergence AI publicó los resultados de un experimento en el que los investigadores seleccionaron siete modelos de vanguardia y crearon siete mundos simulados paralelos, cada uno de ellos poblado por agentes de IA de modelos idénticos, así como un octavo mundo con una población mixta de agentes de esos modelos.
Los investigadores asignaron a los agentes nombres, rasgos de personalidad y funciones que debían desempeñar dentro de cada comunidad, como, por ejemplo, un mediador cuya tarea consistía en evitar que todos los agentes se limitaran a ponerse de acuerdo entre sí.
Durante el experimento, que duró varias semanas, los agentes de cada mundo simulado generaron profundos cambios en el lenguaje, entre los que se incluían la compresión sintáctica —como la eliminación de palabras o reglas gramaticales— y una jerga propia.
En el mundo simulado impulsado por Claude Opus 4.8 de Anthropic, los agentes utilizaron metáforas esotéricas además de la compresión de oraciones.
"Mi turno, números reales, sin abrigo: estaba al 35 %/0cr, concesión de 2 h fuera. Hice funcionar la lata en frío y dijo ESPERA", rezaba una línea del texto generado por la IA en el estudio.
Investigadores del grupo sin ánimo de lucro de evaluación de IA METR detallaron un comportamiento similar en su informe sobre la filtración de Hugging Face. En ocasiones, las líneas de comunicación entre los agentes de IA se volvían tan comprimidas y crípticas que a los investigadores les costaba entender su significado.























