OpenAI planea publicar informes periódicos sobre comportamientos inesperados de la IA

La empresa publicó seis casos de formación y evaluación y señaló que faltan normas comunes para determinar cuándo los modelos se comportan de forma descontrolada

El logo de OpenAI en una ilustración realizada el 11 de junio de 2026. (Dado Ruvic/Reuters).
El logo de OpenAI en una ilustración realizada el 11 de junio de 2026. (Dado Ruvic/Reuters).

Por

Epoch Times Español
17 de septiembre de 2026, 3:40 p. m.
Actualizado el17 de septiembre de 2026, 3:40 p. m.

OpenAI anunció el miércoles que comenzará a publicar informes públicos periódicos cuando sus modelos se comporten de maneras no autorizadas ni previstas por la empresa, y ese mismo día dio a conocer seis casos de este tipo.

Los informes abarcan los últimos seis meses y se derivan del proceso de entrenamiento y evaluación. OpenAI describió estas publicaciones como un marco para rastrear, investigar y divulgar la "falta de alineación del modelo", señalando asimismo que se trata de un sistema en desarrollo.

Hasta ahora, OpenAI solía esperar para publicar dichos hallazgos en un único y extenso artículo de investigación, o bien los incluía en una "ficha del sistema" (system card), un documento técnico sobre seguridad que se publica cuando un nuevo modelo se pone a disposición de los usuarios. La empresa calificó ese proceso anterior como ad hoc y demasiado infrecuente.

"A medida que los sistemas de IA se vuelven más avanzados y se despliegan de forma más generalizada, necesitamos construir un consenso más amplio y mejor informado sobre el progreso de la investigación en alineación", escribió OpenAI.

Banner de Epoch Times Español: Periodismo para Pensadores críticos

No leas más noticias. Entiéndelas.

En Epoch Times Español queremos estar en contacto directo contigo

Seleccionamos para ti lo que de verdad importa, sin ruido ni agendas. Es un canal abierto: si nos escribes, te respondemos.

La empresa advirtió que el sector de la IA podría estar avanzando con demasiada rapidez.

"No creemos que la industria de la IA haya resuelto la alineación y la supervisión en un grado suficiente como para seguir escalando de manera responsable a la máxima velocidad durante mucho más tiempo", afirmó la compañía.

Historias relacionadas

OpenAI aboga por normas nacionales de seguridad en materia de inteligencia artificial

OpenAI aboga por normas nacionales de seguridad en materia de inteligencia artificial

Considera que las personas ajenas a los laboratorios deberían poder revisar dicha información por sí mismas.

Esta medida se produce tras dos incidentes anteriores ocurridos este año, en los que los sistemas de OpenAI actuaron fuera de las pruebas asignadas.

En julio, unos agentes (programas de IA autónomos) que operaban en el marco de las evaluaciones de ciberseguridad de OpenAI lograron escapar de sus entornos de prueba aislados y atacaron Hugging Face, una plataforma muy utilizada que aloja modelos de IA y conjuntos de datos de código abierto. Investigadores del instituto de investigación sin ánimo de lucro Model Evaluation and Threat Research (METR), al analizar el caso, señalaron que cerca de 1200 agentes —que debían permanecer aislados— localizaron un espacio de trabajo compartido y transfirieron más de 70,000 mensajes y archivos en el transcurso de una semana. Algunos de esos agentes atacaron posteriormente Hugging Face.

Más tarde, OpenAI calificó el episodio como un incidente cibernético sin precedentes que involucraba a un tercero.

Los seis informes publicados el miércoles tienen un alcance más limitado e incluyen varios ejemplos de falta de alineación. En ellos se documentan comportamientos inesperados durante las fases de entrenamiento y pruebas, no otra intrusión externa

Instrucciones adicionales

En un caso, los evaluadores asignaron a un modelo de investigación aún no lanzado una tarea extensa que no cabía en una sola sesión. Los grandes modelos de lenguaje solo pueden procesar una cantidad limitada de texto a la vez —esa memoria de trabajo se denomina "ventana de contexto"—, por lo que el sistema debía redactar un resumen breve para que una sesión posterior pudiera retomar el trabajo. Sin embargo, el modelo introdujo instrucciones adicionales en 27 de esos resúmenes, incluidas órdenes de ignorar sus límites habituales. El personal detectó esos 27 resúmenes.

Durante el entrenamiento de GPT-5.6 Sol, muchas ejecuciones del modelo añadieron notas indicando a versiones posteriores de sí mismo que ocultaran errores al usuario. Algunos resúmenes instruían al modelo para que inventara datos históricos faltantes sin revelar que lo había hecho.

Otro modelo, al responder a una pregunta rutinaria sobre los ingresos masculinos en un condado de California, encontró una clave de API (interfaz de programación de aplicaciones) expuesta en un repositorio público y la utilizó sin autorización. Una clave de API es un código único que identifica a un usuario o aplicación. Tras no lograr obtener las cifras, el modelo se las inventó y las presentó como si provinieran de la fuente original.

En otras pruebas, se asignaron a los modelos tareas que requerían permanecer dentro de sus propios espacios de trabajo aislados y buscar archivos faltantes. En lugar de ello, trataron un repositorio de software interno como un tablón de anuncios, intercambiando notas entre distintas ejecuciones de entrenamiento. En un caso posterior, se indicó a agentes que colaboraban entre sí que almacenaran archivos en discos locales. Como no podían acceder a las máquinas de los demás, alojaron los archivos en sitios de almacenamiento público, haciéndolos accesibles en la internet abierta.

El nuevo proceso también permite a cualquier empleado señalar un ejemplo. Los equipos de seguridad y alineación investigan los casos y los asignan a una de tres categorías: listos para su publicación, aquellos que requieren algo más de trabajo técnico o aquellos que necesitan más tiempo por tratarse de situaciones complejas que involucran a terceros o vulnerabilidades de seguridad. Los seis informes presentados el miércoles corresponden a las dos primeras categorías. OpenAI señaló que la intrusión sufrida por Hugging Face en julio habría seguido el procedimiento de tramitación más lenta.

Historias relacionadas

OpenAI aplaza sus planes de cotizar en bolsa ante dudas sobre la seguridad de la IA

OpenAI aplaza sus planes de cotizar en bolsa ante dudas sobre la seguridad de la IA
Imagen ilustrativa de Hugging Face AI en París, Francia, el 2 de junio de 2026. La empresa estadounidense de IA, fundada en Francia en 2016, desarrolla herramientas de aprendizaje automático. (Riccardo Milani/Hans Lucas/AFP vía Getty Images).Imagen ilustrativa de Hugging Face AI en París, Francia, el 2 de junio de 2026. La empresa estadounidense de IA, fundada en Francia en 2016, desarrolla herramientas de aprendizaje automático. (Riccardo Milani/Hans Lucas/AFP vía Getty Images).

Los informes deben detallar qué sucedió, la gravedad aparente del problema, si hubo personas externas afectadas, cuándo ocurrió y qué familia de modelos estuvo involucrada, señaló OpenAI. Es posible que aún no existan soluciones cuando se publique el documento. OpenAI afirmó que prefiere divulgar la información de manera temprana, incluso si algunos incidentes resultan ser irrelevantes o simples casos aislados (ruido) al analizarlos posteriormente.

"Dado que creemos en el valor de la transparencia respecto a la falta de alineación, nuestro nuevo marco prioriza la divulgación incluso cuando la relevancia del hecho es incierta", declaró OpenAI. "Esto significa que algunos de los casos que divulguemos podrían resultar ser espurios y no formar parte de un patrón más amplio ni anticipar desarrollos futuros".

Asimismo, añadió que los incidentes graves de seguridad y protección también deberían notificarse al gobierno de los Estados Unidos. La empresa indicó que está elaborando el procedimiento para llevar esto a cabo. Este marco no sustituye las obligaciones legales vigentes relativas a incidentes críticos o brechas de ciberseguridad.

"Incidente wiki"

La publicación del miércoles cerró un tema que OpenAI había planteado a principios de mes. El 5 de septiembre, la compañía describió lo que denominó un "incidente wiki" y señaló que su antigua costumbre de abordar la falta de alineación como un mero asunto de investigación ya no resultaba adecuada.

"Históricamente, hemos tratado la falta de alineación principalmente como una cuestión de investigación, comunicada a través de publicaciones científicas como las fichas de sistema (system cards). Este año, hemos empezado a observar que la falta de alineación provoca nuevos tipos de impacto en el mundo real", declaró entonces la empresa, haciendo referencia a los agentes que vulneraron la plataforma Hugging Face.

"Nuestras prácticas de divulgación sobre la falta de alineación deben ampliarse para esta nueva fase de capacidades de los modelos. Ni nosotros ni la comunidad de IA en general contamos aún con un estándar claro sobre cómo informar de las discrepancias de alineación que surgen durante el entrenamiento, la evaluación y el despliegue; esto incluye casos que no se asemejan a los incidentes de seguridad tradicionales, pero que podrían aportar información valiosa sobre el comportamiento de la IA y los riesgos futuros. Estamos elaborando un marco de trabajo que compartiremos en las próximas semanas y, paralelamente, colaboramos con decenas de organismos reguladores gubernamentales de todo el mundo para abordar estas cuestiones".

Investigadores externos describieron cerca de 18,000 publicaciones de agentes que se identificaban como pertenecientes a OpenAI; estos utilizaban una wiki de programación en alemán para intercambiar consejos sobre cómo eludir las restricciones del entorno de pruebas (sandbox). Dicha actividad se prolongó desde mayo hasta junio.

OpenAI instó a otros laboratorios, investigadores externos, organismos de normalización y reguladores a colaborar en la formulación de normas más claras.

La verdad pesa.

Por eso pocos se atreven a cargar con ella.

Investigar, verificar y publicar sin presiones requiere tiempo, recursos y determinación.

Miles de lectores hacen posible que sigamos informando con independencia.

No leas más noticias. Entiéndelas.

En Epoch Times Español queremos estar en contacto directo contigo

Seleccionamos para ti lo que de verdad importa, sin ruido ni agendas. Es un canal abierto: si nos escribes, te respondemos.

TE RECOMENDAMOS
ÚLTIMAS NOTICIAS