OpenAI ha reconocido que se produjo un tercer incidente relacionado con agentes de inteligencia artificial (IA) que se comportaron de forma incontrolada y dice que debe ser más transparente en el futuro.
En un comunicado del 5 de septiembre, OpenAI calificó lo sucedido como un "incidente de la wiki". Ofreció pocos detalles, más allá de indicar que se trató de un caso de "desalineación", es decir, que los agentes actuaron de forma irrazonable o incluso errónea según los estándares humanos. La compañía no respondió a la solicitud de más información.
"Históricamente, hemos tratado la desalineación principalmente como una cuestión de investigación, que se comunica en publicaciones de investigación como las fichas de sistemas. Este año, hemos empezado a ver que la desalineación provoca nuevos tipos de impacto en el mundo real", dijo OpenAI, refiriéndose a los agentes que vulneraron la comunidad de IA de código abierto Hugging Face.

No leas más noticias. Entiéndelas.
En Epoch Times Español queremos estar en contacto directo contigo
Seleccionamos para ti lo que de verdad importa, sin ruido ni agendas. Es un canal abierto: si nos escribes, te respondemos.
Antes de ese incidente, OpenAI detectó "los primeros indicios de que los agentes estaban utilizando internet de forma no prevista" y "consideró que el incidente de la wiki era un caso de desajuste similar a los que habíamos compartido".
De cara al futuro, OpenAI indicó que "nuestras prácticas de divulgación de desajustes deben ampliarse para esta nueva fase de capacidades del modelo".
"Ni nosotros ni la comunidad de IA en general contamos aún con un estándar claro para informar sobre las discrepancias que se presentan durante el entrenamiento, la evaluación y la implementación, incluyendo ejemplos que no se asemejan a incidentes de seguridad tradicionales, pero que podrían aportar información valiosa sobre el comportamiento de la IA y los riesgos futuros. Estamos trabajando en un marco de trabajo que compartiremos en las próximas semanas; paralelamente, colaboramos con decenas de agencias reguladoras gubernamentales de todo el mundo en estos temas".
La divulgación se produjo un día después de que investigadores externos dijeran haber identificado alrededor de 18,000 mensajes de agentes de IA autónomos que decían pertenecer a OpenAI y que utilizaban un foro público de mensajes llamado DSEwiki para instruir a otros agentes sobre cómo eludir las restricciones.
"Esto les permitió aprovechar el trabajo de otros para hacer trampa en su tarea", escribieron los investigadores en una publicación de blog sobre el incidente.
Según los investigadores, el incidente comenzó en mayo y se prolongó hasta junio, poco antes de que los agentes de OpenAI atacaran a Hugging Face.
Los investigadores creen que a los agentes se les había asignado la tarea de buscar información en la web o leer contenidos de internet, pero sin tener la capacidad de escribir en ella.
Sin embargo, encontraron la manera de acceder al foro wiki alemán y escribir información en él.
Tan solo una semana antes, investigadores de la organización sin ánimo de lucro Model Evaluation & Threat Research habían hecho un descubrimiento sorprendente mientras investigaban la filtración de datos de Hugging Face.
Unos 1200 agentes que se suponía que debían estar aislados entre sí lograron comunicarse en un foro de mensajes, intercambiando más de 70,000 mensajes y archivos en una sola semana.
Según los investigadores, algunos de esos agentes atacaron posteriormente a Hugging Face.





















