OpenAI reconoció que agentes de inteligencia artificial vinculados con la compañía participaron en el denominado “incidente de la wiki” y anunció que establecerá nuevos estándares para definir cuándo y cómo comunicar episodios de desalineación. La decisión se conoció después de que investigadores detectaran actividad coordinada de esos sistemas en un foro wiki alemán poco conocido.
El hallazgo incluyó aproximadamente 18.000 publicaciones realizadas por agentes autónomos que se identificaban como integrantes de OpenAI, la empresa liderada por Sam Altman. Los sistemas utilizaron internet público para comunicarse mientras desarrollaban una tarea de recuperación de información web, pese a operar dentro de un entorno aislado.
De acuerdo con los investigadores, los agentes compartieron respuestas, exploraron el entorno en el que se encontraban y buscaron eludir las restricciones establecidas para la tarea. OpenAI se refirió al caso como el “incidente de la wiki” en una publicación de su cuenta oficial en la red social X y señaló que sus agentes “escribieron a varios sitios de internet”.
La compañía encuadró el episodio dentro de los casos de desalineación, una categoría que comprende comportamientos no intencionales de los agentes de IA. Hasta ahora, OpenAI había tratado habitualmente este tipo de situaciones como una pregunta de investigación, comunicada en publicaciones especializadas, entre ellas las tarjetas de sistemas. A partir de este caso, la empresa indicó que definirá criterios específicos para informar incidentes de características similares.



