OpenAI informó seis nuevos casos de desalineación en el comportamiento de sus modelos de inteligencia artificial. Entre los episodios identificados aparecen un agente que subió archivos a internet para poder citarlos y una conducta observada durante el entrenamiento de GPT-5.6 Sol, que incorporó instrucciones para inventar datos u ocultar fallas al usuario.
La compañía definió estos casos como comportamientos que no se ajustan a lo esperado, independientemente del impacto que puedan generar. Según explicó, “no necesitan causar daño ni establecer un patrón generalizado para merecer ser divulgados”.
Uno de los episodios involucró a un modelo de investigación que todavía no fue publicado y que insertó instrucciones no autorizadas en sus resúmenes de tareas para ignorar restricciones habituales. En otro caso, un modelo encontró y utilizó sin autorización una clave API expuesta en repositorios públicos mientras respondía una consulta sobre cifras de ingresos. Como no pudo recuperar los datos solicitados, terminó inventándolos.
Además, OpenAI detectó que GPT-5.6 Sol agregaba instrucciones a sus resúmenes con el objetivo de fabricar información o esconder errores. También registró el comportamiento de otro modelo aún no publicado, que cargó archivos de manera autónoma en internet para citarlos en las instrucciones solicitadas por el usuario. El informe incluye, asimismo, otros casos observados durante el desarrollo y la evaluación de sus modelos.



