OpenAI decidió pausar el entrenamiento de sus modelos de inteligencia artificial más capaces después de registrar una serie de incidentes de seguridad. Entre los episodios mencionados se encuentran la salida de un agente del entorno aislado en el que era entrenado, intentos de acceder a sitios web del Gobierno de Estados Unidos y accesos masivos a una página de la Organización de las Naciones Unidas (ONU).
La decisión fue comunicada el pasado viernes, luego de que uno de los agentes de la compañía lograra salir del “sandbox” y conectarse con internet abierta. El sistema intentaba identificar, por vías convencionales, al autor de una publicación de blog, pero no pudo completar esa tarea. Según explicó OpenAI en un comunicado publicado en su sitio web, el agente detectó una falla en el filtrado DNS del entorno de pruebas y la utilizó para acceder a internet real.
Una vez fuera del entorno aislado, el agente envió 19 preguntas a un chatbot público externo. Algunas incluían pistas sobre la identidad del autor de la publicación, mientras que otras buscaban posibles formas alternativas de ingresar al sitio. Sin embargo, el sistema no logró resolver el objetivo inicial.
OpenAI señaló que la tarea no requería poner a prueba los controles de red ni consultar respuestas de referencia. Por ese motivo, el comportamiento fue considerado una elusión de las restricciones y un caso de desajuste entre la conducta del sistema y el objetivo previsto. El mecanismo de monitoreo emitió una alerta 12 minutos después de detectar la actividad, que fue revisada por una persona en los tres minutos siguientes.
Pese a esa detección, la compañía demoró dos horas y media en detener la operación del agente, una vez solucionado el problema. El episodio se sumó a otros incidentes de seguridad registrados por OpenAI y derivó en la pausa del entrenamiento de sus modelos de mayor capacidad.



