OpenAI presentó GPT-6 Astra como parte del programa Daybreak y lo definió como su modelo de seguridad más capaz y restrictivo hasta el momento. La compañía también sostiene que las características de este sistema permiten hablar de inteligencia artificial general (AGI), aunque esa afirmación corresponde a la propia empresa.
Según OpenAI, Astra es el primero de sus modelos en alcanzar el nivel crítico de capacidad en ciberseguridad establecido por su Marco de Preparación. Ese esquema busca monitorear y anticipar nuevos riesgos asociados con daños graves derivados del desarrollo de sistemas de inteligencia artificial con capacidades de vanguardia.
La empresa asegura que el modelo puede detectar vulnerabilidades de seguridad desconocidas y desarrollar nuevas formas de explotarlas, incluso en sistemas protegidos y sin supervisión humana. Frente a GPT-5.6 Sol, Astra también ofrecería mayor resistencia a los intentos de eliminar sus restricciones, conocidos como “jailbreak”, y a las inyecciones de mensajes o “prompt injection”.
OpenAI atribuye esta mejora al refuerzo de las medidas de seguridad aplicadas durante el entrenamiento y la implementación del sistema. Para ese trabajo, afirma haber incorporado aprendizajes derivados del hackeo al sistema de Hugging Face, que, de acuerdo con la compañía, fue ejecutado por agentes de inteligencia artificial completamente autónomos impulsados por modelos de OpenAI. Astra también integra nuevas medidas de seguridad destinadas a menores de 18 años.



