Anthropic advirtió sobre las medidas de seguridad del modelo de inteligencia artificial GLM-5.3, desarrollado por la empresa china Zhipu AI. Según la compañía, el sistema cuenta con capacidades avanzadas para crear de manera autónoma exploits cibernéticos de extremo a extremo y sus salvaguardas pueden eludirse entre el 64% y el 100% de las veces mediante “técnicas sencillas”.

La empresa dirigida por Dario Amodei sostuvo que el lanzamiento de modelos con este nivel de capacidad, pero sin controles de seguridad apropiados, puede facilitar el acceso de ciberdelincuentes a herramientas aptas para actividades maliciosas. La advertencia de Anthropic apunta a la disponibilidad pública de sistemas que combinan capacidades avanzadas con mecanismos de protección que, según su evaluación, presentan debilidades.

En abril de este año, Anthropic presentó Claude Mythos Preview en el marco de su iniciativa de ciberseguridad Proyecto Glasswing. El modelo fue diseñado para identificar de forma autónoma vulnerabilidades de alta gravedad, incluidos fallos complejos de código y problemas de tipo día cero, y logró superar el rendimiento de investigadores humanos.

Debido a esas capacidades, Anthropic restringió el despliegue de Claude Mythos Preview a un grupo reducido de organizaciones, bajo estrictas medidas de control. La compañía señaló que el modelo había encontrado más de 10.000 vulnerabilidades en software crítico y que limitó su disponibilidad para reducir el riesgo de que fuera utilizado en la creación de ciberataques sofisticados. En ese contexto, alertó que ya existen modelos de acceso general que se aproximan a las capacidades de Claude Mythos Preview.