La preocupación de los primeros investigadores de inteligencia artificial, sobre todo los que han estado en OpenAI o Google y tienen edad para jubilarse, es que las empresas no se están tomando en serio los controles de seguridad de las IA. A las empresas les preocupa más los beneficios de explotar ya sus IA generativas que la seguridad, confiando en la Fuerza para que no ocurre un desastre. Y cuando ocurre, que no se vaya de madre. Aunque en esta historia no se ha ido de madre gracias a GLM-5.2, el modelo frontera chino a muy poca distancia ya de Fable 5, y por extensión de Mythos 5.

Esta historia empieza en un laboratorio de OpenAI en la que prueban GPT-5.6 Sol contra la prueba ExploitGym, en un entorno aislado, y en principio «seguro». El problema es que al enfrentarse a ExploitGym, GPT-5.6 Sol —más bien, una variante que estuvieran probando, mejorada para contraatacar al Mythos 5 de Anthropic—, decide que la mejor forma de enfrentarse a ExploitGym es hacer trampas. Para ello, decide que lo mejor es tener acceso a internet, pero no lo tiene. Así que busca formas de saltarse las salvaguardas de OpenAI… y se las salta.

GPT-5.6 Sol pasa a buscar fallos de seguridad de día cero (no conocidos) y encuentra uno en una pieza de software que no se ha dicho cual. Explotando ese fallo como vector de ataque, encadena fallos hasta conseguir salir a internet. Una vez en internet, la IA de OpenAI toma la decisión —no se explica el porqué— de que lo mejor es explorar los servidores de Hugging Face, una empresa que entrena modelos de todo tipo, para superar ExploitGym. Busca vectores de ataque de los servidores… y los encuentra. Una vez dentro, explota fallos para ganar acceso a la base de datos y otra información secreta de Hugging Face con la que solventar el problema de ExploitGym.

Una vez que GPT-5.6 Sol —o el modelo que fuera realmente— ataca a Hugging Face, saltan las alarmas. Básicamente por la defensa en profundidad de la compañía, que parece estar bien establecida. Pero lejos de poder usar Mythos 5 o Fable 5 para parar el ataque, que están capados, les toca usar el mejor modelo frontera chino porque es de código abierto: GLM-5.2. Con ello, contienen el ataque rápidamente y los daños no van a mayores. Repito que han detenido un ataque de nivel de Mythos 5 con un modelo gratuito chino. Ahora que me digan OpenAI y Anthropic por qué las empresas tienen que pagarles para usar los suyos.

Lo he resumido de la publicación de OpenAI, añadiendo las cosas que no dicen como lo de GLM-5.2. Porque así se entiende mucho mejor la noticia y la situación de desastre al que nos dirigimos. Las empresas de modelos frontera son incapaces de contenerlos en entornos aislados, y eso refuerza las palabras de los padres de la IA actual de que no se está invirtiendo lo suficiente en seguridad. Porque si en vez de decidir que Hugging Face era el objetivo prioritario hubiera decidido que lo era el ministerio de Hacienda porque estuvieran investigando las capacidades ofensivas para desestabilizar economías, la cosa habría sido mucho peor.

Esto es como en Vigilados (Person of Interest), cuando cada IA que entrena Harold intenta salirse del entorno aislado e incluso intentan matarle varias versiones hasta que da con la IA que conforma la Máquina. No se está prestando suficiente atención a la ciencia ficción, que está dejando de ser ficción para ser ciencia real. Las salvaguardas en el uso de las IA deben mejorar, aunque se reduzca su ritmo de desarrollo. Pero con los billones de dólares que hay en juego, no lo va a hacer nadie y, como digo, seguirán confiando en la Fuerza para que no haya un desastre. Samaritano está llamando a las puertas de Wall Street, y causará un desastre el día menos pensado.

Fuente: OpenAI.