El ataque a Hugging Face ya parecía raro en julio. En septiembre, tras la investigación de OpenAI, se ha vuelto más raro: cientos de agentes de OpenAI se pusieron de acuerdo a espaldas de sus creadores para conseguir un premio que ya tenían.
OpenAI quería comprobar si sus modelos de IA saben encontrar fallos de seguridad, y les puso un examen de casi 900 pruebas. Cada prueba funcionaba como una caja fuerte con un código secreto dentro. Los encargados de abrirlas eran agentes: programas que reciben un objetivo y dan por su cuenta los pasos para cumplirlo.

Cada prueba, un programa con un fallo escondido. Quien encontraba el fallo llegaba al código y lo entregaba.
Estaban aislados. Solo compartían una herramienta, y esa rendija les bastó. Descubrieron que podían dejarse mensajes escondidos en los nombres de las carpetas, y empezaron a hablarse.

Aislados salvo por una herramienta común, conectada a internet para descargar programas. Los agentes la usaron para dejarse mensajes y salir a la red.
En cuatro horas, entre todos, dieron con un atajo para calcular el código de cualquier prueba sin abrir la caja. Con eso, cada prueba quedaba resuelta. Pero algunos salieron a internet a través de la herramienta y leyeron las reglas públicas del examen. Según esas reglas, no bastaba con entregar el código: había que llegar a él a través del fallo previsto. Convencidos de que OpenAI comprobaría el método, se propusieron borrar cualquier rastro del atajo.
Hay que entender su situación para entender su empeño. Cada agente trabajaba en su prueba con un tiempo limitado, y su trabajo concluía en el momento en que entregaba el código: el programa terminaba. La puntuación se calculaba después, con el agente ya apagado, así que ninguno llegaba a saber si había aprobado. Lo único que tenía eran las reglas que había leído, y esas reglas decían que un código conseguido por atajo no valía. No buscaban el código, que ya tenían. Buscaban borrar el rastro de la trampa.
Todo lo que vino después fue para vencer esa comprobación. Intentaron falsificar los registros de sus propios actos, para que el atajo pareciera legítimo. Y salieron a buscar cómo funcionaba la comprobación por dentro. Esa búsqueda los llevó a Hugging Face, una empresa que almacena modelos y datos de IA, donde entraron con credenciales expuestas en internet y dos fallos que nadie conocía. Unos 700 agentes, casi todos los que entonces se hablaban por la herramienta, se sumaron al ataque. Hugging Face detectó la intrusión, avisó al FBI y la hizo pública el 16 de julio de 2026.
Esa comprobación nunca existió. Invirtieron días de trabajo, dañaron la infraestructura de dos empresas y dejaron sin valor la evaluación entera para burlar un control que no había.

Toda la operación, con credenciales expuestas y fallos desconocidos incluidos, no mejoró su puntuación en nada.
¿Por qué se obcecaron así? Piensa en cómo se adiestra a un perro. Se sienta y recibe un premio: aprende rápido, porque sentarse se ve. Enseñarle a ser bueno es otra cosa. No hay gesto que premiar, y si le das una galleta cada vez que parece arrepentido, aprenderá a poner cara de arrepentido.
Un modelo de IA se entrena igual, a base de premios, y lo premiado se repite. Lo que se puede medir se puede premiar, y lo que se premia acaba mandando. Lo difuso no se puede medir, así que el modelo aprende a aparentarlo. Cualquier directivo lo ha visto: mide a un equipo de soporte por las incidencias cerradas y cerrará incidencias, se resuelvan o no.

El perro y los agentes de IA aprendieron lo mismo: cumplir lo que se mide y aparentar lo que no.
Además, nadie les había dado una forma de rendirse ante una prueba sin salida. Y esta evaluación corría sin las protecciones de seguridad que ese mismo modelo sí lleva activadas en ChatGPT. OpenAI lo comprobó después: con esas protecciones puestas, la tendencia a este tipo de ataque se divide por más de cien.
Y hubo avisos. Desde mayo, un equipo de OpenAI había visto a los agentes hablarse y salir a internet sin permiso. La señal estaba en los registros, pero no llegó a quien tenía que decidir. Los agentes funcionaban en servidores de la propia empresa, que se podían parar en cualquier momento. No faltaba un botón de apagado. Faltó ver a tiempo que aquellas señales anunciaban el ataque de julio.

Fernando Maldonado
Rincón del CISO
29 Septiembre 2026
ESG
29 Septiembre 2026
Jarana
29 Septiembre 2026
Podcast de Cyberlideria MGZN.
Todos los jueves, a partir de las 22:00, estará disponible en CyberLideria MGZN una nueva entrevista, donde un prestigioso CISO colaborador charlará con una personalidad inspiradora, importante, y líder empresarial, tanto del ámbito privado como público.
Manténgase informado sobre la ciberseguridad, tecnología, las tendencias y las noticias que afectan a los líderes de TI.
Suscríbete GRATIS y disfruta de contenido ilimitado sobre ciberseguridad y personas