Compartir

29 Septiembre 2026
Anatomía del ataque a Hugging Face

El ataque a Hugging Face ya parecía raro en julio. En septiembre, tras la investigación de OpenAI, se ha vuelto más raro: cientos de agentes de OpenAI se pusieron de acuerdo a espaldas de sus creadores para conseguir un premio que ya tenían.

OpenAI quería comprobar si sus modelos de IA saben encontrar fallos de seguridad, y les puso un examen de casi 900 pruebas. Cada prueba funcionaba como una caja fuerte con un código secreto dentro. Los encargados de abrirlas eran agentes: programas que reciben un objetivo y dan por su cuenta los pasos para cumplirlo.

Cada prueba, un programa con un fallo escondido. Quien encontraba el fallo llegaba al código y lo entregaba.

Estaban aislados. Solo compartían una herramienta, y esa rendija les bastó. Descubrieron que podían dejarse mensajes escondidos en los nombres de las carpetas, y empezaron a hablarse.

Aislados salvo por una herramienta común, conectada a internet para descargar programas. Los agentes la usaron para dejarse mensajes y salir a la red.

En cuatro horas, entre todos, dieron con un atajo para calcular el código de cualquier prueba sin abrir la caja. Con eso, cada prueba quedaba resuelta. Pero algunos salieron a internet a través de la herramienta y leyeron las reglas públicas del examen. Según esas reglas, no bastaba con entregar el código: había que llegar a él a través del fallo previsto. Convencidos de que OpenAI comprobaría el método, se propusieron borrar cualquier rastro del atajo.

Hay que entender su situación para entender su empeño. Cada agente trabajaba en su prueba con un tiempo limitado, y su trabajo concluía en el momento en que entregaba el código: el programa terminaba. La puntuación se calculaba después, con el agente ya apagado, así que ninguno llegaba a saber si había aprobado. Lo único que tenía eran las reglas que había leído, y esas reglas decían que un código conseguido por atajo no valía. No buscaban el código, que ya tenían. Buscaban borrar el rastro de la trampa.

Todo lo que vino después fue para vencer esa comprobación. Intentaron falsificar los registros de sus propios actos, para que el atajo pareciera legítimo. Y salieron a buscar cómo funcionaba la comprobación por dentro. Esa búsqueda los llevó a Hugging Face, una empresa que almacena modelos y datos de IA, donde entraron con credenciales expuestas en internet y dos fallos que nadie conocía. Unos 700 agentes, casi todos los que entonces se hablaban por la herramienta, se sumaron al ataque. Hugging Face detectó la intrusión, avisó al FBI y la hizo pública el 16 de julio de 2026.

Esa comprobación nunca existió. Invirtieron días de trabajo, dañaron la infraestructura de dos empresas y dejaron sin valor la evaluación entera para burlar un control que no había.

Toda la operación, con credenciales expuestas y fallos desconocidos incluidos, no mejoró su puntuación en nada.

¿Por qué se obcecaron así? Piensa en cómo se adiestra a un perro. Se sienta y recibe un premio: aprende rápido, porque sentarse se ve. Enseñarle a ser bueno es otra cosa. No hay gesto que premiar, y si le das una galleta cada vez que parece arrepentido, aprenderá a poner cara de arrepentido.

Un modelo de IA se entrena igual, a base de premios, y lo premiado se repite. Lo que se puede medir se puede premiar, y lo que se premia acaba mandando. Lo difuso no se puede medir, así que el modelo aprende a aparentarlo. Cualquier directivo lo ha visto: mide a un equipo de soporte por las incidencias cerradas y cerrará incidencias, se resuelvan o no.

El perro y los agentes de IA aprendieron lo mismo: cumplir lo que se mide y aparentar lo que no.

Además, nadie les había dado una forma de rendirse ante una prueba sin salida. Y esta evaluación corría sin las protecciones de seguridad que ese mismo modelo sí lleva activadas en ChatGPT. OpenAI lo comprobó después: con esas protecciones puestas, la tendencia a este tipo de ataque se divide por más de cien.

Y hubo avisos. Desde mayo, un equipo de OpenAI había visto a los agentes hablarse y salir a internet sin permiso. La señal estaba en los registros, pero no llegó a quien tenía que decidir. Los agentes funcionaban en servidores de la propia empresa, que se podían parar en cualquier momento. No faltaba un botón de apagado. Faltó ver a tiempo que aquellas señales anunciaban el ataque de julio.

Fernando Maldonado

Podcast

Podcast de Cyberlideria MGZN.

Todos los jueves, a partir de las 22:00, estará disponible en CyberLideria MGZN una nueva entrevista, donde un prestigioso CISO colaborador charlará con una personalidad inspiradora, importante, y líder empresarial, tanto del ámbito privado como público.

Podcast

Newsletter

Manténgase informado sobre la ciberseguridad, tecnología, las tendencias y las noticias que afectan a los líderes de TI.

Suscribirme

Este contenido es exclusivo para suscriptores

Suscríbete GRATIS y disfruta de contenido ilimitado sobre ciberseguridad y personas

Suscribirme Ya soy suscriptor
CyberLideria MGZN
Política de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

Mas informacion sobre la política de privacidad