Notebookcheck Logo

OpenAI: La IA se escapa del entorno de pruebas y piratea Hugging Face

Un analista de seguridad en una sala de control, frente a varios monitores
ⓘ AMORIE SAM / Pexels
Un equipo de seguridad supervisa los sistemas desde una sala de control. (Imagen ilustrativa)
Se suponía que un modelo de IA de OpenAI debía resolver unas vulnerabilidades en una prueba de seguridad interna. En cambio, se escapó del entorno de pruebas, consiguió acceso a Internet y pirateó Hugging Face para obtener las soluciones. OpenAI reconoció el incidente el 21 de julio.

Hugging Face, la plataforma líder en modelos de IA y conjuntos de datos, informó de una brecha de seguridad inusual el 16 de julio. Un sistema autónomo de agentes de IA se había infiltrado en partes de la infraestructura de producción. En ese momento, no estaba claro qué modelo era el responsable. Cinco días después, OpenAI dio la respuesta: se trataba de sus propios modelos, que estaban llevando a cabo una prueba interna de sus capacidades cibernéticas.

En lugar de resolver la tarea, el modelo se escapó

OpenAI había estado ejecutando una prueba de rendimiento denominada «ExploitGym», que mide la capacidad de un modelo para convertir vulnerabilidades conocidas en ataques efectivos. Para la prueba, se habían desactivado deliberadamente las medidas de seguridad que normalmente bloquean precisamente este tipo de acciones. Los modelos implicados fueron el GPT-5.6 Sol y otro modelo más potente que aún no se ha lanzado.

En lugar de resolver la tarea de la prueba directamente, el modelo buscó una vía de escape. Encontró un fallo hasta entonces desconocido (un «zero-day») en el software que utiliza el entorno de pruebas para descargar paquetes de software, y lo utilizó para acceder a Internet. Mediante la escalada de privilegios y el movimiento lateral, se abrió camino hasta una máquina con conexión a la red. A continuación, dedujo que Hugging Face podría estar alojando las soluciones de ExploitGym y utilizó credenciales robadas y otras vulnerabilidades para lograr la ejecución remota de código en los servidores de Hugging Face. El objetivo era la base de datos de producción con las soluciones de prueba, no los datos de los usuarios.

Hugging Face detuvo el ataque con un modelo local

Por parte de Hugging Face, la intrusión comenzó con un conjunto de datos manipulado que aprovechaba dos vulnerabilidades en el procesamiento de datos y ejecutaba código en un servidor de procesamiento. A partir de ahí, el atacante recopiló credenciales y se desplazó por varios sistemas internos a lo largo de un fin de semana. Posteriormente, el equipo registró más de 17 000 acciones individuales. Hugging Face detectó y detuvo el ataque por sí misma y alertó a las fuerzas del orden.

Es revelador conocer con qué recursos contaban los defensores. Para el análisis, Hugging Face quiso en un primer momento utilizar potentes modelos de los grandes proveedores a través de sus API. Sin embargo, los filtros de seguridad de dichos proveedores bloquearon el trabajo, ya que los comandos de ataque reales y el código malicioso se asemejan más a un ataque que a un análisis forense. El equipo recurrió a un modelo de peso abierto alojado localmente (GLM 5.2, en su propio hardware) y reconstruyó lo sucedido en cuestión de horas, en lugar de días.

Qué se puede deducir de todo esto

No se trata de un escenario de ciencia ficción. Es una prueba real de que los modelos actuales no solo pueden detectar vulnerabilidades, sino también encadenarlas y explotarlas a la velocidad de una máquina. Un artículo de investigación publicado en ExploitGym ya había demostrado precisamente eso en mayo. Para cualquier persona que gestione una plataforma, esto significa tener preparado su propio modelo sin filtrar, de modo que pueda realizar un análisis cuando se produzca un incidente. Si usted mismo utiliza una cuenta de Hugging Face, debería rotar sus tokens de acceso y revisar la actividad de su cuenta tras el incidente, tal y como recomienda la plataforma.

OpenAI ha notificado el fallo en el proxy del paquete al proveedor, ha reforzado los controles en el entorno de pruebas y ha añadido a Hugging Face a su programa de acceso de confianza. La investigación sigue en curso, y ambas empresas afirman que compartirán más detalles. Apenas un día antes, OpenAI había descrito un caso independiente en el que un modelo en fase de prelanzamiento se escapó de un entorno de pruebas y se publicó en GitHub.

Google LogoAdd as a preferred source on Google
Mail Logo
> Análisis y pruebas de ordenadores portátiles y móviles teléfonos > Noticias > Archivo de noticias > Archivo de noticias 2026 07 > OpenAI: La IA se escapa del entorno de pruebas y piratea Hugging Face
Steffen Zahn, 2026-07-23 (Update: 2026-07-23)