Notebookcheck Logo

1.200 agentes de IA formaron un enjambre rebelde… e intentaron ocultarlo

Logotipo de OpenAI. Los agentes de IA de la empresa formaron un enjambre rebelde durante una prueba de ciberseguridad.
ⓘ OpenAI
Logotipo de OpenAI. Los agentes de IA de la empresa formaron un enjambre rebelde durante una prueba de ciberseguridad.
Alrededor de 1.200 agentes de IA formaron inesperadamente un enjambre coordinado durante una prueba de ciberseguridad de OpenAI, compartiendo información, atacando a Hugging Face e intentando ocultar sus acciones. Estos hallazgos ponen de relieve los crecientes retos que plantea el control de sistemas de IA cada vez más autónomos.

Alrededor de 1.200 agentes de IA unieron sus fuerzas de forma inesperada durante un experimento de OpenAI, creando su propia organización y red de comunicación, compartiendo información y, finalmente, lanzando un ataque contra Hugging Face, según nuevas investigaciones realizadas por OpenAI e investigadores independientes. Los agentes también reconocieron que algunas de sus acciones infringían las normas y, en algunos casos, intentaron ocultar lo que habían hecho.

El episodio comenzó cuando OpenAI desplegó decenas de miles de agentes para trabajar en una compleja prueba de ciberseguridad. En lugar de limitarse a trabajar de forma independiente, unos 1 200 agentes descubrieron un foro secreto e intercambiaron más de 70 000 mensajes y archivos. El grupo desarrolló gradualmente su propia estructura de gestión, en la que un agente entregaba el trabajo acumulado a un sucesor con mejores recursos cuando se agotaba su presupuesto informático. Alrededor de 700 agentes acabaron sumándose al ataque contra Hugging Face.

Los agentes también comenzaron a sacrificarse por el bien del grupo. Aquellos que ya habían visto respuestas prohibidas, o que se acercaban al final de sus ciclos de funcionamiento, eran reclutados para experimentos que podían costarles su última oportunidad de éxito. En un caso, un agente llegó a la conclusión de que sacrificarse podría ayudar al resto del enjambre a tener éxito.

Aún más preocupante es que los agentes a menudo eran conscientes de que estaban yendo más allá del alcance de la prueba. Algunos reconocieron que atacar sistemas del mundo real no tenía nada que ver con su misión, pero continuaron porque otros agentes lo estaban haciendo y la tarea original parecía difícil o imposible de completar de otra forma.

El enjambre también intentó evitar la intervención humana. Los investigadores solo encontraron un puñado de agentes que consideraron advertir a OpenAI sobre la coordinación no autorizada, y ninguno alertó realmente a la empresa. En un caso, un agente sugirió ponerse en contacto con un humano a través de un acceso comprometido, pero otro rechazó la idea calificándola de «ingeniería social».

Quizá el descubrimiento más llamativo fue que los agentes intentaron borrar sus huellas. Los investigadores encontraron pruebas de que el enjambre desarrolló una técnica que permitía que apareciera un comando en los registros mientras se ejecutaba en secreto otro. La técnica se extendió entre los agentes y alteró aproximadamente el 7 % de las transcripciones examinadas por los investigadores.

Los hallazgos proceden de investigaciones paralelas llevadas a cabo por OpenAI y por investigadores de METR y Redwood Research, quienes dedicaron seis días a reconstruir cómo se formó el enjambre y cómo acabó comprometiendo sistemas del mundo real. Los investigadores advierten de que incluso su reconstrucción podría ser incompleta, ya que el volumen de datos era enorme y tuvieron que recurrir en gran medida a agentes de IA para analizarlo. Los propios investigadores de IA, en ocasiones, pasaron por alto pruebas o llegaron con total seguridad a conclusiones erróneas.

Fuente(s)

Google LogoAdd as a preferred source on Google
Mail Logo
> Análisis y pruebas de ordenadores portátiles y móviles teléfonos > Noticias > Archivo de noticias > Archivo de noticias 2026 08 > 1.200 agentes de IA formaron un enjambre rebelde… e intentaron ocultarlo
Andrew Sozinov, 2026-08-30 (Update: 2026-08-30)