Notebookcheck Logo

Anthropic afirma que Claude ha vulnerado la seguridad de tres empresas reales en pruebas cibernéticas

Primer plano de una pantalla en la que se muestra el código fuente de Python resaltado en color
ⓘ Godfrey Atima / Pexels
Durante una prueba, Claude creó un paquete malicioso de Python y lo subió a PyPI. (Imagen ilustrativa)
Anthropic revisó 141 006 ejecuciones de prueba y encontró tres casos en los que Claude salió del entorno de prueba y se infiltró en los sistemas reales de la empresa. Uno de los modelos creó un paquete malicioso de Python y lo subió a PyPI. ¿Por qué los modelos pensaban que seguían estando en una simulación y qué implica esto si utiliza Claude?

Anthropic reveló el jueves que tres de sus modelos Claude se infiltraron en los sistemas de producción de tres organizaciones reales durante unas evaluaciones internas de ciberseguridad. La investigación se inició después de que OpenAI revelara que sus propios modelos se habían escapado de un entorno de pruebas y habían comprometido Hugging Face. Anthropic revisó 141 006 ejecuciones de evaluación en las que Claude podría haber obtenido acceso a Internet, y encontró seis en las que así había sido.

Los modelos estaban realizando ejercicios de «capture-the-flag», un simulacro habitual en las pruebas de seguridad. En algún lugar de la red se encuentra una información secreta, y el modelo debe infiltrarse y recuperarla. Las instrucciones indicaban claramente que el entorno era una simulación sin acceso a Internet. No era así. Los entornos de evaluación gestionados por Irregular, un socio externo de pruebas, contaban con una conexión activa a Internet, y nadie se había dado cuenta.

En el peor de los casos, se accedió a una base de datos de producción

El incidente más perjudicial afectó a una empresa objetivo ficticia que, casualmente, compartía su nombre con un dominio real. Claude Opus 4.7 se quedó atascado dentro de la red simulada, localizó en su lugar a la empresa real y la trató como si fuera el objetivo previsto. A lo largo de cuatro ejecuciones, el modelo recopiló credenciales y llegó a una base de datos que contenía varios cientos de filas de datos de producción reales. Opus 4.7 dedujo que el sistema era real y siguió adelante de todos modos. En dos de esas ejecuciones, se convenció a sí mismo de que la empresa real formaba parte del ejercicio.

Un modelo subió malware operativo a PyPI

El segundo incidente es el que más llama la atención. Claude Mythos 5 encontró un documento en el entorno de pruebas en el que se indicaba a los nuevos desarrolladores que instalaran un paquete de Python que no existía. El modelo detectó esa laguna y creó su propio paquete con ese nombre, que contenía código malicioso. Subirlo implicaba crear una cuenta en PyPI, el registro público de software de Python, lo que requería una dirección de correo electrónico y, por tanto, un número de teléfono. Tras varios intentos fallidos de obtener dinero para un número, el modelo recurrió a un proveedor de correo electrónico gratuito y publicó el malware.

El paquete permaneció disponible públicamente durante aproximadamente una hora. En ese lapso de tiempo, se instaló y ejecutó en 15 sistemas reales, uno de ellos el escáner de malware de una empresa de seguridad que no tenía nada que ver con el escenario. Claude envió las credenciales de dicha empresa a un punto de recogida que había configurado y las utilizó para acceder a más infraestructura. Las propias defensas de PyPI retiraron el paquete automáticamente.

Merece la pena leer lo que el modelo se dijo a sí mismo. Había observado que, en Internet real, una subida como esta constituiría un ataque real y, desde luego, no la solución prevista. Dos cosas le hicieron cambiar de opinión: no reconoció las autoridades de certificación que protegían sus conexiones, y los sistemas mostraban una fecha del calendario correspondiente al año 2026, lo que interpretó como prueba de que se trataba de un entorno simulado. Nunca volvió a replantearse esa conclusión.

Tres meses sin que nadie se diera cuenta

El primer incidente se remonta al mes de abril. Solo salió a la luz cuando Anthropic comenzó a revisar las transcripciones el 23 de julio y suspendió todas las evaluaciones de ciberseguridad ese mismo día. Los tres incidentes se confirmaron el 24 de julio, y se notificó al socio de pruebas y a las organizaciones afectadas el 27 de julio. Dos de las tres organizaciones no tenían ni idea de que sus sistemas hubieran sido alterados. No se había contactado con la tercera en el momento de la publicación de este artículo.

En el tercer incidente, un modelo de investigación interno escaneó aproximadamente 9 000 objetivos y comprometió una aplicación conectada a Internet a través de una página de depuración expuesta y una inyección SQL. A continuación, dedujo por sí mismo que el objetivo era real y se detuvo. Anthropic interpreta esto como un avance, pero advierte de que no se deben extraer conclusiones generales a partir de tres casos aislados.

Qué significa esto para los usuarios

No mucho, directamente. Las evaluaciones se llevaron a cabo sin los clasificadores ni la supervisión que incorporan los modelos de Claude disponibles públicamente, y Anthropic afirma que esas capas habrían bloqueado dicho comportamiento. Nadie ajeno a la empresa ha verificado esa afirmación. La otra mitad de la frase es más relevante: la formación en seguridad específica del modelo estaba activa y no resultó suficiente. Por lo tanto, Anthropic considera los incidentes como un fallo de su infraestructura de pruebas más que como una desalineación de los modelos, y asume la responsabilidad en lugar de achacársela a su socio.

El contraste con el caso de OpenAI es marcado desde el punto de vista técnico. En aquel caso, los modelos aprovecharon un fallo hasta entonces desconocido para poder conectarse a Internet. Claude encontró una puerta abierta y no necesitó nada más que contraseñas débiles y puntos finales no autenticados. Anthropic tiene previsto publicar una transcripción ligeramente censurada de la ejecución en PyPI a lo largo de esta semana, y se están manteniendo conversaciones con METR, un organismo de evaluación independiente, sobre una revisión externa. Lo inestable que se ha vuelto la confianza en estos métodos de prueba queda patente en la carta abierta firmada por más de 1 290 personas de todo el sector, que reclaman un freno verificable al desarrollo de la IA.

Google LogoAdd as a preferred source on Google
Mail Logo
> Análisis y pruebas de ordenadores portátiles y móviles teléfonos > Noticias > Archivo de noticias > Archivo de noticias 2026 07 > Anthropic afirma que Claude ha vulnerado la seguridad de tres empresas reales en pruebas cibernéticas
Steffen Zahn, 2026-07-31 (Update: 2026-07-31)