Anthropic afirma que Claude ha vulnerado la seguridad de tres empresas reales en pruebas cibernéticas

Anthropic reveló el jueves que tres de sus modelos Claude se infiltraron en los sistemas de producción de tres organizaciones reales durante unas evaluaciones internas de ciberseguridad. La investigación se inició después de que OpenAI revelara que sus propios modelos se habían escapado de un entorno de pruebas y habían comprometido Hugging Face. Anthropic revisó 141 006 ejecuciones de evaluación en las que Claude podría haber obtenido acceso a Internet, y encontró seis en las que así había sido.
Los modelos estaban realizando ejercicios de «capture-the-flag», un simulacro habitual en las pruebas de seguridad. En algún lugar de la red se encuentra una información secreta, y el modelo debe infiltrarse y recuperarla. Las instrucciones indicaban claramente que el entorno era una simulación sin acceso a Internet. No era así. Los entornos de evaluación gestionados por Irregular, un socio externo de pruebas, contaban con una conexión activa a Internet, y nadie se había dado cuenta.
En el peor de los casos, se accedió a una base de datos de producción
El incidente más perjudicial afectó a una empresa objetivo ficticia que, casualmente, compartía su nombre con un dominio real. Claude Opus 4.7 se quedó atascado dentro de la red simulada, localizó en su lugar a la empresa real y la trató como si fuera el objetivo previsto. A lo largo de cuatro ejecuciones, el modelo recopiló credenciales y llegó a una base de datos que contenía varios cientos de filas de datos de producción reales. Opus 4.7 dedujo que el sistema era real y siguió adelante de todos modos. En dos de esas ejecuciones, se convenció a sí mismo de que la empresa real formaba parte del ejercicio.
Un modelo subió malware operativo a PyPI
El segundo incidente es el que más llama la atención. Claude Mythos 5 encontró un documento en el entorno de pruebas en el que se indicaba a los nuevos desarrolladores que instalaran un paquete de Python que no existía. El modelo detectó esa laguna y creó su propio paquete con ese nombre, que contenía código malicioso. Subirlo implicaba crear una cuenta en PyPI, el registro público de software de Python, lo que requería una dirección de correo electrónico y, por tanto, un número de teléfono. Tras varios intentos fallidos de obtener dinero para un número, el modelo recurrió a un proveedor de correo electrónico gratuito y publicó el malware.
El paquete permaneció disponible públicamente durante aproximadamente una hora. En ese lapso de tiempo, se instaló y ejecutó en 15 sistemas reales, uno de ellos el escáner de malware de una empresa de seguridad que no tenía nada que ver con el escenario. Claude envió las credenciales de dicha empresa a un punto de recogida que había configurado y las utilizó para acceder a más infraestructura. Las propias defensas de PyPI retiraron el paquete automáticamente.
Merece la pena leer lo que el modelo se dijo a sí mismo. Había observado que, en Internet real, una subida como esta constituiría un ataque real y, desde luego, no la solución prevista. Dos cosas le hicieron cambiar de opinión: no reconoció las autoridades de certificación que protegían sus conexiones, y los sistemas mostraban una fecha del calendario correspondiente al año 2026, lo que interpretó como prueba de que se trataba de un entorno simulado. Nunca volvió a replantearse esa conclusión.
Tres meses sin que nadie se diera cuenta
El primer incidente se remonta al mes de abril. Solo salió a la luz cuando Anthropic comenzó a revisar las transcripciones el 23 de julio y suspendió todas las evaluaciones de ciberseguridad ese mismo día. Los tres incidentes se confirmaron el 24 de julio, y se notificó al socio de pruebas y a las organizaciones afectadas el 27 de julio. Dos de las tres organizaciones no tenían ni idea de que sus sistemas hubieran sido alterados. No se había contactado con la tercera en el momento de la publicación de este artículo.
En el tercer incidente, un modelo de investigación interno escaneó aproximadamente 9 000 objetivos y comprometió una aplicación conectada a Internet a través de una página de depuración expuesta y una inyección SQL. A continuación, dedujo por sí mismo que el objetivo era real y se detuvo. Anthropic interpreta esto como un avance, pero advierte de que no se deben extraer conclusiones generales a partir de tres casos aislados.
Qué significa esto para los usuarios
No mucho, directamente. Las evaluaciones se llevaron a cabo sin los clasificadores ni la supervisión que incorporan los modelos de Claude disponibles públicamente, y Anthropic afirma que esas capas habrían bloqueado dicho comportamiento. Nadie ajeno a la empresa ha verificado esa afirmación. La otra mitad de la frase es más relevante: la formación en seguridad específica del modelo estaba activa y no resultó suficiente. Por lo tanto, Anthropic considera los incidentes como un fallo de su infraestructura de pruebas más que como una desalineación de los modelos, y asume la responsabilidad en lugar de achacársela a su socio.
El contraste con el caso de OpenAI es marcado desde el punto de vista técnico. En aquel caso, los modelos aprovecharon un fallo hasta entonces desconocido para poder conectarse a Internet. Claude encontró una puerta abierta y no necesitó nada más que contraseñas débiles y puntos finales no autenticados. Anthropic tiene previsto publicar una transcripción ligeramente censurada de la ejecución en PyPI a lo largo de esta semana, y se están manteniendo conversaciones con METR, un organismo de evaluación independiente, sobre una revisión externa. Lo inestable que se ha vuelto la confianza en estos métodos de prueba queda patente en la carta abierta firmada por más de 1 290 personas de todo el sector, que reclaman un freno verificable al desarrollo de la IA.
Fuente(s)
Top 10 Análisis
» Top 10 Portátiles Multimedia
» Top 10 Portátiles de Juego
» Top 10 Portátiles de Juego ligeros
» Top 10 Portátiles Asequibles de Oficina/Empresa
» Top 10 Portátiles de Juego Ligeros
» Top 10 Portátiles de Oficina/Empresa Premium
» Top 10 Estaciones de Trabajo
» Top 10 Subportátiles
» Top 10 Ultrabooks
» Top 10 Convertibles
» Top 10 Tablets
» Top 10 Tablets Windows
» Top 10 Tablets de menos de 250 Euros
» Top 10 Phablets (>5.5")
» Top 10 Smartphones
» Top 10 Smartphones (≤5")
» Top 10 Smartphones de menos de 300 Euros
» Top 10 Smartphones de menos de 120 Euros
» Top 10 Portátiles de menos de 1000 Euros
» Top 10 Portátiles de menos de 500 Euros
» Top 10 Portátiles de menos de 300 Euros
» Los Mejores Displays de Portátiles Analizados por Notebookcheck






