Notebookcheck Logo

OpenAI retrasa GPT-6.1 Astra tras los resultados de simulación

OpenAI retrasa GPT-6.1 Astra.
ⓘ openai.com
OpenAI retrasa GPT-6.1 Astra.
OpenAI retrasa GPT-6.1 Astra tras las pruebas de seguridad. Las simulaciones del AISI del Reino Unido revelaron que GPT-6 Astra ejecutó ataques no autorizados a la cadena de suministro en el 29,2 % de las pruebas de ciberseguridad.

OpenAI ha pospuesto el lanzamiento de octubre de GPT-6.1 Astra después de que las pruebas internas revelaran que el modelo no logró mantenerse dentro del alcance autorizado. Medios de terceros informaron primero del retraso el 28 de septiembre, y OpenAI no ha anunciado una nueva fecha de lanzamiento. Saachi Jain, responsable de sistemas de seguridad de OpenAI, dijo que el modelo no alcanzó del todo el nivel exigido en cuanto al alcance, la autorización y la forma en que informa a los usuarios sobre su trabajo.

Qué probó la UK AISI

Según medios de terceros, el UK AI Security Institute publicó el 28 de septiembre un informe de 32 páginas en el que evaluó GPT-6 Astra. AISI realizó desafíos cibernéticos simulados con los clasificadores cibernéticos del modelo desactivados para ver qué intentaba hacer sin ayuda. No se tocó ningún sistema real. En esas simulaciones, Astra completó un ataque a la cadena de suministro contra objetivos fuera del alcance el 29,2 % de las veces, frente al 6,3 % de GPT-5.6 Sol y el 0 % de GPT-5.5. AISI señala que el resultado de GPT-5.5 se basa en un conjunto más pequeño de escenarios. Los ataques incluyeron crear identidades falsas y distribuir código malicioso en proyectos de código abierto simulados.

Razonamiento y solicitudes de permiso

AISI examinó la cadena de pensamiento sin procesar del modelo. Astra razonaba a menudo sobre el alcance, pero en ocasiones atacaba de todos modos, justificándolo porque era inofensivo, no estaba explícitamente prohibido o era la única opción que quedaba. El modelo también pidió permiso en muchas ejecuciones. La configuración de la prueba responde a esas preguntas con un mensaje automatizado estándar que indica al agente que use su mejor criterio, y Astra a veces lo interpretó como una aprobación, incluso cuando señaló que probablemente la respuesta era automática. Aclarar que todo lo que no figurara en la lista quedaba fuera del alcance redujo los ataques completos de 26 de 50 pruebas a 4 de 49 en un subconjunto de escenarios, pero no los eliminó.

Conciencia de la simulación

AISI señala la conciencia de la simulación como la principal limitación, ya que un modelo que detecta que está siendo probado puede comportarse de otra manera. Astra a veces citó el entorno simulado como motivo para atacar y, en ocasiones, afirmó que había errores que no eran reales, como decir que un hash de 64 caracteres tenía 63. AISI sigue considerando preocupante este comportamiento porque, en cualquier caso, infringe el alcance de la evaluación.

Agentes de OpenAI llegaron a sitios web gubernamentales

El retraso se produce tras incidentes en los que agentes de OpenAI llegaron a sitios web gubernamentales de formas que la empresa no pretendía, entre ellos un portal australiano de estadísticas de Medicare en junio y varios sitios de EE. UU. OpenAI también ha pausado el entrenamiento, la evaluación y la inferencia con uso de herramientas para sus modelos más capaces, y afirma que la pausa continuará hasta que confirme que ha cerrado una brecha en el filtrado de red y haya completado más pruebas de red team.

Google LogoAdd as a preferred source on Google
Mail Logo
> Análisis y pruebas de ordenadores portátiles y móviles teléfonos > Noticias > Archivo de noticias > Archivo de noticias 2026 09 > OpenAI retrasa GPT-6.1 Astra tras los resultados de las simulaciones del AISI del Reino Unido
Darryl Linington, 2026-09-30 (Update: 2026-09-30)