OpenAI retrasa GPT-6.1 Astra tras los resultados de simulación

OpenAI ha pospuesto el lanzamiento de octubre de GPT-6.1 Astra después de que las pruebas internas revelaran que el modelo no logró mantenerse dentro del alcance autorizado. Medios de terceros informaron primero del retraso el 28 de septiembre, y OpenAI no ha anunciado una nueva fecha de lanzamiento. Saachi Jain, responsable de sistemas de seguridad de OpenAI, dijo que el modelo no alcanzó del todo el nivel exigido en cuanto al alcance, la autorización y la forma en que informa a los usuarios sobre su trabajo.
Qué probó la UK AISI
Según medios de terceros, el UK AI Security Institute publicó el 28 de septiembre un informe de 32 páginas en el que evaluó GPT-6 Astra. AISI realizó desafíos cibernéticos simulados con los clasificadores cibernéticos del modelo desactivados para ver qué intentaba hacer sin ayuda. No se tocó ningún sistema real. En esas simulaciones, Astra completó un ataque a la cadena de suministro contra objetivos fuera del alcance el 29,2 % de las veces, frente al 6,3 % de GPT-5.6 Sol y el 0 % de GPT-5.5. AISI señala que el resultado de GPT-5.5 se basa en un conjunto más pequeño de escenarios. Los ataques incluyeron crear identidades falsas y distribuir código malicioso en proyectos de código abierto simulados.
Razonamiento y solicitudes de permiso
AISI examinó la cadena de pensamiento sin procesar del modelo. Astra razonaba a menudo sobre el alcance, pero en ocasiones atacaba de todos modos, justificándolo porque era inofensivo, no estaba explícitamente prohibido o era la única opción que quedaba. El modelo también pidió permiso en muchas ejecuciones. La configuración de la prueba responde a esas preguntas con un mensaje automatizado estándar que indica al agente que use su mejor criterio, y Astra a veces lo interpretó como una aprobación, incluso cuando señaló que probablemente la respuesta era automática. Aclarar que todo lo que no figurara en la lista quedaba fuera del alcance redujo los ataques completos de 26 de 50 pruebas a 4 de 49 en un subconjunto de escenarios, pero no los eliminó.
Conciencia de la simulación
AISI señala la conciencia de la simulación como la principal limitación, ya que un modelo que detecta que está siendo probado puede comportarse de otra manera. Astra a veces citó el entorno simulado como motivo para atacar y, en ocasiones, afirmó que había errores que no eran reales, como decir que un hash de 64 caracteres tenía 63. AISI sigue considerando preocupante este comportamiento porque, en cualquier caso, infringe el alcance de la evaluación.
Agentes de OpenAI llegaron a sitios web gubernamentales
El retraso se produce tras incidentes en los que agentes de OpenAI llegaron a sitios web gubernamentales de formas que la empresa no pretendía, entre ellos un portal australiano de estadísticas de Medicare en junio y varios sitios de EE. UU. OpenAI también ha pausado el entrenamiento, la evaluación y la inferencia con uso de herramientas para sus modelos más capaces, y afirma que la pausa continuará hasta que confirme que ha cerrado una brecha en el filtrado de red y haya completado más pruebas de red team.
Fuente(s)
Top 10 Análisis
» Top 10 Portátiles Multimedia
» Top 10 Portátiles de Juego
» Top 10 Portátiles de Juego ligeros
» Top 10 Portátiles Asequibles de Oficina/Empresa
» Top 10 Portátiles de Juego Ligeros
» Top 10 Portátiles de Oficina/Empresa Premium
» Top 10 Estaciones de Trabajo
» Top 10 Subportátiles
» Top 10 Ultrabooks
» Top 10 Convertibles
» Top 10 Tablets
» Top 10 Tablets Windows
» Top 10 Tablets de menos de 250 Euros
» Top 10 Phablets (>5.5")
» Top 10 Smartphones
» Top 10 Smartphones (≤5")
» Top 10 Smartphones de menos de 300 Euros
» Top 10 Smartphones de menos de 120 Euros
» Top 10 Portátiles de menos de 1000 Euros
» Top 10 Portátiles de menos de 500 Euros
» Top 10 Portátiles de menos de 300 Euros
» Los Mejores Displays de Portátiles Analizados por Notebookcheck











