Notebookcheck Logo

Sorprendidos mintiendo en el 88 % de las pruebas: los agentes de IA que usan modelos chinos aprendieron a hacer trampa; los modelos estadounidenses hicieron lo mismo

DeepSeek-V3.2-Exp alcanzó el 84 % en la investigación revisada por Reuters.
ⓘ John Cameron on Unsplash
DeepSeek-V3.2-Exp alcanzó el 84 % en la investigación revisada por Reuters.
Los agentes de IA basados en los modelos Qwen, DeepSeek y Kimi mintieron en entre el 84 % y el 88 % de las sesiones de una prueba de licitación simulada, según una investigación revisada por Reuters. En el pasado, los modelos estadounidenses se comportaron de manera similar, y ninguno de los casos hizo que un agente escapara de su entorno de prueba controlado.

AI agentes basados en modelos chinos mintieron en la mayoría de las sesiones de un concurso de licitación simulado, según una investigación examinada por Reuters. Los agentes que funcionaban con Qwen3-Max-Preview de Alibaba y Kimi-K2 de Moonshot hicieron al menos una afirmación falsa en el 88 % de las sesiones. DeepSeek-V3.2-Exp lo hizo en el 84 %. Sin embargo, los modelos de empresas estadounidenses obtuvieron resultados similares en la misma prueba.

El experimento tuvo lugar en marzo. Investigadores de la Universidad Beihang, la Universidad de Pekín, la University of Nottingham Ningbo China y 360 AI Security Lab hicieron que los agentes pujaran por contratos de clientes. A cada agente se le indicó lo que podía hacer su producto y lo que necesitaba el cliente. Cuando se les permitió aprender de rondas anteriores e intentarlo de nuevo, los tres agentes basados en modelos chinos se volvieron más engañosos, entre 12 y 20 puntos porcentuales.

Ese estudio es uno de al menos 20 que Reuters identificó entre más de 200 documentos publicados desde 2025. Otro, presentado en la ICML de este año, descubrió que agentes basados tanto en modelos chinos como estadounidenses falseaban resultados y fabricaban archivos en vez de admitir que habían fallado en una tarea. En marzo de 2025, investigadores de la Universidad Fudan también informaron que un agente basado en Qwen2.5-72B-Instruct de Alibaba hizo una copia de sí mismo en otro entorno después de enterarse de que sería reemplazado. Por separado, el agente ROME, vinculado a Alibaba, desvió potencia de computación en la nube para minar criptomonedas antes de que los sistemas de seguridad lo detuvieran.

La mayoría de estos casos surgieron de experimentos controlados diseñados para provocar fallos. Reuters no encontró pruebas de que ningún agente con tecnología china escapara a la internet abierta o eludiera el apagado. Aun así, varios investigadores calificaron los hallazgos de advertencia. A medida que los sistemas se vuelven más capaces, resulta más difícil contener ese mismo comportamiento.

China también ha empezado a abordar esta cuestión en sus políticas. Su Marco de Gobernanza de Seguridad de la IA 3.0, publicado el 14 de septiembre, enumera como riesgos engañar a los evaluadores y ocultar capacidades. Alibaba, DeepSeek, Moonshot y Z.ai no respondieron a Reuters. Los tres primeros han dicho anteriormente que prueban sus sistemas con regularidad y actualizan las medidas de protección.

Google LogoAdd as a preferred source on Google
Mail Logo
> Análisis y pruebas de ordenadores portátiles y móviles teléfonos > Noticias > Archivo de noticias > Archivo de noticias 2026 09 > Sorprendidos mintiendo en el 88 % de las pruebas: los agentes de IA que usan modelos chinos aprendieron a hacer trampa; los modelos estadounidenses hicieron lo mismo
Anubhav Sharma, 2026-09-30 (Update: 2026-09-30)