¿Qué hay realmente detrás de las cifras récord del Kimi K3?

Kimi K3 lleva en línea desde el 16 de julio, y los titulares dan a entender que China acaba de superar a EE. UU. Con 2,8 billones de parámetros, es el modelo más grande cuyos pesos se van a hacer públicos. Algunos observadores ya lo están calificando como el próximo «momento DeepSeek».
Sin embargo, la frase más interesante sobre este modelo no aparece en los titulares, sino en el propio blog técnico de Moonshot. Allí, el desarrollador señala que el rendimiento general sigue estando por detrás de los modelos propietarios más potentes, concretamente Claude Fable 5 y GPT-5.6 Sol. Es poco habitual que una empresa presente su propio producto y afirme que no es el mejor. Precisamente por eso, estas cifras récord merecen un análisis más detallado.
Ya nos hemos hecho eco de la noticia en sí: K3 ya está disponible y se puede probar de forma gratuita. Este artículo trata sobre lo que viene después.
El primer puesto y lo que realmente mide
K3 sí que gana una comparación importante. En el «Frontend Code Arena», donde los usuarios ven dos resultados uno al lado del otro y eligen el mejor sin saber qué modelo lo ha generado, K3 se sitúa en cabeza. Por delante también de Claude y GPT.
El inconveniente: esta prueba mide el gusto personal. Los usuarios valoran qué interfaz web les gusta más. Eso dice mucho sobre el diseño y poco sobre la corrección. Cualquiera que interprete esto como «Kimi supera a los modelos estadounidenses» ha pasado por alto la diferencia entre una clasificación por preferencias y una prueba de precisión.
Por qué hay que leer con atención las tablas comparativas
Moonshot publica sus mediciones, y lo interesante se encuentra en las notas al pie. Dependiendo de la prueba comparativa, cada modelo se ejecutó en un entorno de agente diferente: a veces KimiCode, otras veces Claude Code y otras Codex. Se trata de condiciones de partida distintas, no de una carrera limpia en la misma pista.
En una de las pruebas de codificación, la propia Moonshot reconoce que Claude Fable 5 recurrió a soluciones alternativas en el 35 % de las tareas, lo que puede haber lastrado su puntuación. En otra prueba, K3 solo alcanza su máxima puntuación con una técnica que compacta el contexto a 300 000 tokens. Sin esa gestión del contexto, la cifra desciende.
La facilidad con la que pueden dar un giro estas cifras queda patente en una evaluación realizada por la empresa de análisis independiente Artificial Analysis. En ella, Kimi K3 obtiene un 49 % en una métrica de «alucinaciones». Parece una puntuación baja. Sin embargo, la escala está invertida: cuenta la frecuencia con la que el modelo no comete errores. Cuanto más alta sea la puntuación, mejor; y en esa misma lista, Claude Fable 5 se sitúa por debajo de K3, con un 45 %, mientras que varias variantes de GPT-5.6 quedan muy por detrás.
Una regla que conviene tener en cuenta: antes de dar por buena la titularidad de una prueba comparativa, compruebe qué se ha medido exactamente y en qué sentido apunta la escala.
¿Puede ejecutar K3 por su cuenta?
Para nuestros lectores, esa es la verdadera pregunta. La respuesta sincera: para los usuarios habituales, esto no supondrá prácticamente ninguna diferencia, ni siquiera una vez que se publiquen los pesos. La razón es, sencillamente, el tamaño.
Haga unos cálculos rápidos. Moonshot entrena a K3 desde el principio en un formato numérico compacto denominado MXFP4, que utiliza unos cuatro bits por peso. Los pesos, también denominados parámetros, son los valores numéricos aprendidos que conforman un modelo de IA. Con 2,8 billones de parámetros, eso supone aproximadamente 1,4 terabytes solo para el archivo del modelo. No gigabytes. Terabytes. Para que se haga una idea: un modelo típico con 8 000 millones de parámetros, del tipo que se ejecuta en un ordenador portátil bien equipado, ocupa unos cinco gigabytes.
Top 10 Análisis
» Top 10 Portátiles Multimedia
» Top 10 Portátiles de Juego
» Top 10 Portátiles de Juego ligeros
» Top 10 Portátiles Asequibles de Oficina/Empresa
» Top 10 Portátiles de Juego Ligeros
» Top 10 Portátiles de Oficina/Empresa Premium
» Top 10 Estaciones de Trabajo
» Top 10 Subportátiles
» Top 10 Ultrabooks
» Top 10 Convertibles
» Top 10 Tablets
» Top 10 Tablets Windows
» Top 10 Tablets de menos de 250 Euros
» Top 10 Phablets (>5.5")
» Top 10 Smartphones
» Top 10 Smartphones (≤5")
» Top 10 Smartphones de menos de 300 Euros
» Top 10 Smartphones de menos de 120 Euros
» Top 10 Portátiles de menos de 1000 Euros
» Top 10 Portátiles de menos de 500 Euros
» Top 10 Portátiles de menos de 300 Euros
» Los Mejores Displays de Portátiles Analizados por Notebookcheck
La propia Moonshot recomienda ejecutar K3 en configuraciones de supernodos con 64 o más aceleradores. No se trata de una precaución excesiva, sino de la simple consecuencia de estas dimensiones. Una sola tarjeta gráfica profesional con 96 gigabytes de memoria se queda muy por debajo, en más de un factor de diez.
Por lo tanto, «peso abierto» no significa que vaya a ejecutar este modelo en su casa. Significa que los investigadores, las empresas y los proveedores de servicios en la nube pueden descargarlo, examinarlo y ejecutarlo en su propia infraestructura, en lugar de limitarse a alquilarlo a través de los servidores de Moonshot. Esto es valioso, pero es algo distinto de lo que mucha gente se imagina.
Si realmente desea disponer de IA sin necesidad de la nube en su propio equipo, los modelos pequeños diseñados para esa tarea son la opción adecuada. Hemos mostrado cómo funciona y qué requisitos de hardware necesita en un artículo aparte.
Una nota al margen para los curiosos en materia técnica: dado que K3 se entrenó con esta baja precisión desde el primer día, el formato compacto es su estado original, no un modelo comprimido a posteriori. La pregunta habitual sobre en qué medida la reducción de tamaño afecta a la calidad no se plantea de la misma manera.
Cuánto cuesta en la práctica
La facturación se realiza en tokens, pequeños fragmentos de texto que suelen tener solo unos pocos caracteres. A través de la API, Moonshot cobra 3 dólares por cada millón de tokens de entrada y 15 dólares por cada millón de tokens de salida. Las entradas repetidas se facturan a 30 céntimos, lo cual resulta mucho más económico.
Esto hace que K3 ya no sea una ganga. Cuesta aproximadamente tres veces más que su propio predecesor, que cobraba algo menos de un dólar por entrada. En comparación con Claude Fable 5, a 10 y 50 dólares, K3 resulta claramente más económico. Sin embargo, Claude Sonnet 5 sigue siendo más barato que K3 con su precio de lanzamiento actual de 2 y 10 dólares, y solo igualará el precio de K3 en septiembre. La era de los modelos chinos que compiten principalmente en precio está llegando a su fin en Moonshot.
Hay otro aspecto que es fácil pasar por alto. Actualmente, K3 siempre funciona al máximo de su capacidad. Moonshot tiene previsto añadir modos más ligeros más adelante. Esto hace que las respuestas sean exhaustivas, pero también implica que incluso una pregunta sencilla desencadena un costoso proceso de razonamiento. Mediciones independientes también registran que el modelo genera alrededor de 62 tokens de salida por segundo, lo que lo sitúa en la mitad de la tabla en cuanto a velocidad.
¿Qué ocurre con sus entradas?
Para cualquiera que pruebe K3 en la aplicación o en la página web, esta es la sección más importante. La política de privacidad de Moonshot establece claramente que las entradas, el audio, las imágenes, los vídeos y los archivos se procesan para prestar y mejorar los servicios, incluyendo explícitamente el entrenamiento y la optimización de sus propios modelos.
En la política no aparece por ninguna parte un interruptor específico para desactivar el entrenamiento con su contenido. Se hace referencia a los derechos generales de los interesados, que puede ejercer a través de la configuración de su cuenta o enviando un correo electrónico al contacto de privacidad. ChatGPT y Claude, por el contrario, incluyen un interruptor directamente en la configuración.
Asimismo, en la política se indica que los datos recopilados incluyen la dirección IP, los identificadores del dispositivo, los ID de sesión y de conversación y, cuando la configuración del dispositivo lo permita, los datos del portapapeles. En cuanto a la ubicación de almacenamiento, la política solo indica que los datos pueden transferirse a servidores situados fuera de su país de residencia. No se menciona ningún país en concreto. El proveedor es Moonshot AI PTE. LTD., con sede en Singapur, y la política tiene fecha del 7 de julio de 2025.
Para una prueba con tareas inofensivas, esto resulta aceptable. En el caso de información interna de la empresa, datos de clientes o documentos privados, se aplica la misma norma que con cualquier servicio en la nube, solo que en este caso se trata de un proveedor cuyos propios términos prevén explícitamente el entrenamiento del modelo.
¿Quién saca el máximo partido a Kimi K3?
Probarlo no cuesta nada. Hay dos grupos que pueden beneficiarse más: quienes se dedican al desarrollo o al diseño, y quienes trabajan habitualmente con documentos muy extensos. K3 destaca allí donde se combinan el código y los elementos visuales, como en interfaces web, 3D y animación. La ventana de contexto de un millón de tokens es un argumento de peso para textos largos, y el procesamiento de imágenes está integrado.
Si desea la mejor calidad en las respuestas o la experiencia más fluida, los mejores modelos estadounidenses siguen siendo la mejor opción. La propia Moonshot así lo afirma. Y cualquiera que espere poder instalar pronto un modelo de vanguardia en su propio ordenador debería tener en cuenta esos 1,4 terabytes.
Lo más destacable de K3 no es tanto su posición en la clasificación como su ritmo de desarrollo. Una empresa china está ofreciendo un modelo a la altura de los mejores del mundo y está haciendo públicos los datos del modelo. Hace dos años, eso habría sido difícil de imaginar.









