Kimi K3 se corona en Frontend Code Arena y desata una fiebre entre desarrolladores
El nuevo modelo chino Kimi K3 acaba de colarse en lo más alto de una de las pruebas de programación más observadas del momento, y lo ha hecho superando a rivales que parecían intocables. Moonshot AI ha presentado un sistema de 2,8 billones de parámetros totales que, nada más aterrizar, se ha situado en la cima de Frontend Code Arena, por delante de algunas de las propuestas más potentes de Anthropic y OpenAI. Recuerda un poco a aquel momento en que DeepSeek R1 puso en duda algo que muchos daban por sentado, esto es, que la carrera por la inteligencia artificial avanzada tenía dueño claro en Silicon Valley.
Un modelo chino que lidera la prueba más visible de programación
Conviene detenerse en los números, porque cuentan bastante. En el momento de escribir esto, Kimi K3 alcanza 1.679 puntos en Frontend Code Arena, por delante de Claude Fable 5, con 1.631, y de GPT-5.6 Sol xHigh, con 1.618. El salto respecto a la generación anterior también llama la atención, ya que Kimi K2.6 ocupaba el puesto 18 mientras que su sucesor manda en seis de los siete dominios evaluados. Arena todavía mantiene la etiqueta de resultado preliminar, así que esta posición es una fotografía muy significativa, aunque susceptible de cambios.
No se trata de un examen universal de programación, sino de algo muy concreto. Frontend Code Arena compara aplicaciones web creadas por distintos modelos y deja que los usuarios decidan cuál resuelve mejor la tarea. Un enfoque útil para medir capacidades visibles y prácticas, con límites evidentes. Que Kimi K3 mande aquí dice mucho sobre su rendimiento en frontend, pero no permite extender esa ventaja a repositorios complejos, backend, matemáticas o razonamiento general. Fuera de ese terreno, la imagen sigue siendo favorable aunque más equilibrada, con Vals AI colocándolo segundo entre 38 modelos con un 74,70%, apenas por detrás de Claude Fable 5 con un 75,14%.
Dónde brilla y qué cautelas conviene tener
Donde Kimi K3 parece sentirse más cómodo es en tareas que mezclan programación, contexto visual y varios pasos encadenados. Moonshot cuenta que el modelo recorre repositorios extensos, usa herramientas de terminal y revisa capturas de su propio trabajo para corregir sobre la marcha, algo que la empresa bautiza como “vision in the loop”. Eso ayuda a explicar por qué destaca al transformar referencias visuales en productos interactivos.
Hay que poner algunos frenos, eso sí. Moonshot lo presenta como un modelo de pesos abiertos, pero esos archivos aún no se han publicado y la compañía promete liberarlos como muy tarde el 27 de julio. Tampoco conviene confundir esa apertura con código abierto completo. Sus 2,8 billones de parámetros pertenecen a una arquitectura dispersa que activa 16 de sus 896 expertos, y la propia empresa recomienda configuraciones con 64 aceleradores o más, muy lejos de un ordenador convencional.
La reacción de la comunidad explica buena parte del ruido. Uno de los ejemplos más comentados es una recreación de macOS 27 que funciona dentro del navegador y que su creador atribuye a un enjambre de agentes del modelo trabajando durante unas tres horas. A eso se suman Ballista, un panel interactivo con un globo 3D, y varias comparaciones frente a Claude y GPT. No son benchmarks independientes, sino demostraciones de sus propios creadores, pero dejan ver qué está produciendo el modelo fuera de las tablas. Kimi K3 puede usarse desde Kimi.com, Kimi Work, Kimi Code o herramientas conectadas a su API, aunque no está confirmado qué entorno concreto se empleó en varios de esos ejemplos. Fable 5 y GPT-5.6 Sol siguen por delante en varias evaluaciones, los pesos de Kimi K3 aún no están disponibles y muchas de sus capacidades tendrán que verificarse con más tiempo.
—
Fuente
Imagen: xataka.com
