en este artículo
Uso Kimi K3 hace meses por la suscripción de Kimi Code, unos $50 al mes fijos. Mi benchmark le da top 31 en valor. Los números no se contradicen: el benchmark mide precio por token de API, y yo no pago por token.
Esa es toda la historia de este modelo en una frase. Kimi K3 salió esta semana con la prensa desatada —Bloomberg, CNBC, VentureBeat— porque es el modelo de pesos abiertos más grande del mundo y, según su propio reporte, le gana a Claude Opus 4.8. Lo medí en mi benchmark y confirmo la mitad del hype con dato propio. La otra mitad —si te conviene o no— depende de algo que ningún titular menciona: cómo lo pagas.
Qué es Kimi K3
Kimi K3 es el modelo insignia de Moonshot AI, el laboratorio chino detrás del chatbot Kimi. Ficha técnica:
🚀 ¿Te interesa la tecnología que realmente importa?
En la comunidad compartimos herramientas, workflows y automatizaciones que usamos en el día a día. Sin teoría — pura práctica.
Entrar a la comunidad- 2.8 billones de parámetros (2.8 trillion en inglés — ojo con el falso amigo, trillón en español es otro número). Es un Mixture-of-Experts disperso: de 896 expertos, solo 16 se activan por token, así que no ejecuta los 2.8 billones en cada respuesta.
- Ventana de 1 millón de tokens de contexto y visión nativa.
- Pesos abiertos: la liberación open-weight estaba anunciada para el 27 de julio de 2026 — sería el modelo abierto más grande jamás publicado.
- Dos mecanismos de eficiencia nuevos que Moonshot llama Kimi Delta Attention y Attention Residuals, con los que reporta hasta 6.3× más velocidad de decodificación y un 21% menos de tokens de salida que la generación K2 anterior.
- Precio por API: $3 por millón de tokens de entrada, $15 de salida — el modelo chino más caro lanzado hasta la fecha, al nivel de Claude Sonnet.
En los índices agregados en inglés le va muy bien: en el Artificial Analysis Intelligence Index saca 57.1, por encima de Opus 4.8 (55.7) y detrás solo de Claude Fable 5 y GPT-5.6 Sol. En Arena quedó primero en evaluación de código frontend. El hype de calidad, entonces, no es humo. La pregunta es qué pasa cuando lo mido yo, en español y con tareas de negocio reales.
Lo que dice mi benchmark
Contexto rápido para que los números signifiquen algo. Mi benchmark corre hace meses: 171 modelos catalogados, 119 con cobertura de medición, 70 rankeados, todo en español y con tareas aplicadas —workflows de n8n, scripts, contenido, razonamiento, extracción de datos—. El juez es Phi-4, un modelo de Microsoft corriendo local en mi infraestructura: no evalúo modelos de Microsoft, así que el que pone las notas no tiene equipo en la cancha. El score compuesto pesa 70% calidad, 15% costo, 7,5% velocidad y 7,5% latencia (versión 4.0, julio 2026).
Kimi K3 aterriza en dos lugares muy distintos según qué midas:
| Dimensión | Kimi K3 | Dónde queda |
|---|---|---|
| Calidad pura | 8.22 / 10 | #11 de 70 — clúster frontier, a 0.19 del #1 |
| Score de valor (compuesto) | 5.90 | #31 de 70 |
| Precio por API | $3 / $15 por millón | $23 por cada 1.000 llamadas |
| Velocidad | 34 tokens/segundo | lento (la media frontier va sobre 60) |
En calidad pura, el hype se confirma: #11 de 70, empatado con GLM 5 y a un pelo del mejor del mundo. Mi medición independiente en español coincide con lo que dicen Artificial Analysis y Arena. Frente a Claude Opus 4.8, que es el modelo que la prensa dice que K3 “supera”, en mi tabla Opus le gana por 0.08 (8.30 vs 8.22): están prácticamente empatados, y cuál queda arriba depende de la tarea y del idioma.
El score de valor lo pone en #31, y ahí es donde hay que leer fino. Ese número asume que pagas el modelo por API, a $3/$15 el millón, y castiga que genere lento. Con esa vara, K3 es caro: hay modelos de calidad frontier que salen una fracción por token. Pero “pagas por API” es un supuesto, no una ley.
El valor no es del modelo — es de cómo lo pagas
Acá está el matiz que ningún review de lanzamiento te va a dar, porque hay que usar el modelo por un tiempo para verlo.
El #31 en valor es el precio pay-per-token: si conectas K3 por API y pagas cada llamada, es caro. Pero yo no lo uso así. Lo uso por la suscripción Kimi Code, unos $50 al mes fijos, y con una suscripción el costo marginal por llamada tiende a cero. Es exactamente lo mismo que pasa con Claude: por API, Opus cuesta $5/$25 el millón; por la suscripción de Claude Code, el costo por llamada deja de ser la variable. Mi benchmark mide el precio de la API porque es el número comparable y auditable entre todos los modelos —no todos tienen suscripción—, pero ese número no es lo que paga el que tiene el plan.
Traducido: para un suscriptor de Kimi Code, K3 es calidad frontier a costo fijo mensual. Ese no es el mismo modelo económico que “el modelo chino más caro por token”. Es el mismo modelo, cobrado de otra forma.
Por eso el benchmark es una calculadora y no un veredicto. El score de valor asume un caso de uso —pagas por token, cada llamada cuenta— que no es el tuyo si tienes la suscripción. Cambia el supuesto y el ranking cambia con él.
Kimi K3 frente al frontier, con la misma vara
Para que el “#31 por API” no quede en abstracto, acá está K3 contra el #1 de mi ranking, medidos igual:
| Kimi K3 | GPT-5.6 Luna | |
|---|---|---|
| Calidad pura | 8.22 (#11) | 8.41 (#1) |
| Score de valor compuesto | 5.90 (#31) | 8.34 (#1) |
| Precio por API | $3 / $15 por millón | $1 / $6 por millón |
| Costo por 1.000 llamadas | $23 | $9 |
| Velocidad | 34 tok/s | 113 tok/s |
| Parámetros | 2.8 billones (MoE, 16 activos) | (cerrado) |
Por API, la lectura es dura: hay modelos de calidad casi idéntica que salen menos y corren más rápido. Y no es solo Luna —GLM 5.2 tiene la misma calidad que Opus (8.30) a $0.95/$3 el millón, un cuarto del precio de K3, y queda #6 en valor—. Si tu caso es pagar por token y optimizar calidad-por-dólar, K3 no es la compra. Si tu caso es que ya pagas la suscripción de Kimi Code, todo lo anterior es ruido: ya tienes acceso a un modelo frontier y el token marginal es gratis.
Mi experiencia real usándolo
No es un modelo que probé una tarde para escribir esto. Empecé con Kimi K2.7 Code hace meses y ahora estoy en K3, siempre por la suscripción. Lo uso sobre todo por consola, con Kimi Code —el agente de coding en la terminal, el mismo formato que Claude Code— y me gusta bastante para el trabajo asistido del día a día.
Lo que más me acelera es el Swarm: levantar varios agentes en paralelo para atacar un problema al mismo tiempo. La velocidad con la que sacas cosas cuando repartes el trabajo entre agentes es de otro nivel —y eso, más que un punto extra de calidad en un benchmark, es lo que lo vuelve útil de verdad para producir—.
Lo que me frena para usarlo aún más es que todavía no tiene control remoto: dispararlo y manejarlo desde afuera, como ya hacen otras herramientas. El día que Moonshot cierre ese hueco, lo uso todavía más. Es una limitación de producto, no de modelo: la calidad y el paralelismo ya están, falta el envoltorio.
Digo todo esto como usuario que paga la suscripción, no como recomendación de que la pagues tú. Cómo pagas tu stack es tu decisión y depende de tu volumen; esto es solo cómo lo pago yo y qué obtengo.
Cuándo tiene sentido y cuándo no
Tiene sentido si:
- Ya pagas la suscripción Kimi Code: tienes un modelo de calidad frontier a costo fijo, aprovéchalo.
- Necesitas calidad bruta para trabajo crítico y el costo por token no es tu restricción principal.
- Trabajas con contexto muy largo o necesitas visión nativa —la ventana de 1M y el multimodal son reales.
- Te importa el open source: cuando liberen los pesos, es el modelo abierto más grande disponible.
Piénsalo dos veces si:
- Pagas por token y optimizas calidad-por-dólar → GPT-5.6 Luna, GLM 5.2 o modelos abiertos más baratos te dan calidad casi igual por mucho menos.
- Un humano espera la respuesta en pantalla: 34 tokens/segundo se siente lento en interacción en vivo.
- Necesitas español publicable sin revisión: como varios modelos de origen chino de mi tabla, conviene revisar el output antes de mandarlo a audiencia.
Kimi K2 vs K3: la familia mejoró
Si venías siguiendo la familia, el salto es real. Cuando medí las variantes de Kimi K2, la conclusión incomodaba: la mejor era la más vieja y las razonadoras quedaban al fondo de la tabla. K3 corrige eso: entra directo al clúster frontier en calidad, algo que ninguna K2 logró. La deuda pendiente sigue siendo la misma —velocidad y precio por token—, pero la calidad ya no es el problema.
Ver en el Benchmark: Kimi K3 aparece con su score actualizado en el ranking de mejores LLM y en la calculadora interactiva, donde puedes ajustar los pesos a tu caso. El análisis metodológico completo, con los 70 modelos rankeados, está en el post vivo del benchmark.
El ranking sigue vivo (y este post es de hoy)
Las cifras de arriba son de julio de 2026. Desde la versión 4.0, mi benchmark congela la referencia del score por versión: medir un modelo nuevo ya no recalcula el de los demás —así que el #11 y el #31 de K3 son estables dentro de esta versión—. Pero entre versiones sí se recalibran, y cualquier cifra puntual caduca. Si viniste a decidir hoy, mira la fuente que se actualiza sola:
- La calculadora — ajusta los pesos a tu caso: si ya pagas una suscripción, el peso del costo por token no debería mandar en tu decisión.
- El ranking de modelos para agentes.
Todo el código y los datos están abiertos en GitHub.
Preguntas frecuentes
¿Kimi K3 vale la pena?
Depende de cómo lo pagas. En calidad pura es frontier: puesto #11 de 70 modelos en mi benchmark (8.22 sobre 10, a 0.19 del mejor del mundo, julio 2026). Pero el score de valor lo pone en #31, porque asume el precio por API ($3/$15 por millón de tokens) y porque genera lento (34 tokens por segundo). Si lo pagas por la suscripción Kimi Code (un costo fijo mensual, desde $19 y con tiers superiores que suman Agent Swarm), el costo por llamada deja de importar y la ecuación cambia por completo.
¿Cuántos parámetros tiene Kimi K3?
2.8 billones de parámetros (2.8 trillion en la prensa en inglés — trillón en español es otro número). Es un Mixture-of-Experts disperso: de 896 expertos, solo 16 se activan por token, así que no ejecuta los 2.8 billones en cada respuesta. Moonshot lo presenta como el modelo de pesos abiertos más grande hasta la fecha; la liberación open-weight estaba anunciada para el 27 de julio de 2026.
¿Kimi K3 le gana a Claude Opus 4.8?
En los índices agregados en inglés (Artificial Analysis Intelligence Index), K3 saca 57.1 y queda por encima de Opus 4.8 (55.7). En mi benchmark, que mide tareas aplicadas en español, Opus 4.8 le gana por un pelo en calidad (8.30 vs 8.22) — están prácticamente empatados. El titular "le gana a Opus" es defendible en agregado; en el detalle depende de la tarea y del idioma.
¿Cuánto cuesta Kimi K3?
Por API pay-per-token: $3 por millón de tokens de entrada y $15 de salida — el modelo chino más caro lanzado hasta ahora, al nivel de Claude Sonnet. Eso son unos $23 por cada 1.000 llamadas con mi supuesto de consumo. Por suscripción: el plan Kimi Code arranca en $19 al mes y los tiers con Agent Swarm y más cuota suben desde ahí (yo uso uno de unos $50); con cualquiera de ellos el costo marginal por llamada tiende a cero, igual que la suscripción de Claude Code.
¿Por qué Kimi K3 queda #31 en valor si es tan bueno?
Porque mi score de valor pondera calidad, costo y velocidad, y usa el precio por token de API por diseño. K3 es caro por token ($3/$15) y lento (34 tokens/segundo), así que aunque su calidad sea frontier, el compuesto lo baja. No es una contradicción: es la diferencia entre lo que cuesta por API y lo que pagas si lo usas por suscripción. El valor no es una propiedad fija del modelo.
🚀 ¿Te interesa la tecnología que realmente importa?
En la comunidad compartimos herramientas, workflows y automatizaciones que usamos en el día a día. Sin teoría — pura práctica.
Entrar a la comunidad