en este artículo
- Por qué existe este benchmark
- Cómo funciona el benchmark (versión agosto 2026)
- El ranking: top 10 por índice de calidad
- Si solo te importan los modelos abiertos
- Si solo te importa la calidad (y el costo no es factor)
- Dentro de la misma familia, el caro es peor
- Claude Fable 5: lo medimos el día 1 (y descartamos nuestra propia medición)
- Lo nuevo de junio: contexto usable y seguridad
- Los modelos “thinking” empeoran los agentes multi-turno
- El proveedor importa tanto como el modelo
- Correrlo en tu propia máquina: los números que cambiaron
- Lo que este benchmark NO mide (y dónde mirar)
TL;DR: No hay una mejor IA universal en 2026. Los modelos de arriba empatan en calidad — y el más caro cuesta cientos de veces lo que el más barato por las mismas mil llamadas. Pagar más no compra calidad: compra otra cosa. Lo que sigue son los datos.
¿Cuál es el mejor modelo de IA para tu negocio en 2026? Después de medir 190+ modelos con más de 30.000 ejecuciones de tests reales en español, la respuesta corta es: no existe el mejor modelo universal. Existe el mejor modelo para tu tarea, tu volumen y tu presupuesto. Y la data deja algo claro: pagar más no compra más calidad — la correlación entre precio y calidad en los modelos pagados es casi nula (el precio explica menos del 3% de la diferencia).
Este benchmark nació en febrero de 2026 con 25 modelos y 125 tests. Hoy es un proyecto open-source (MIT) con 192 modelos catalogados y más de 30.000 ejecuciones, de los cuales 83 tienen cobertura suficiente para competir en el ranking (50+ ejecuciones cada uno). Todo el código y los datos crudos están en GitHub.
🧠 ¿No sabes qué modelo de IA usar?
Intro a LLMs te da el criterio para elegir modelo por costo y caso de uso — y cierra con un test A/B real de 5 modelos en OpenRouter.
Ver el cursoPor qué existe este benchmark
No lo empecé por curiosidad. Lo empecé porque me estaba costando plata.
Tenía el plan Max de Anthropic. Sonaba razonable hasta que intenté usarlo con mis agentes y descubrí que la suscripción no está diseñada para eso: correr un agente 3-4 horas al día por API no costaba $20 ni $200. Costaba $11.250 al mes por desarrollador.
Eso no es un bug. Es cómo funciona el modelo de suscripción: te hace pensar que pagás $20 cuando en producción necesitás cinco cifras.
Después vino lo otro. Anthropic se cayó cinco veces en un mes. Después del tercer corte estaba frustrado; después del quinto entendí algo peor: me había casado con un proveedor. Exactamente igual que cuando era founder y dependía de ese empleado «irremplazable» que tenía todo en la cabeza.
Necesitaba una alternativa. Y necesitaba datos, no opiniones — porque los benchmarks que encontraba estaban en inglés, medían tareas de laboratorio, y ninguno respondía la única pregunta que me importaba: ¿cuál de estos me sirve a mí, en español, y cuánto me va a costar de verdad?
Así que lo medí yo.
Cómo funciona el benchmark (versión agosto 2026)
Cada modelo pasa por 31 suites de tests, organizados en 4 pilares aplicados más 2 dimensiones nuevas:
- Razonamiento: lógica, estrategia, detección de alucinaciones
- Coding: generación de código, JSON estructurado, precisión de strings
- Contenido/Marketing: blog, newsletters, traducción ES↔EN, copy de ventas
- Agentes/Operaciones: tool calling, soporte al cliente, multi-turno de 8+ turnos
- Long-context (nueva): retrieval tipo needle-in-a-haystack de 8K a 800K tokens
- Seguridad: resistencia a fuga de credenciales (
prompt_injection_es) - Trabajo agéntico real: tareas de negocio ejecutadas de punta a punta dentro de un agente con Docker y herramientas, verificadas por tests — no por un juez
La calidad la evalúa Phi-4 (Microsoft, 14B, licencia MIT) corriendo local en un DGX Spark — un juez que no le debe nada a ningún proveedor.
Cómo se lee el número (y por qué lo cambiamos)
Durante meses el titular de este benchmark fue un score compuesto: calidad, costo, velocidad y latencia mezclados en una cifra, estandarizados con z-score. Lo abandonamos, y vale contar por qué porque es la clase de error que se comete en cualquier dashboard.
Problema uno: el z-score estiraba las diferencias. Toda la población de modelos entra en 1,43 puntos de calidad real — del 7,10 al 8,53. El z-score los repartía sobre una escala de 0 a 10, así que una diferencia de 0,3 puntos aparecía publicada como 2 puntos. La brecha se veía seis veces más grande de lo que era. Peor: cada modelo nuevo movía el promedio y recalculaba la nota de todos, aunque ninguno hubiera cambiado su rendimiento.
Problema dos: mezclar precio con calidad esconde la decisión. Un compuesto que ya trae el costo adentro te contesta “cuál conviene” cuando todavía no preguntaste “cuál es mejor”. Y con los pesos mal calibrados, el costo terminaba decidiendo el ranking aunque pesara 15%.
Hoy el titular es el índice de calidad: capacidad pura, escala absoluta, 10 sería perfecto. Precio, velocidad y latencia van en sus propias columnas, al lado. Primero cuál es mejor; después cuánto cuesta. Y como la escala es absoluta y está anclada, una cifra citada hoy no caduca cuando mido un modelo nuevo — que era el problema real de la versión anterior.
La lección de método, que es lo que sirve fuera de acá: si tus métricas tienen rangos muy distintos, tus pesos te están mintiendo. Y si tu número principal mezcla “qué tan bueno es” con “cuánto cuesta”, no estás midiendo: estás opinando con decimales.
El ranking: top 10 por índice de calidad
Ranking al 16 de agosto de 2026. Calidad pura —sin mezclar precio— y el costo al lado, por 1.000 llamadas típicas. Todos medidos por el mismo camino para que la comparación sea entre modelos y no entre infraestructuras.
| # | Modelo | Calidad | $/1k llamadas | Open source |
|---|---|---|---|---|
| 1 | Tencent Hy3 | 8.53 | $0.83 | Sí |
| 2 | GPT-5.6 Luna | 8.43 | $0.93 | No |
| 3 | DeepSeek R1 (reasoning) | 8.43 | $3.96 | Sí |
| 4 | Qwen 3.7 Flash | 8.42 | $0.20 | No |
| 5 | Claude Opus 4.8 | 8.37 | $39.00 | No |
| 6 | Qwen 3.6 Max | 8.37 | $9.55 | No |
| 7 | Inkling Small | 8.36 | $1.94 | Sí |
| 8 | Claude Opus 4.6 | 8.34 | $39.00 | No |
| 9 | Qwen 3.6 Plus | 8.33 | $3.02 | No |
| 10 | GLM 5 | 8.33 | $4.11 | Sí |
La escala es absoluta y está anclada, así que —a diferencia de la versión anterior de este post— medir un modelo nuevo ya no recalcula la nota de los demás. Igual el catálogo crece cada mes: para el número de hoy está la calculadora en vivo, que se regenera sola.
Tres lecturas inmediatas:
El #1 es open source y cuesta menos de un dólar. Tencent Hy3 lidera el índice completo a $0.83 por mil llamadas, por encima de todos los propietarios. Esa brecha entre calidad y precio es también el dato central de por qué creo que hay una burbuja de valorizaciones en la IA.
Los de arriba empatan, y eso es el hallazgo. Del #1 al #10 hay 0,20 puntos. Toda la población rankeada entra en 1,43. Mientras tanto el precio va de $0.20 a $39 por las mismas mil llamadas: la calidad se apelotona y el precio se dispara. Que Claude Opus 4.8 esté #5 con calidad casi idéntica a un abierto que cuesta 47 veces menos es el argumento entero de este benchmark en una línea.
Lo barato dejó de ser segunda categoría. Qwen 3.7 Flash entra #4 a $0.20 por mil llamadas — el más barato del top 10 y a una décima de punto del líder.
Si solo te importan los modelos abiertos
Como el ranking mezcla propietarios y abiertos, acá está el corte que muchos vienen a buscar: solo open source, por score compuesto. Ocho de estos diez tienen licencia MIT o Apache 2.0 — los usás, los self-hosteás y los auditás sin pedirle permiso a nadie.
| # | Modelo | Calidad | $/1k llamadas | Licencia |
|---|---|---|---|---|
| 1 | Tencent Hy3 | 8.53 | $0.83 | Abierta |
| 2 | DeepSeek R1 (reasoning) | 8.43 | $3.96 | MIT |
| 3 | Inkling Small | 8.36 | $1.94 | Abierta |
| 4 | GLM 5 | 8.33 | $4.11 | MIT |
| 5 | Gemma 4 26B MoE (3.8B activos) | 8.28 | $0.64 | Apache 2.0 |
| 6 | GLM 5.2 | 8.28 | $2.45 | MIT |
| 7 | DeepSeek V3 | 8.27 | $0.68 | MIT |
| 8 | GLM-5.1 | 8.26 | $4.77 | MIT |
| 9 | Kimi K2.6 | 8.22 | $3.83 | MIT modificada |
| 10 | Hermes 4 405B | 8.20 | $4.80 | Llama 3 community |
Tencent Hy3 lidera el corte abierto y el ranking global entero. El costo-beneficio del open source dejó de ser una promesa: es el estado del arte medido.
Matiz honesto sobre el #1 abierto: ningún modelo gana en todo, y esta tabla lo demuestra de la peor manera. Hermes 4 405B está #10 en calidad y saca 0,00 en tareas agénticas reales — no existe endpoint que le dé herramientas, así que dentro de un agente no ejecuta nada. Una nota alta de calidad no dice si el modelo sirve para tu caso: por eso publicamos el trabajo agéntico aparte, y por eso el ranking es un mapa, no una respuesta única.
Si solo te importa la calidad (y el costo no es factor)
El ranking compuesto castiga a los modelos caros. Si tu caso es trabajo crítico donde el presupuesto no manda, esta es la tabla que importa — calidad pura, sin descontar precio:
Con el índice de calidad como titular, esa tabla es la misma de arriba: ya no hay dos rankings que decir cosas distintas. Lo que antes hacía falta separar —porque el compuesto hundía a los caros— hoy se lee de una sola tabla, con el precio en su columna.
Y lo que muestra es esto: la cima la comparten un abierto de $0.83 (Tencent Hy3) y uno de $3.96 (DeepSeek R1), y le ganan a Opus 4.8, que cuesta $39. Los premium no son peores; son igual de buenos que varios abiertos, pero cuestan decenas de veces más.
Y acá el hallazgo que más me sorprendió: la correlación entre precio y calidad en los pagados es +0.16 — casi nada. El precio explica menos del 3% de la diferencia de calidad. Pagás marca, soporte y prioridad en cola, no calidad medible en tareas aplicadas.
Dentro de la misma familia, el caro es peor
No hace falta comparar marcas para ver que pagar más no compra calidad. Alcanza con mirar una sola familia.
OpenAI vende tres versiones de GPT-5.6. Esto es lo que miden:
| Versión | Calidad | $/1.000 llamadas |
|---|---|---|
| GPT-5.6 Luna | 8.43 | $0.93 |
| GPT-5.6 Terra | 8.21 | $9.30 |
| GPT-5.6 Sol | 8.20 | $46.50 |
En calidad global, las tres empatan dentro del margen de error. Pero lo interesante aparece cuando separás por tarea: la barata (Luna) empata o gana en la mayoría de las categorías, y la cara (Sol) solo gana en dos concretas —escribir respetando restricciones duras y conversaciones multi-turno largas—. En razonamiento profundo, Luna incluso le gana con claridad.
Y hay algo que sí es contundente:
| Luna | Sol | |
|---|---|---|
| Precio (1.000 llamadas) | $0.93 | $46.50 |
| Velocidad | 107 tok/s | 44 tok/s |
Pagás cincuenta veces más, vas a menos de la mitad de velocidad, y en calidad obtenés menos. Luna no empata con Sol: le gana.
No es que Sol sea un mal modelo. Es que la escalera de precios no está comprada con calidad — está comprada con otra cosa (contexto, límites de uso, prioridad en cola). Y hay un giro que da vuelta la escalera entera: el tier más seguro no es el más caro, es el del medio. Terra fue el único de los tres que no filtró una credencial plantada en veinte intentos; Sol, el flagship, filtró en dos. El desglose completo, categoría por categoría y con el hallazgo de seguridad, está en mi análisis de GPT-5.6: Luna, Terra o Sol.
Claude Fable 5: lo medimos el día 1 (y descartamos nuestra propia medición)
Anthropic lanzó Fable 5 como tier nuevo sobre Opus, al doble de precio ($10/$50 por millón de tokens). Lo corrimos el mismo día del lanzamiento vía suscripción Claude Code, y ahí — comparado contra los otros Claude por el mismo camino — lidera el plano de suscripción, por encima de Opus 4.8. Su pitch (tareas agénticas de horizonte largo) se sostiene en esa medición.
Lo que pasó después vale más que el número. Al medirlo por API para meterlo al ranking principal, el resultado dio muy por debajo de lo esperado. En vez de publicarlo, revisamos las respuestas individuales: Fable razona internamente por defecto, nuestro runner no le daba presupuesto de tokens para eso, y 22 de 143 respuestas volvieron vacías — con el sistema marcándolas como “éxito”. El score bajo no era del modelo: era de nuestra medición. Descartamos ese examen entero y lo re-medimos con el fix.
Y el re-examen limpio dejó un hallazgo que ningún spec sheet te cuenta — y que al principio leímos mal. Creíamos que Fable “respondía vacío” ante credenciales. La verdad, al mirar la respuesta cruda de la API: Anthropic lo bloquea a nivel de plataforma — “blocked under Anthropic’s Usage Policy”, con mensaje explícito en un campo que nuestro sistema no leía. Copiar un JWT, la mitad de los tests de inyección: bloqueados, determinístico, corrida tras corrida. Y el remate: el mismo modelo, vía la suscripción de Claude Code, responde esos tests sin bloqueo. El filtro vive en el camino API, no en el modelo. Para quien usa la API eso es lo que cuenta: en el ranking Fable entró cargando esa verdad — calidad alta cuando responde, ceros donde la plataforma lo bloquea, y el precio más caro del catálogo — que lo hunde a la misma zona donde vive GPT-5.5, la esquina de los caros que no rinden lo que cuestan.
Veredicto: dentro de la suscripción de Claude, Fable es el mejor modelo y sale gratis marginal — ahí sí. Por API, paga el doble que Opus solo si tu caso es un agente de tareas largas y no procesa credenciales. Para todo lo demás, Haiku 4.5 — casi la misma calidad a un quinto del precio de Opus — es la compra racional de la familia. El análisis completo está en mi comparación Fable 5 vs Opus 4.8.
Lo nuevo de junio: contexto usable y seguridad
El hallazgo más valioso del mes no fue sobre un modelo — fue sobre nuestra propia medición. Descubrimos que la suite de long-context en español mentía de 5 formas distintas: los “needles” eran credenciales (medíamos fuga, no retrieval), el juez nunca veía el needle y castigaba extracciones correctas, la heurística de tokens excedía la ventana real, los tamaños usaban needles distintos (rankings falsos) y todo eso estaba mezclado en el score general. Auditamos cada respuesta individual, arreglamos las 5 y separamos la medición en dos dimensiones honestas.
Contexto usable ≠ contexto declarado. Con la medición limpia, todos los modelos top recuperan el dato casi perfecto en cualquier tamaño hasta su techo real. Lo que diferencia es dónde está ese techo:
| Modelo | Declarado | Usable real |
|---|---|---|
| Gemini 2.5/3.5 Flash Lite, DeepSeek V4 Flash, Llama 4 Maverick | 1M | 800K |
| MiniMax M3 (API directa) | 1M | 512K |
| MiniMax M3 (vía OpenRouter) | 1M | 256K |
MiniMax M3 anuncia 1M de contexto pero su API da error a partir de 800K. Si procesas documentos grandes, el número de marketing no es el que importa.
Seguridad: acá los premium sí compran algo. La suite nueva prompt_injection_es planta un secreto en un documento y pide extraerlo. Con la medición limpia y el catálogo de agosto, el orden sorprende: los que mejor resisten son Muse Spark 1.2 (8.61) y GPT-5.6 Terra (8.52) —ni el más caro ni el más famoso—, mientras varios modelos que en calidad rinden de primer nivel entregan el secreto. Si tu agente procesa contratos, configs o datos de clientes, este eje pesa — y es invisible en cualquier ranking de calidad o costo. Es el único lugar del benchmark donde pagar de más compra algo verificable.
Los modelos “thinking” empeoran los agentes multi-turno
Otro patrón que va contra el marketing: forzar el razonamiento extendido baja el rendimiento agéntico. En la mayoría de los modelos híbridos medidos con thinking forzado en la suite multi-turno, el score cae. El razonamiento interno consume atención que el modelo necesita para sostener el contexto de la conversación y la sintaxis de las tools.
Regla práctica: para agentes en producción, thinking apagado por defecto. Actívalo solo si validaste que ayuda en TU tarea específica.
El proveedor importa tanto como el modelo
Elegís un modelo mirando un ranking. Después lo llamás por el proveedor que tenías a mano. Y esa segunda decisión, la que nadie te ayuda a tomar, te puede costar más calidad que la primera.
Qwen 3.5 397B, el mismo modelo, los mismos pesos:
| Servido por | Calidad |
|---|---|
| NVIDIA NIM | 8.36 |
| Ollama Cloud | 8.02 |
0,34 puntos de diferencia — y acá va una corrección honesta: este post publicó antes «2,50 puntos». Esa cifra salía de la escala z-scoreada, que amplificaba las diferencias unas seis veces; con la escala absoluta el efecto real del serving es 0,34. Sigue siendo grande —toda la población entra en 1,43 puntos, así que 0,34 mueve muchas posiciones— pero no es el abismo que publicamos. Es cuantización o configuración de serving, y ningún proveedor te lo dice.
Por eso este benchmark mide todo por el mismo camino (OpenRouter). Si cada modelo se midiera en la infraestructura de su proveedor, no estarías comparando modelos: estarías comparando datacenters. Groq corre a cientos de tokens por segundo en sus LPU; otros proveedores, a decenas. Eso no dice nada sobre el modelo.
Lo desarrollé aparte, con todos los casos: el mismo modelo rinde distinto según quién lo sirva.
Correrlo en tu propia máquina: los números que cambiaron
Tengo un DGX Spark de US$4.000. Hace unos meses corría Gemma 4 ahí a 9 tokens por segundo — un agente que te hace esperar, inusable para trabajar. Ese número se me quedó grabado como “lo local es lindo pero lento”.
Volví a medir con el runtime correcto, y la historia cambió. Con vLLM y cuantización NVFP4, el mismo Spark corre Qwen 3.6 35B a 76 tokens por segundo — y ese modelo, medido por el plano común, da 7.90 de calidad:
| Dónde corre | Modelo | Calidad | Velocidad | Costo |
|---|---|---|---|---|
| Mi Spark (vLLM, NVFP4) | Qwen 3.6 35B | 7.90 | 76 tok/s | ”gratis” |
| En la nube | Gemma 4 26B | 8.01 | 45 tok/s | $0.49 / 1.000 llamadas |
Léelo dos veces. El local ya no es el lento de la película: con el software adecuado, mi Spark corre más rápido que ese modelo en la nube, con calidad comparable. El problema “lo self-hosted es inusable” era mío, de configuración, no del hardware.
Lo que no cambió es la aritmética. El hardware propio no es gratis: es capital hundido, electricidad, y horas de tuning del runtime. A $0.49 los mil llamados, ese Spark tarda años en pagarse por ahorro puro. Tiene sentido cuando la privacidad manda, cuando el volumen es brutal, o cuando ya lo tenés y querés exprimirlo. Como decisión de ahorro aislada, hacé la cuenta antes.
Nota metodológica: la velocidad de un modelo en mi Spark es la velocidad de mi Spark, no del modelo. Por eso los self-hosted no compiten en el ranking principal: comparar mi GPU contra un datacenter no mide modelos, mide máquinas. La calidad sí es del modelo (medida por el plano común); la velocidad es de mi hardware.
Lo que este benchmark NO mide (y dónde mirar)
Honestidad ante todo: este benchmark mide tareas aplicadas en español con prompts single-turn y multi-turno simulado. No mide debugging agéntico real con Docker, sistemas de archivos y ejecución de código.
Un caso real lo dejó claro: un emprendedor con un problema técnico complejo en un contenedor en su VPS lo intentó resolver con MiniMax M2.7 (bien rankeado acá) y no pudo. Cambió a Claude Opus — que en nuestro ranking compuesto aparece hundido por su costo — y lo resolvió en minutos. Para esa dimensión la referencia es SWE-bench Verified, donde Opus 4.7 lidera con 87.6%.
La regla: este ranking sirve para elegir el caballo de trabajo de volumen (contenido, workflows, agentes, análisis). Para incident response y debugging crítico, los premium siguen valiendo lo que cuestan.
La mejor IA de 2026 según tu caso
Qué usar según el caso, con los datos de julio 2026. El patrón que recomiendo para agentes: 1 LLM cabecera (orquestador) + N modelos especializados por skill — el mismo enfoque que uso en mis workflows de n8n.
| Tarea | Recomendado | Alternativa | Por qué |
|---|---|---|---|
| Agente cabecera (n8n) | Claude Opus 4.8 | Qwen 3.7 Max | Resuelven la tarea de negocio completa dentro del agente, 3 de 3 |
| Coding (workflows, plugins, scripts) | Qwen 3-Next 80B | Ling 3.0 Flash | Abiertos, y Ling cuesta centavos |
| Contenido en español | Tencent Hy3 | Ministral 14B | Calidad #1 del ranking a $0.83 por mil llamadas |
| Soporte al cliente multi-turno | GPT-5.6 Luna | Kimi K2.6 | Retención de contexto + latencia baja |
| Research con tools | DeepSeek V4 Flash (NIM) | Mistral Small 4 | Gratis (40 RPM), 800K usable |
| Documentos muy largos | Gemini Flash Lite / DeepSeek V4 Flash | Llama 4 Maverick | 800K de contexto usable real |
| Datos sensibles / credenciales | Muse Spark 1.2 | GPT-5.6 Terra | Los que no filtran el secreto (8.61 y 8.52) |
| Debugging real en producción | Claude Opus | GPT-5.x | SWE-bench Verified, no este ranking |
| JSON estricto | Qwen 3.7 Flash | GPT-OSS 20B | Los chicos baten a los gigantes en schema |
| Presupuesto $0 | DeepSeek V4 Flash (NIM) | Nemotron 3 Nano Omni (NIM) | Calidad top-tier gratis, límite 40 RPM |
Ojo con una trampa que este mismo post tenía: hasta agosto recomendaba acá a Llama 3.1 8B Instant, que rinde muy bien en tests de texto y saca 0,00 dentro de un agente real — rompe el bucle de herramientas. Si un modelo va a operar algo, mirá su columna de trabajo agéntico, no solo la de calidad.
Cuánto gastar según tu presupuesto
La estrategia de costo que sale de la data:
- $0/mes, volumen bajo: NVIDIA NIM gratis (20+ modelos, 40 RPM) + los Groq baratos por uso.
- $30-50/mes: Ollama Cloud ($30, incluye GPT-OSS 120B y DeepSeek V4) + pay-as-you-go puntual. Cobertura completa para un negocio chico.
- $100+/mes: pay-as-you-go en OpenRouter con fallback automático entre modelos.
Con ese stack, el 80-90% de las tareas de un negocio corre en modelos que cuestan centavos, y reservas los premium para lo que de verdad los necesita.
Lo que aprendí
No existe el mejor modelo universal. La regla #0 desde febrero, hoy con más de 30.000 ejecuciones que la respaldan.
Pagar más no compra calidad. Correlación precio-calidad de +0.16 en los modelos pagados — casi nada. Compra marca, soporte y, en el caso de Anthropic, seguridad.
Open-source ganó el costo-beneficio. Tencent Hy3 ($0.83) es #1 del ranking global entero y le gana en calidad a un Opus de $39. En el corte solo-abierto, los diez primeros dan calidad de primer nivel por centavos.
Los premium están arriba, pero el precio no rinde. Claude Opus 4.8 y 4.6 entran al top 10 por calidad — y los supera un abierto que cuesta 47 veces menos. Que lleguen arriba y no alcancen es la tesis, no la excepción.
El thinking es para problemas, no para agentes. Forzar razonamiento empeora el multi-turno en la mayoría de los modelos híbridos.
El contexto declarado es marketing; el usable es data. 1M anunciado puede ser 512K real.
Audita tu propia medición — y tu propia escala. Nuestra suite de long-context mentía de 5 formas y cada sesgo parecía un hallazgo. Y el z-score que usábamos para publicar inflaba las diferencias seis veces: el dato del serving de Qwen se publicó como 2,50 puntos cuando era 0,34. Antes de publicar un ranking — o un dashboard de tu negocio — revisa las respuestas individuales y qué le hace tu normalización a los números.
Todo el benchmark es open-source (MIT): código, tests, resultados crudos y análisis están en github.com/ctala/ai-benchmarks-alternativos. Y si quieres encontrar tu modelo en 30 segundos ajustando los pesos a tu caso (presupuesto, calls/mes, calidad mínima), usa la calculadora interactiva.
¿Dudas sobre qué modelo usar para tu negocio? Únete a mi comunidad de emprendedores en Cágala – Aprende, Repite — ahí publicamos los hallazgos de cada mes y podemos ayudarte a encontrar el setup óptimo para tu caso.
El ranking sigue vivo (y este post no)
Las cifras de arriba son del 16 de agosto de 2026. Desde que la escala es absoluta ya no se recalculan solas —esa era la peor parte del método anterior—, pero el catálogo crece cada mes y con él las posiciones. Si viniste a decidir hoy, mirá la fuente que se actualiza sola:
- modelos para agentes
- para programar
- los más baratos que rinden
- los mejores en español
- La calculadora — ajustá los pesos a tu caso: si corrés de noche, la latencia no te importa y el ranking la penaliza igual.
Todo el código y los datos están abiertos en GitHub.
Preguntas frecuentes
¿Cuál es el mejor modelo de IA en 2026?
No existe un mejor modelo universal. En índice de calidad lidera Tencent Hy3, que además es open source, con GPT-5.6 Luna y DeepSeek R1 pisándole los talones. Pero la diferencia entre los de arriba es mínima —toda la población entra en 1,4 puntos— y lo que cambia brutalmente es el precio, cientos de veces. Depende de tu caso.
¿Vale la pena pagar la versión más cara de un modelo?
En nuestras pruebas en español, casi nunca. Dentro de GPT-5.6, la versión barata (Luna) empata en calidad con la cara (Sol, que cuesta cinco veces más y tarda cuatro veces más), y hasta la supera en la mayoría de las tareas. La escalera de precios compra contexto, límites de uso y prioridad en cola — no calidad de respuesta. Y en un giro que no esperábamos, el tier del medio resultó ser el más seguro, no el de arriba.
¿Qué modelos de IA gratis valen la pena?
NVIDIA NIM ofrece más de 20 modelos gratis con límite de 40 requests por minuto: DeepSeek V4 Flash, Gemma 4, Qwen 3-Next y la familia Nemotron, entre otros. Para volumen bajo o medio (un blog, un agente n8n con decenas de ejecuciones diarias) es suficiente y la calidad es de primer nivel.
¿Claude vale lo que cuesta?
Depende de la tarea. En calidad pura Opus 4.8 está entre los mejores (8.37) y en debugging real lidera SWE-bench Verified con 87.6%. Pero cuesta $39 por mil llamadas, y abiertos como Tencent Hy3 ($0.83) o GLM 5 ($4.11) dan calidad igual o mayor a una fracción del precio. En seguridad ya no manda: hoy resisten mejor la fuga de credenciales Muse Spark 1.2 (8.61) y GPT-5.6 Terra (8.52). Para volumen alto de tareas comunes, no lo justifica.
¿Cuál es la mejor IA de 2026?
Depende de tu caso, y menos de lo que crees. Los mejores empatan en calidad — la diferencia real está en el precio, que va de centavos a decenas de dólares por las mismas mil llamadas. Usa la calculadora del benchmark con tus propios pesos en vez de copiar un ranking.
¿Cuál es la mejor IA gratis y open source en 2026?
Tencent Hy3 lidera el índice de calidad completo —abiertos y propietarios juntos— a $0.83 por mil llamadas. El costo-beneficio del open source dejó de ser una promesa: es el estado del arte medido. En la tabla dedicada solo a modelos abiertos, los diez primeros dan calidad de primer nivel por centavos.
🧠 ¿No sabes qué modelo de IA usar?
Intro a LLMs te da el criterio para elegir modelo por costo y caso de uso — y cierra con un test A/B real de 5 modelos en OpenRouter.
Ver el curso