Saltar al contenido
CristianTala_
IA y Automatización

Cuantización explicada sin marearte (el mismo modelo pesa 67 GB o 22 GB)

Por Cristian Tala Sánchez ·

Cuantización explicada sin marearte (el mismo modelo pesa 67 GB o 22 GB)
en este artículo
  1. Cuantizar es redondear
  2. Por qué te tiene que importar
  3. La pregunta que todos hacen: ¿se vuelve tonto?
  4. La sopa de siglas, ordenada
  5. Lo que a mí me sorprendió: comprimir no siempre acelera
  6. Antes de comprimir, revisa dónde se te va la memoria
  7. Cuál usar: la respuesta corta
  8. Tres cosas que aprendí a los golpes
  9. Lo que sigue

Este es el tema que más me costó entender de correr IA en mi propia máquina, y voy a ser honesto: durante meses lo usé sin entenderlo del todo. Bajaba modelos que decían NVFP4, Q4_K_M o AWQ, elegía el que me recomendaban en un foro y seguía. Funcionaba, pero no sabía por qué.

Así que este post es el que me habría gustado leer.

Empecemos por el dato que lo hace concreto. Estos son tres archivos de mi disco. Los tres son el mismo modelo, Qwen 3.6 35B:

🚀 ¿Te interesa la tecnología que realmente importa?

En la comunidad compartimos herramientas, workflows y automatizaciones que usamos en el día a día. Sin teoría — pura práctica.

Entrar a la comunidad
VersiónLo que pesa en mi disco
Sin comprimir67 GB
Comprimido a la mitad36 GB
Comprimido a un cuarto22 GB

Mismo modelo, mismas respuestas para lo que yo hago, y entre el primero y el último hay 45 GB de diferencia. Eso es la cuantización. Ahora el porqué.

Cuantizar es redondear

En el post anterior quedamos en que un modelo de IA es un mapa gigante: miles de millones de coordenadas guardadas en un archivo.

La pregunta que nadie se hace es: ¿con cuánto detalle se anota cada coordenada?

Piensa en el número pi. Puedes anotarlo así:

  • 3,14159265358979
  • 3,1415
  • 3,14
  • 3

Los cuatro sirven para calcular el área de una pizza. El primero ocupa cuatro veces más espacio que el tercero y, para tu pizza, da el mismo resultado. Solo si estuvieras calculando la órbita de un satélite notarías la diferencia.

Cuantizar es exactamente eso, aplicado a los miles de millones de números que forman el modelo. En vez de guardar cada uno con mucho detalle, lo guardas con menos. El archivo se achica y el modelo sigue llegando al mismo lugar casi siempre.

Cuando leas que un modelo está “en 4 bits”, traduce: cada número se guarda con muy poquito detalle. Cuando leas “16 bits”, traduce: cada número se guarda con bastante detalle. Los bits son el tamaño del casillero donde anotas cada número. Menos casillero, archivo más chico, y algo de precisión que se va.

Por eso la escalera de arriba baja de a la mitad: 16 bits, 8 bits, 4 bits. Cada escalón parte el archivo en dos.

Por qué te tiene que importar

Porque es la diferencia entre poder correr el modelo o no correrlo.

Mi máquina tiene 128 GB de memoria. El Qwen sin comprimir pesa 67 GB solo en pesos, y como te conté en el post anterior, el modelo no es lo único que hay que guardar en memoria: la conversación se lleva un pedazo enorme. Con el modelo sin comprimir no me queda espacio para trabajar. Con el mismo modelo a 4 bits, ocupo 22 GB y me sobran más de 100 para lo demás.

Y esto escala hacia abajo. Un modelo que sin comprimir necesita una tarjeta de $30.000 dólares, comprimido corre en un computador de escritorio. La cuantización es la razón por la que hoy puedes correr un modelo bueno en tu casa. No es un detalle de ingeniería, es lo que abrió la puerta.

La pregunta que todos hacen: ¿se vuelve tonto?

Esta es la parte que a mí me daba desconfianza. Si estoy borrando información del modelo, algo tengo que estar perdiendo. ¿Cuánto?

Los números publicados en 2026 son bastante consistentes:

CompresiónCuánta calidad pierdeTraducción
8 bitsmenos de 1%No lo vas a notar
4 bits (buen método)entre 1% y 3%Lo notas en tareas difíciles, no en el día a día
4 bits (mal método)entre 2% y 5%Empieza a molestar
menos de 4 bitsmucho másSe pone tonto de verdad

La lectura práctica: hasta 4 bits el negocio es buenísimo. Achicas el archivo cuatro veces y pagas uno o dos por ciento de calidad. Por debajo de 4 bits la cuenta se da vuelta: ahorras poco espacio y el modelo empieza a equivocarse en cosas que antes hacía bien.

Un detalle que importa: no todas las compresiones a 4 bits son iguales. Comprimir bien exige un trabajo previo, pasarle al modelo textos de prueba para ver qué números conviene redondear y cuáles conviene respetar. Los métodos que hacen ese trabajo conservan más calidad que los que redondean todo por parejo. Por eso dos archivos que dicen “4 bits” pueden rendir distinto.

Es la misma lógica de una foto: dos JPEG del mismo tamaño se ven distinto según qué tan bien se hizo la compresión.

La sopa de siglas, ordenada

Acá es donde la mayoría se pierde, porque los nombres no dicen nada. Traducidos:

SiglaQué esPara quién
BF16 / FP16El modelo sin comprimir, tal como salióEl que tiene tarjetas de sobra
MLX (-4bit, -8bit)El formato de AppleMac con chip M
GGUF (Q4_K_M, Q5_K_M…)El formato de llama.cppMac, PC normal, laptop, procesador
AWQ4 bits cuidando la calidadTarjetas NVIDIA con vLLM
GPTQ4 bits, el veteranoTarjetas NVIDIA, hoy AWQ suele ganarle
FP88 bits, pérdida casi nulaTarjetas nuevas, cuando te sobra algo de espacio
NVFP4 / MXFP44 bits, formato de NVIDIATarjetas Blackwell

Y la regla para no marearte: el formato lo elige tu máquina, no tú.

  • ¿Mac con chip M? MLX, el formato de Apple, y GGUF como segunda opción. En MLX los modelos se llaman con el número de bits pegado al final del nombre, así que buscas el que quieres y le agregas -4bit o -8bit. Hay casi cinco mil modelos ya convertidos esperándote.
  • ¿PC, laptop sin tarjeta dedicada o procesador? GGUF, empezando por Q4_K_M. Esa Q4 es el número de bits y lo demás es la receta interna de compresión.
  • ¿Tarjeta NVIDIA con vLLM? AWQ, o el NVFP4 oficial si tu tarjeta es de las nuevas.
  • ¿Te sobra memoria? FP8 y duermes tranquilo.

No hay que estudiarse la tabla. Hay que saber cuál te toca.

Un detalle del que casi nadie avisa: en los modelos chicos la compresión duele más. Por debajo de unos 3 mil millones de parámetros, bajar a 4 bits se nota de verdad, y conviene quedarse en 8. Mientras más grande el modelo, más aguanta que le redondeen los números. Es de las pocas cosas donde lo grande es más resistente, no más frágil.

Lo que a mí me sorprendió: comprimir no siempre acelera

Acá viene el hallazgo que me obligó a corregir lo que yo creía, y es la razón por la que este post existe.

La creencia general es que un modelo comprimido corre más rápido. Tiene lógica: si hay menos datos que mover desde la memoria, cada palabra debería salir antes. En la mayoría de las máquinas es así.

En la mía no. Medí el mismo modelo, Muse Glimmer, en sus dos versiones:

VersiónPeso en discoVelocidad
Sin comprimir56 GB11,32 tokens por segundo
Comprimido a 4 bits24 GB11,29 tokens por segundo

Menos de la mitad de tamaño y exactamente la misma velocidad.

La explicación tiene que ver con lo que tu chip sabe hacer. Comprimir a 4 bits solo acelera si el procesador sabe operar directamente con números de 4 bits. El chip de mi máquina, el GB10, no sabe: cada vez que necesita un número comprimido, primero lo descomprime y recién después calcula. Ese trabajo extra se come la ganancia.

Los chips de centro de datos, como el B200, sí operan en 4 bits de forma nativa. Ahí la compresión acelera de verdad, y por eso circulan cifras que en mi máquina no se replican jamás.

Conclusión para mi caso, que probablemente sea también el tuyo si corres en casa: cuantizo para que el modelo quepa, no para que corra más rápido. Que quepa ya es razón suficiente. Pero si alguien te promete que comprimir te va a duplicar la velocidad, esa promesa depende de un chip que quizás no tienes.

Antes de comprimir, revisa dónde se te va la memoria

Un error que cometí y que vale contar, porque es plata y tiempo.

Cuando me quedé sin memoria, mi primer instinto fue buscar una compresión más agresiva del modelo. Estaba mirando el lugar equivocado. Cuando revisé en qué se iban mis 112 GB, esto es lo que encontré:

QuéCuánto
El modelo comprimido20 GB
La memoria de la conversación82 GB
Todo lo demás10 GB

El modelo ya era la parte chica. Lo que se comía la máquina era el espacio reservado para recordar conversaciones larguísimas. Bajé ese límite y pasé de 112 GB a 44 GB sin tocar la compresión y sin perder velocidad.

Si te quedas sin memoria, revisa primero cuánto contexto le estás permitiendo. Comprimir más el modelo suele ser la palanca equivocada, y esa sí te cuesta calidad.

Cuál usar: la respuesta corta

  1. Si el modelo te cabe sin comprimir, no compliques tu vida. Cero pérdida, cero decisiones.
  2. Si no te cabe, baja a 8 bits. Achicas a la mitad y la pérdida es invisible.
  3. Si todavía no te cabe, baja a 4 bits con un método bueno (AWQ en NVIDIA, Q4_K_M en Mac o PC). Es el punto dulce y donde vive casi todo el mundo.
  4. Por debajo de 4 bits, solo si no hay alternativa. Ahí el modelo empieza a pagar caro.
  5. Prueba las dos versiones con tus tareas reales. Un uno por ciento de diferencia en una tabla no te dice nada sobre si el modelo va a resolver tu problema. Media hora de pruebas propias vale más que cualquier ranking.

Tres cosas que aprendí a los golpes

1. El nombre del archivo te dice casi todo. Q4 o FP4 son cuatro bits; FP8, ocho; BF16, sin comprimir. Con eso ya sabes qué estás bajando y cuánto va a pesar, sin leer la documentación.

2. Comprimido no es “peor modelo”. Es el mismo modelo con los números redondeados. Un modelo grande comprimido casi siempre le gana a un modelo chico sin comprimir del mismo peso en disco. Si tienes que elegir entre un modelo de 30B a 4 bits y uno de 8B sin comprimir, y ambos ocupan lo mismo, quédate con el grande comprimido.

3. La ganancia de velocidad depende de tu chip, la de espacio no. El espacio lo ganas siempre. La velocidad, solo si tu procesador habla ese idioma de forma nativa. Confirma con una medición tuya antes de dar por hecha la mitad que no te toca.

Lo que sigue

Con esto ya tienes las dos piezas que deciden si puedes correr IA en tu propia máquina: el motor, que es el programa que hace responder al modelo, y la compresión, que decide si el modelo entra o no entra.

Falta la tercera, que es donde se gana o se pierde el producto: el chasis que conecta el modelo con tus herramientas, tus datos y tu negocio. Un modelo mediano bien conectado le gana a uno excelente que no puede tocar nada tuyo.

Mientras tanto, si vas a bajar un modelo esta semana, ya sabes qué significan las siglas del nombre y cuál te toca. Y si mides algo raro en tu máquina, cuéntalo donde otro lo pueda aprovechar: la mitad de lo que aprendí acá salió de números que no me cuadraban y que alguien más ya había visto antes.

Preguntas frecuentes

¿Qué es cuantizar un modelo de IA?

Es guardar los números del modelo con menos precisión para que ocupe menos espacio. Un modelo guarda miles de millones de números; si en vez de anotar cada uno con dieciséis decimales lo anotas con cuatro, el archivo se achica varias veces y el modelo sigue respondiendo casi igual. En mi disco, el mismo Qwen 3.6 35B pesa 67 GB sin comprimir y 22 GB cuantizado a 4 bits.

¿Cuánta calidad se pierde al cuantizar un modelo?

Menos de lo que la gente teme. A 8 bits la diferencia contra el modelo original queda por debajo del 1%, prácticamente invisible. A 4 bits con un método bueno (AWQ o GGUF Q4_K_M) la caída ronda el 1 a 3%. Por debajo de 4 bits sí empieza a notarse: el modelo se pone impreciso y comete errores tontos. El punto dulce para correr en casa son los 4 bits.

¿Qué significan MLX, GGUF, AWQ, GPTQ, FP8 y NVFP4?

Son formatos distintos de comprimir el mismo modelo, y eliges por la máquina que tienes, no por cuál suena mejor. MLX es el de Apple y es la mejor opción en un Mac con chip M: los modelos llevan el número de bits en el nombre, así que buscas el tuyo y le agregas -4bit o -8bit. GGUF es el de llama.cpp y sirve en Mac, PC y procesador, con niveles como Q4_K_M. AWQ y GPTQ son para tarjetas NVIDIA vía vLLM, y AWQ suele conservar algo más de calidad a 4 bits. FP8 comprime a 8 bits con pérdida casi nula. NVFP4 es el formato de 4 bits de NVIDIA para tarjetas Blackwell.

¿Cuantizar un modelo lo hace más rápido?

Casi siempre sí, porque hay menos datos que mover desde la memoria. Pero no siempre: depende de si tu chip sabe operar en ese formato de forma nativa. En mi DGX Spark medí Muse Glimmer sin comprimir y comprimido a 4 bits, y dio lo mismo: 11,32 contra 11,29 tokens por segundo. El chip GB10 no tiene cálculo FP4 nativo y descomprime en tiempo real, así que la compresión me sirve para que el modelo quepa, no para que corra más rápido.

¿Qué nivel de cuantización debería usar?

Si el modelo te cabe sin comprimir, no compliques tu vida. Si no te cabe, baja a 8 bits primero y solo si aún no entra baja a 4 bits, que es donde está el equilibrio entre tamaño y calidad. Evita bajar de 4 bits salvo que no tengas alternativa. Y la regla que vale más que cualquier tabla: prueba las dos versiones con tus tareas reales antes de decidir.

🚀 ¿Te interesa la tecnología que realmente importa?

En la comunidad compartimos herramientas, workflows y automatizaciones que usamos en el día a día. Sin teoría — pura práctica.

Entrar a la comunidad