Guía técnica · AIHARD

Cuantización de LLMs: qué es, cuánta VRAM ahorra y cuánta calidad pierdes

Q4, Q5, Q8, GGUF… explicado en claro: cómo la cuantización reduce un modelo de 16 GB a 5 GB, qué nivel elegir según tu GPU, tabla de VRAM por tamaño de modelo y qué se pierde de verdad por el camino.

Actualizado: 20 de agosto de 2026

Para empezar

¿Qué es la cuantización? La explicación sin matemáticas

Un modelo de lenguaje son miles de millones de números (los 'pesos'). De fábrica, cada número se guarda con mucha precisión — 16 bits — igual que una foto RAW guarda cada píxel con todo detalle. La cuantización es el equivalente a convertir esa foto a JPEG: guardas cada número con menos bits (8, 5, 4…) y el archivo pasa a ocupar una fracción, con una pérdida de calidad tan pequeña que en la mayoría de usos no se aprecia.

La consecuencia práctica es enorme: un modelo 8B que en formato original ocupa ~16 GB pasa a ~5 GB en Q4. Es la diferencia entre necesitar una GPU profesional y correrlo en una tarjeta de consumo de 8 GB. La cuantización es el motivo por el que la IA local es viable en hardware normal.

En profundidad

Q4, Q5, Q8 y GGUF: descifrar los nombres

GGUF es el formato de archivo que usan llama.cpp y Ollama para distribuir modelos cuantizados. El sufijo indica el nivel: el número es la cantidad de bits por peso (Q8 = 8 bits, Q4 = 4 bits) — menos bits, menos VRAM y menos precisión.

Las variantes 'K' (Q4_K_M, Q5_K_S…) son cuantizaciones inteligentes: no aplican los mismos bits a todo el modelo, sino que protegen las capas más sensibles con más precisión. Q4_K_M es el estándar de facto de 2026 — el mejor equilibrio tamaño/calidad — y es lo que Ollama descarga por defecto en la mayoría de modelos. También verás formatos nuevos como MXFP4, con el que se distribuye gpt-oss.

Regla rápida de tamaño: en Q4 un modelo ocupa aproximadamente 0,6 GB por cada mil millones de parámetros (un 14B ≈ 9 GB); en Q8, ~1,1 GB por millardo (el mismo 14B ≈ 15 GB); en FP16 original, ~2,1 GB (≈ 30 GB). A eso se le suma siempre el contexto (caché KV), que crece con la longitud de la conversación.

Tabla: VRAM necesaria por modelo y nivel de cuantización

Modelos 8B (Llama 3.1 8B, Qwen3 8B): FP16 ~16 GB → Q8 ~9 GB → Q4 ~5-6 GB. En Q4 caben en cualquier GPU de 8 GB.

Modelos 14B (Qwen3 14B): FP16 ~30 GB → Q8 ~15 GB → Q4 ~9-10 GB. En Q4 funcionan holgados en una GPU de 16 GB; en Q8 exigen 24 GB.

Modelos 27-32B (Gemma 3 27B, Qwen3 32B): FP16 fuera del alcance de consumo → Q8 ~30 GB → Q4 ~17-20 GB. La clase que convierte una GPU de 16 GB en una máquina seria (con contexto moderado) y que con 24 GB va sobrada.

Modelos 70B (Llama 3.3 70B): Q4 ~42-45 GB. Territorio de dos GPUs de 24 GB o tarjetas profesionales, incluso cuantizado.

Cifras orientativas para el peso del modelo; el contexto suma VRAM aparte. Para tu combinación exacta de modelo, cuantización y longitud de contexto, usa la calculadora de VRAM para LLMs.

¿Cuánta calidad se pierde de verdad?

Q8: pérdida prácticamente imperceptible en cualquier uso. Si te cabe, es la opción conservadora.

Q4_K_M: el punto dulce. En chat, redacción y resumen la diferencia con el original es difícil de notar; en benchmarks públicos la caída suele ser de pocos puntos porcentuales. Es el nivel con el que se sirven la mayoría de despliegues locales.

Por debajo de Q4 (Q3, Q2): la degradación se acelera y deja de ser un buen trato — el modelo empieza a fallar en razonamiento de varios pasos, matemáticas y seguimiento de instrucciones largas, justo lo primero que sufre siempre con cuantizaciones agresivas. Antes de bajar de Q4, suele ser mejor idea pasar a un modelo más pequeño en Q4 o Q8.

Un caso especial son los modelos QAT (quantization-aware training), entrenados ya pensando en la cuantización — Gemma 3 los publica oficialmente — que aguantan Q4 con una pérdida aún menor que una cuantización a posteriori.

Review y comparativa

Qué cuantización elegir según tu GPU

8 GB de VRAM (RTX 3050, RTX 5050): modelos 7-8B en Q4_K_M. Es el punto de entrada — chat fluido y calidad digna sin tocar los 300-400 €.

16 GB de VRAM (RTX 5060 Ti 16 GB, RX 9060 XT 16 GB, RX 9070): el mejor salto calidad/precio de 2026. Un 14B en Q8, o un 27B en Q4 — con cualquiera de los dos, el nivel de razonamiento cambia de liga frente a los 8B.

24 GB (RTX 3090/4090 de segunda mano): la clase 30B en Q4 con contexto amplio, o un 14B en Q8 con margen para agentes y herramientas.

32 GB (RTX 5090): todo lo anterior con contexto muy largo, o modelos 32B en Q5/Q6 apurando calidad.

Cuantización en Ollama, en la práctica

Ollama gestiona la cuantización por ti: 'ollama pull qwen3:14b' descarga la variante Q4_K_M por defecto. Si quieres otro nivel, se indica en la etiqueta del modelo (por ejemplo ':14b-q8_0') — cada modelo lista sus variantes disponibles en la biblioteca de Ollama.

Consejo práctico: empieza con la Q4_K_M por defecto y sube a Q8 solo si detectas fallos de calidad en tu caso de uso concreto y te sobra VRAM. La VRAM que ahorres vale más invertida en contexto (conversaciones y documentos más largos) que en bits extra de precisión.

Productos de esta guía

Preguntas frecuentes

¿La cuantización hace más tonto al modelo?

En Q8 la pérdida es prácticamente nula y en Q4_K_M, muy pequeña — difícil de notar en chat y redacción. La degradación real empieza por debajo de Q4: falla antes el razonamiento en varios pasos que la conversación normal. Con Q4 o superior, la respuesta corta es: no de forma apreciable.

¿Qué significa Q4_K_M?

Cuantización de ~4 bits por peso en formato GGUF, variante 'K' (protege las capas más sensibles con más precisión) y tamaño 'M' (medio). Es el equilibrio estándar entre tamaño y calidad, y lo que Ollama descarga por defecto en la mayoría de modelos.

¿Cuánta VRAM ahorro cuantizando un modelo?

De FP16 a Q4 el modelo ocupa unas 3,5 veces menos: un 8B pasa de ~16 GB a ~5-6 GB; un 27B, de imposible en consumo a ~17 GB. Puedes calcular tu combinación exacta de modelo y cuantización con nuestra calculadora de VRAM.

¿Es mejor un modelo grande muy cuantizado o uno pequeño sin cuantizar?

Hasta Q4, casi siempre gana el grande: un 27B en Q4 rinde por encima de un 8B en Q8. Por debajo de Q4 la balanza se invierte — antes que un 70B en Q2, elige un 32B en Q4. La excepción son los modelos QAT, entrenados para aguantar cuantizaciones agresivas.

¿Qué es GGUF?

El formato de archivo con el que llama.cpp y Ollama empaquetan modelos cuantizados: pesos, tokenizador y metadatos en un único archivo. Es el estándar de facto de la IA local; los modelos de la biblioteca de Ollama y la mayoría de los de Hugging Face para uso local se distribuyen en GGUF.