Guía técnica · AIHARD
Cuantización de LLMs: qué es, cuánta VRAM ahorra y cuánta calidad pierdes
Q4, Q5, Q8, GGUF… explicado en claro: cómo la cuantización reduce un modelo de 19 GB a 6,6 GB, qué nivel elegir según tu GPU, tabla de VRAM por tamaño de modelo y qué se pierde de verdad por el camino.
Actualizado: 4 de octubre de 2026
Para empezar
¿Qué es la cuantización? La explicación sin matemáticas
Un modelo de lenguaje son miles de millones de números (los 'pesos'). De fábrica, cada número se guarda con mucha precisión — 16 bits — igual que una foto RAW guarda cada píxel con todo detalle. La cuantización es el equivalente a convertir esa foto a JPEG: guardas cada número con menos bits (8, 5, 4…) y el archivo pasa a ocupar una fracción, con una pérdida de calidad tan pequeña que en la mayoría de usos no se aprecia.
La consecuencia práctica es enorme: Qwen 3.5 9B, que en formato original (BF16) ocupa 19 GB, pasa a 6,6 GB en Q4. Es la diferencia entre necesitar una GPU profesional y correrlo en una tarjeta de consumo de 8 GB. La cuantización es el motivo por el que la IA local es viable en hardware normal.
En profundidad
Q4, Q5, Q8 y GGUF: descifrar los nombres
GGUF es el formato de archivo que usan llama.cpp y Ollama para distribuir modelos cuantizados. El sufijo indica el nivel: el número es la cantidad de bits por peso (Q8 = 8 bits, Q4 = 4 bits) — menos bits, menos VRAM y menos precisión.
Las variantes 'K' (Q4_K_M, Q5_K_S…) son cuantizaciones inteligentes: no aplican los mismos bits a todo el modelo, sino que protegen las capas más sensibles con más precisión. Q4_K_M es el estándar de facto de 2026 — el mejor equilibrio tamaño/calidad — y es lo que Ollama descarga por defecto en la mayoría de modelos. También verás formatos nuevos como MXFP4, con el que se distribuye gpt-oss.
Regla rápida de tamaño: en Q4 un modelo ocupa aproximadamente 0,6 GB por cada mil millones de parámetros (un 14B ≈ 9 GB); en Q8, ~1,1 GB por millardo (el mismo 14B ≈ 15 GB); en FP16 original, ~2,1 GB (≈ 30 GB). A eso se le suma siempre el contexto (caché KV), que crece con la longitud de la conversación.
Tabla: VRAM necesaria por modelo y nivel de cuantización
Cifras de la biblioteca de Ollama a octubre de 2026, sin contar el contexto.
Clase 9B (Qwen 3.5 9B): BF16 19 GB → Q8 11 GB → Q4 6,6 GB. En Q4 cabe en una GPU de 8 GB; en Q8, en una de 16 GB.
Clase 12B (Gemma 4 12B): BF16 24 GB → Q8 13 GB → Q4 8 GB. En Q4 funciona holgado en una GPU de 16 GB, y en Q8 también cabe.
Clase 27-31B (Qwen 3.6 27B, Gemma 4 31B): BF16 56-63 GB, fuera del alcance de consumo → Q8 unos 30 GB → Q4 17-20 GB. En Q4 no cabe en 16 GB con contexto útil: pide 24 GB, y con 32 GB va sobrado.
Modelos de 70B: Q4 ~42-45 GB. Territorio de dos GPUs de 24 GB o tarjetas profesionales, incluso cuantizado.
Cifras orientativas para el peso del modelo; el contexto suma VRAM aparte. Para tu combinación exacta de modelo, cuantización y longitud de contexto, usa la calculadora de VRAM para LLMs.
¿Cuánta calidad se pierde de verdad?
Q8: pérdida prácticamente imperceptible en cualquier uso. Si te cabe, es la opción conservadora.
Q4_K_M: el punto dulce. En chat, redacción y resumen la diferencia con el original es difícil de notar; en benchmarks públicos la caída suele ser de pocos puntos porcentuales. Es el nivel con el que se sirven la mayoría de despliegues locales.
Por debajo de Q4 (Q3, Q2): la degradación se acelera y deja de ser un buen trato — el modelo empieza a fallar en razonamiento de varios pasos, matemáticas y seguimiento de instrucciones largas, justo lo primero que sufre siempre con cuantizaciones agresivas. Antes de bajar de Q4, suele ser mejor idea pasar a un modelo más pequeño en Q4 o Q8.
Un caso especial son los modelos QAT (quantization-aware training), entrenados ya pensando en la cuantización — Gemma 3 y Gemma 4 los publican oficialmente — que aguantan Q4 con una pérdida aún menor que una cuantización a posteriori.
Review y comparativa
Qué cuantización elegir según tu GPU
8 GB de VRAM (RTX 3050, RTX 5050): modelos de hasta 9B en Q4_K_M (Qwen 3.5 9B, Gemma 4 E4B). Es el punto de entrada: chat fluido y calidad digna.
16 GB de VRAM (RTX 5060 Ti 16 GB, RX 9060 XT 16 GB, RX 9070): el mejor salto calidad/precio de 2026. Un 12B en Q8, o gpt-oss-20b en su formato nativo (14 GB). Los densos de 27-31B en Q4 ocupan 17-20 GB y no caben con contexto útil: para ellos, 24 GB.
24 GB (RTX 3090 de segunda mano): los densos de 27-31B en Q4 (Qwen 3.6 27B, Gemma 4 31B) con contexto amplio, o un 12B en Q8 con margen para agentes y herramientas.
32 GB (RTX 5090, Radeon AI PRO R9700, Arc Pro B70): todo lo anterior con contexto muy largo, o los de 27-31B en Q5/Q6 apurando calidad.
Cuantización en Ollama, en la práctica
Ollama gestiona la cuantización por ti: 'ollama pull qwen3:14b' descarga la variante Q4_K_M por defecto. Si quieres otro nivel, se indica en la etiqueta del modelo (por ejemplo ':14b-q8_0') — cada modelo lista sus variantes disponibles en la biblioteca de Ollama.
Consejo práctico: empieza con la Q4_K_M por defecto y sube a Q8 solo si detectas fallos de calidad en tu caso de uso concreto y te sobra VRAM. La VRAM que ahorres vale más invertida en contexto (conversaciones y documentos más largos) que en bits extra de precisión.
Preguntas frecuentes
¿La cuantización hace más tonto al modelo?
En Q8 la pérdida es prácticamente nula y en Q4_K_M, muy pequeña — difícil de notar en chat y redacción. La degradación real empieza por debajo de Q4: falla antes el razonamiento en varios pasos que la conversación normal. Con Q4 o superior, la respuesta corta es: no de forma apreciable.
¿Qué significa Q4_K_M?
Cuantización de ~4 bits por peso en formato GGUF, variante 'K' (protege las capas más sensibles con más precisión) y tamaño 'M' (medio). Es el equilibrio estándar entre tamaño y calidad, y lo que Ollama descarga por defecto en la mayoría de modelos.
¿Cuánta VRAM ahorro cuantizando un modelo?
De FP16 a Q4 el modelo ocupa unas 3,5 veces menos: Qwen 3.5 9B pasa de 19 GB a 6,6 GB; Qwen 3.6 27B, de 56 GB (imposible en consumo) a 17 GB. Puedes calcular tu combinación exacta de modelo y cuantización con nuestra calculadora de VRAM.
¿Es mejor un modelo grande muy cuantizado o uno pequeño sin cuantizar?
Hasta Q4, casi siempre gana el grande: un 27B en Q4 rinde por encima de un 9B en Q8. Por debajo de Q4 la balanza se invierte — antes que un 70B en Q2, elige un 27-31B en Q4. La excepción son los modelos QAT, entrenados para aguantar cuantizaciones agresivas.
¿Qué es GGUF?
El formato de archivo con el que llama.cpp y Ollama empaquetan modelos cuantizados: pesos, tokenizador y metadatos en un único archivo. Es el estándar de facto de la IA local; los modelos de la biblioteca de Ollama y la mayoría de los de Hugging Face para uso local se distribuyen en GGUF.
¿Quieres que te lo montemos?
Te preparamos el equipo a medida: hardware, instalación y puesta en marcha de IA local. Sin compromiso.
Relacionado en AIHARD