Herramienta gratuita

¿Cuánta VRAM necesitas para tu modelo de IA?

Elige el modelo que quieres ejecutar, la cuantización y el contexto. Te decimos cuánta memoria de GPU hace falta y qué configuración lo cubre — sin vendedores de por medio.

El más usado: mejor relación calidad/VRAM.

50.3GBde VRAM para Llama 3.3 70B en Q4_K_M
  • Pesos del modelo42 GB
  • Caché KV (contexto)2.5 GB
  • Activaciones y CUDA5.8 GB

64 GB — dos GPU de 32 GB

El escalón habitual para servir un 70B cuantizado. Necesita placa con dos ranuras PCIe de tamaño completo y una fuente dimensionada para ambas tarjetas.

Estimación con un margen aproximado del 10%. La cifra exacta depende de la implementación de atención del modelo y del motor de inferencia que uses. Calculado para inferencia: entrenar o hacer fine-tuning multiplica estos requisitos.

Cómo se calcula la VRAM de un modelo

La memoria que ocupa un modelo de lenguaje en la GPU se reparte en tres partes, y conviene entenderlas porque cada una se optimiza de forma distinta.

Los pesos son la parte mayor y se calculan multiplicando el número de parámetros por los bits de cada uno, divididos entre ocho. Un modelo de 70.000 millones de parámetros a 4,8 bits ocupa unos 42 GB solo en pesos. Es la parte sobre la que actúa la cuantización.

La caché KV guarda la representación interna de cada token del contexto y crece de forma lineal con él. Es la partida que más se subestima: en un modelo de 70B, pasar de 8K a 128K de contexto añade más de 35 GB.

Las activaciones y el contexto de CUDA suman aproximadamente un 12% de los pesos más un fijo de en torno a 0,8 GB que reserva el propio driver.

Los modelos actuales usan atención agrupada (GQA), que reduce mucho la caché KV frente a los diseños antiguos. Por eso no basta con estimarla a partir del número de parámetros: esta calculadora usa la configuración real de cada modelo.

VRAM necesaria para los modelos más usados

Estimaciones para inferencia, con el contexto indicado en cada fila.

ModeloCuantizaciónContextoVRAMConfiguración
Llama 3.1 8BQ4_K_M8K7.2 GBUna GPU de 8 GB
Llama 3.1 8BFP16 / BF168K19.7 GBUna GPU de 24 GB
Qwen 2.5 14BQ4_K_M8K11.7 GBUna GPU de 12 GB
Gemma 2 27BQ4_K_M8K21.2 GBUna GPU de 24 GB
Qwen 2.5 32BQ4_K_M8K24.3 GBUna GPU de 32 GB
DeepSeek-R1 Distill 32BQ4_K_M32K30.3 GBUna GPU de 32 GB
Mixtral 8x7B (MoE)Q4_K_M8K33.2 GB48 GB — dos GPU de 24 GB o una profesional
Llama 3.3 70BQ4_K_M8K50.3 GB64 GB — dos GPU de 32 GB
Llama 3.3 70BQ8_08K86.6 GB96 GB — configuración profesional
Qwen 2.5 72BFP16 / BF168K164.6 GBServidor multi-GPU

Preguntas frecuentes

¿Cuánta VRAM necesito para ejecutar Llama 70B en local?

Con cuantización Q4_K_M y 8K de contexto, Llama 3.3 70B necesita unos 50 GB de VRAM. Eso implica dos GPU de 24 GB o una profesional de 48 GB ajustada. En FP16 sin cuantizar se va por encima de 150 GB, territorio de servidor multi-GPU.

¿Qué es la cuantización y cuánta calidad pierdo?

Cuantizar es almacenar los pesos del modelo con menos bits: en vez de 16 bits por parámetro, 8, 6 o 4. Q8 es prácticamente indistinguible del original y Q4_K_M es el equilibrio más usado, con una pérdida de calidad pequeña frente a un ahorro de VRAM de más del 70%. Por debajo de Q4 la degradación ya se nota.

¿Por qué el contexto consume VRAM?

El modelo guarda una caché KV con la representación interna de cada token del contexto, y esa caché vive en la VRAM junto a los pesos. Cuanto más largo el contexto, más caché. En un modelo de 70B, pasar de 8K a 128K de contexto puede añadir más de 35 GB.

¿Puedo usar la RAM del sistema si no me cabe en la GPU?

Sí, tanto llama.cpp como Ollama permiten repartir capas entre GPU y CPU, pero el rendimiento cae en picado: la memoria del sistema tiene un ancho de banda muy inferior al de la VRAM. Sirve para probar un modelo, no para usarlo a diario.

¿Estos cálculos valen para entrenar o hacer fine-tuning?

No. Esta calculadora estima la inferencia. Entrenar exige guardar además gradientes y estados del optimizador, lo que multiplica los requisitos por tres o cuatro. Para fine-tuning con LoRA la cifra es más contenida, pero sigue estando por encima de la de inferencia.

¿Es mejor una GPU grande o varias pequeñas?

Para inferencia, una sola GPU con la VRAM suficiente siempre rinde mejor: repartir un modelo entre varias tarjetas añade latencia de comunicación por PCIe. Varias GPU tienen sentido cuando el modelo no cabe de ninguna manera en una, o cuando quieres servir varias peticiones en paralelo.

Seguir leyendo