Guía técnica · AIHARD

Qué GPU comprar para IA local en 2026: guía por VRAM y presupuesto

Comparativa 2026 de GPUs para correr LLMs en local: cuánta VRAM necesitas para cada modelo (de 8 a 32 GB), CUDA vs ROCm, ancho de banda y recomendaciones concretas por presupuesto desde 300 €.

Actualizado: 20 de agosto de 2026

¿Por qué la GPU es clave para correr IA localmente?

Los modelos de lenguaje actuales (Llama 3.3, Qwen3, Gemma 3, DeepSeek-R1, gpt-oss) mueven enormes cantidades de datos entre la memoria y los núcleos de cómputo. La GPU es el componente más crítico porque tiene miles de núcleos paralelos y una memoria de muy alta velocidad (VRAM) diseñada exactamente para esta carga de trabajo.

Una CPU puede correr modelos pequeños, pero será entre 10x y 50x más lenta que una GPU equivalente. Para inferencia en tiempo real o uso productivo, una GPU dedicada no es opcional.

VRAM: el parámetro más importante

La VRAM (memoria de vídeo) determina qué tamaño de modelo puedes cargar completamente en GPU. Un modelo que no cabe en VRAM se 'offloadea' a RAM o disco, reduciendo la velocidad drásticamente.

Reglas orientativas con la cuantización estándar de 2026 (Q4_K_M): un modelo 8B ocupa ~5-6 GB de VRAM; un 14B, ~9-10 GB; un 27B, ~16-18 GB; un 70B, ~40-45 GB. A eso hay que sumar el contexto (la 'memoria de trabajo' de la conversación): cuanto más largo, más VRAM extra. Puedes calcular tu caso exacto con nuestra calculadora de VRAM para LLMs.

La cuantización (Q4, Q5, Q8) reduce el tamaño del modelo a costa de algo de calidad. Con 16 GB de VRAM ya corres modelos de la clase 14B-27B cuantizados — el salto de calidad frente a los 8B es muy notable en razonamiento.

CUDA vs ROCm: ecosistema de software

La gran mayoría de frameworks de IA (PyTorch, llama.cpp, Ollama, ComfyUI) siguen optimizados para CUDA, la plataforma de NVIDIA. Las GPUs AMD usan ROCm, que en 2025-2026 ha dado un salto real: las RX 9000 (RDNA4) tienen soporte oficial desde ROCm 6.4, y Ollama y llama.cpp funcionan bien con ellas, especialmente en Linux.

Si priorizas máxima compatibilidad con cualquier herramienta: NVIDIA sigue siendo la opción segura. Si tu uso es Ollama/llama.cpp y quieres la máxima VRAM por euro: las AMD actuales de 16 GB son la mejor compra de 2026.

Comparativa por presupuesto (2026)

Entrada (300-420 €): RTX 3050 8 GB o RTX 5050 8 GB — modelos 7-8B cuantizados para empezar y aprender. Con 8 GB de VRAM no pases de esa clase de modelo.

Gama media, la mejor compra (450-600 €): RX 9060 XT 16 GB (la mayor VRAM por euro del mercado) o RTX 5060 Ti 16 GB (GDDR7 y ecosistema CUDA). Ojo: ambas existen también en versión de 8 GB — para IA elige SIEMPRE la de 16 GB, la diferencia de precio se paga sola.

Gama media-alta (750-900 €): RX 9070 o RX 9070 XT 16 GB — misma VRAM pero ~640 GB/s de ancho de banda, notablemente más tokens por segundo.

Alto rendimiento (1.200-1.400 €): RTX 5070 Ti 16 GB, con ~896 GB/s de ancho de banda GDDR7. Para 24 GB de VRAM, una RTX 3090 o 4090 de segunda mano sigue siendo la forma más barata de correr modelos de la clase 30B con holgura.

Tope de gama (2.300 €+): RTX 5090 32 GB — la referencia de consumidor en 2026, con ~1.800 GB/s. Para producción empresarial: GPUs de datacenter (H100, H200) o varias GPUs de consumidor en paralelo.

Otros factores a considerar

Ancho de banda de memoria: tan importante como la cantidad de VRAM, porque marca los tokens por segundo. Ejemplos 2026: RTX 5060 Ti ~448 GB/s, RX 9070 XT ~640 GB/s, RTX 5070 Ti ~896 GB/s, RTX 5090 ~1.800 GB/s. A igual VRAM, más ancho de banda = respuestas más rápidas.

Consumo eléctrico: una RTX 5090 puede superar los 500W bajo carga; una RX 9070 XT ronda los 300W y una RTX 5060 Ti los 180W. Dimensiona la fuente con margen (índice 80 Plus Gold y 200W por encima del consumo pico del equipo) y cuida la ventilación.

Multi-GPU: dos GPUs no dan el doble de velocidad de inferencia, pero permiten cargar modelos que no caben en una sola. Dos tarjetas de 16 GB son una alternativa real a una de 32 GB en presupuesto.

Preguntas frecuentes

¿Qué GPU necesito para correr Ollama en local?

Para modelos 7-8B basta una GPU de 8 GB (RTX 3050/5050). El punto dulce 2026 son las de 16 GB — RTX 5060 Ti 16 GB o RX 9060 XT 16 GB — que corren modelos de la clase 14B-27B cuantizados. Para la clase 30B con holgura, 24 GB (RTX 3090/4090 de segunda mano) o la RTX 5090 de 32 GB.

¿Sirve una GPU AMD para IA local?

Sí, y en 2026 más que nunca: las RX 9000 tienen soporte oficial de ROCm (desde la versión 6.4) y funcionan bien con Ollama y llama.cpp, sobre todo en Linux. La RX 9060 XT de 16 GB es la mayor VRAM por euro del mercado. Para PyTorch y frameworks avanzados, NVIDIA sigue ofreciendo la experiencia más pulida.

¿Cuánta VRAM necesito para modelos de IA?

Como regla general con cuantización Q4: 8 GB para modelos hasta 8B, 16 GB para la clase 14-27B, 24 GB para la clase 30B con holgura, y 48 GB o más para modelos 70B. Puedes afinar tu caso con nuestra calculadora de VRAM.

¿RTX 5060 Ti de 8 GB o de 16 GB para IA?

Siempre la de 16 GB. Para juegos la diferencia es discutible; para IA es determinante: con 8 GB te quedas en modelos 7-8B, con 16 GB entras en la clase 14-27B, donde la calidad de razonamiento cambia por completo. Lo mismo aplica a la RX 9060 XT.

¿Quieres que te lo montemos?

Te preparamos el equipo a medida: hardware, instalación y puesta en marcha de IA local. Sin compromiso.