Guía técnica · AIHARD
Requisitos de Ollama: mínimos, VRAM por modelo y cuánto ocupa (2026)
Requisitos de Ollama actualizados a 2026: mínimos sin GPU, qué corre con 8, 16, 24 o 32 GB de VRAM (Llama 3.3, Qwen3, Gemma 3, DeepSeek-R1, gpt-oss), cuánto pesa Ollama y cuánto ocupa cada modelo en disco, y qué hardware pide la llamada de herramientas (tool calling).
Actualizado: 31 de agosto de 2026
¿Qué es Ollama y por qué importa el hardware?
Ollama es la herramienta más popular para correr modelos de lenguaje grande (LLMs) en local, con soporte para las familias actuales: Llama 3.x, Qwen3, Gemma 3, DeepSeek-R1, gpt-oss (los pesos abiertos de OpenAI), Mistral y decenas más. Su facilidad de instalación, su app de escritorio y su API compatible con OpenAI lo convierten en la puerta de entrada al mundo de la IA local.
El rendimiento de Ollama depende casi exclusivamente del hardware: con la GPU correcta, la diferencia entre 5 tokens/segundo y 100 tokens/segundo marca la diferencia entre frustración y productividad.
Requisitos mínimos (solo CPU)
Ollama puede funcionar solo con CPU, sin GPU. Los requisitos mínimos son: cualquier CPU x86_64 o ARM64 moderna, 8 GB de RAM (16 GB recomendado) y 10-15 GB de espacio en disco para los primeros modelos.
El rendimiento en CPU es muy lento: pocos tokens por segundo en modelos 7-8B. Suficiente para experimentar, pero no para uso productivo.
Requisitos con GPU NVIDIA (recomendado)
Para rendimiento real con NVIDIA: drivers recientes con CUDA y una GPU con mínimo 8 GB de VRAM para trabajar cómodo con modelos 7-8B.
Configuraciones prácticas de 2026: RTX 3050/5050 8 GB → modelos 7-8B cuantizados a velocidad interactiva. RTX 5060 Ti 16 GB → Qwen3 14B con soltura y modelos de la clase 27B cuantizados (Gemma 3 27B, Mistral Small). RTX 5070 Ti 16 GB → lo mismo, bastante más rápido (~el doble de ancho de banda). 24 GB (RTX 3090/4090) → clase 30B con holgura de contexto; los 8B vuelan.
Requisitos con GPU AMD (ROCm)
Ollama soporta GPUs AMD vía ROCm. En 2026 el soporte cubre las RX 7000 y las RX 9000 (RDNA4, desde ROCm 6.4) — la RX 9060 XT de 16 GB es hoy una de las formas más baratas de conseguir VRAM suficiente para modelos medianos.
El rendimiento es comparable a NVIDIA en inferencia con Ollama y llama.cpp. Linux (Ubuntu LTS) sigue siendo la plataforma más fiable para ROCm; en Windows la compatibilidad depende del modelo concreto de GPU.
Tabla de modelos por VRAM disponible (2026)
4-6 GB VRAM: Llama 3.2 3B, Gemma 3 4B, Qwen3 4B (cuantizados). Para pruebas y tareas simples.
8-10 GB VRAM: Llama 3.1 8B, Qwen3 8B, DeepSeek-R1 8B (Q4). El punto de entrada real: chat fluido y calidad decente.
16 GB VRAM (RTX 5060 Ti 16 GB, RX 9060 XT/9070): Qwen3 14B holgado, Gemma 3 27B y Mistral Small 24B cuantizados, gpt-oss-20b. El salto de calidad grande por menos de 600 €.
24 GB VRAM (RTX 3090/4090): Qwen3 32B y la clase 30B con contexto amplio; Qwen3 30B-A3B (mezcla de expertos) a gran velocidad. Nivel suficiente para trabajo serio diario.
32 GB VRAM (RTX 5090): todo lo anterior con contexto muy largo y margen para embeddings o un segundo modelo cargado.
48+ GB VRAM (multi-GPU o GPUs profesionales): Llama 3.3 70B y modelos frontier abiertos (gpt-oss-120b en configuraciones grandes). Producción enterprise.
¿Cuánto pesa Ollama y cuánto ocupa cada modelo en disco?
Ollama en sí pesa poco: el instalador ronda 1 GB y la aplicación con su runtime ocupa entre 1 y 2 GB según el sistema. Lo que de verdad llena el disco son los modelos: cada uno se descarga completo y se queda en tu máquina.
En la cuantización Q4 que Ollama usa por defecto, los tamaños orientativos son: un modelo de 7-8B ocupa unos 4-5 GB (Llama 3.1 8B, Qwen3 8B), uno de 12-14B entre 8 y 10 GB, uno de 27-32B entre 17 y 20 GB (Gemma 3 27B, Qwen3 32B) y un 70B unos 40-43 GB (Llama 3.3 70B). Con dos o tres modelos instalados es fácil pasar de 50 GB, así que reserva al menos 100 GB de SSD si vas a experimentar — y que sea NVMe: la carga inicial del modelo a la GPU es lectura pura de disco.
Llamada de herramientas (tool calling) en Ollama: qué hardware pide
El tool calling (llamada de herramientas o function calling) permite que el modelo no solo responda texto: puede invocar funciones que tú defines — buscar en una base de datos, consultar una API, ejecutar una acción — y usar el resultado en su respuesta. Es la base de los agentes de IA y Ollama lo soporta de forma nativa en su API (parámetro 'tools', compatible con el formato de OpenAI).
No todos los modelos lo hacen igual de bien: en 2026, las familias con mejor tool calling en Ollama son Qwen3, Llama 3.x y gpt-oss. Los modelos por debajo de 8B cometen más errores eligiendo herramientas o formateando argumentos.
En hardware, el tool calling no pide una GPU distinta, pero sí más contexto: cada herramienta definida y cada resultado intermedio consumen ventana de contexto, y el contexto vive en VRAM (la caché KV). Para un uso con varias herramientas y conversaciones largas, recomendamos 16 GB de VRAM como base y modelos de 8B para arriba. Si montas agentes autónomos completos, mira nuestra guía de hardware para OpenClaw.
Productos de esta guía

694,99 €

853,99 €

423,99 €

891,99 €
Preguntas frecuentes
¿Qué GPU necesito para Ollama en 2026?
Para modelos 7-8B, cualquier GPU de 8 GB (RTX 3050/5050). El punto dulce son las de 16 GB — RTX 5060 Ti 16 GB o RX 9060 XT 16 GB — que abren la clase 14-27B. Para Llama 3.3 70B necesitas ~48 GB de VRAM total (dos GPUs de 24 GB o una profesional).
¿Cuáles son los requisitos mínimos de Ollama?
Sin GPU: una CPU x86_64 o ARM64 moderna, 8 GB de RAM (16 recomendado) y 10-15 GB de disco. Funciona, pero a pocos tokens por segundo — para uso real recomendamos una GPU de 8 GB o más.
¿Funciona Ollama sin GPU?
Sí, pero muy lento (pocos tokens por segundo en CPU). Para experimentar está bien; para uso productivo una GPU es imprescindible.
¿Cuánta RAM del sistema necesita Ollama?
Con GPU suficiente, 16 GB de RAM del sistema bastan. Si el modelo hace offload a RAM (porque no cabe en VRAM), necesitas tanta RAM como VRAM falte, más margen para el sistema operativo.
¿Soporta Ollama tool calling (llamada de herramientas)?
Sí, de forma nativa: la API de Ollama acepta el parámetro 'tools' con el mismo formato que OpenAI. Los modelos que mejor lo manejan son Qwen3, Llama 3.x y gpt-oss. Para agentes con varias herramientas, recomendamos 16 GB de VRAM: el contexto extra que consumen las herramientas vive en la memoria de la GPU.
¿Puedo correr Ollama en Windows?
Sí, Ollama tiene instalador y app de escritorio para Windows con soporte CUDA. El rendimiento es equivalente a Linux para inferencia con NVIDIA. Para GPUs AMD y multi-GPU, Linux ofrece mejor soporte.
¿Quieres que te lo montemos?
Te preparamos el equipo a medida: hardware, instalación y puesta en marcha de IA local. Sin compromiso.
Relacionado en AIHARD