Guía técnica · AIHARD

Requisitos de Ollama: mínimos, VRAM por modelo y cuánto ocupa (2026)

Requisitos de Ollama actualizados a 2026: mínimos sin GPU, qué corre con 8, 16, 24 o 32 GB de VRAM (Llama 3.3, Qwen3, Gemma 3, DeepSeek-R1, gpt-oss), cuánto pesa Ollama y cuánto ocupa cada modelo en disco, y qué hardware pide la llamada de herramientas (tool calling).

Actualizado: 31 de agosto de 2026

¿Qué es Ollama y por qué importa el hardware?

Ollama es la herramienta más popular para correr modelos de lenguaje grande (LLMs) en local, con soporte para las familias actuales: Llama 3.x, Qwen3, Gemma 3, DeepSeek-R1, gpt-oss (los pesos abiertos de OpenAI), Mistral y decenas más. Su facilidad de instalación, su app de escritorio y su API compatible con OpenAI lo convierten en la puerta de entrada al mundo de la IA local.

El rendimiento de Ollama depende casi exclusivamente del hardware: con la GPU correcta, la diferencia entre 5 tokens/segundo y 100 tokens/segundo marca la diferencia entre frustración y productividad.

Requisitos mínimos (solo CPU)

Ollama puede funcionar solo con CPU, sin GPU. Los requisitos mínimos son: cualquier CPU x86_64 o ARM64 moderna, 8 GB de RAM (16 GB recomendado) y 10-15 GB de espacio en disco para los primeros modelos.

El rendimiento en CPU es muy lento: pocos tokens por segundo en modelos 7-8B. Suficiente para experimentar, pero no para uso productivo.

Requisitos con GPU NVIDIA (recomendado)

Para rendimiento real con NVIDIA: drivers recientes con CUDA y una GPU con mínimo 8 GB de VRAM para trabajar cómodo con modelos 7-8B.

Configuraciones prácticas de 2026: RTX 3050/5050 8 GB → modelos 7-8B cuantizados a velocidad interactiva. RTX 5060 Ti 16 GB → Qwen3 14B con soltura y modelos de la clase 27B cuantizados (Gemma 3 27B, Mistral Small). RTX 5070 Ti 16 GB → lo mismo, bastante más rápido (~el doble de ancho de banda). 24 GB (RTX 3090/4090) → clase 30B con holgura de contexto; los 8B vuelan.

Requisitos con GPU AMD (ROCm)

Ollama soporta GPUs AMD vía ROCm. En 2026 el soporte cubre las RX 7000 y las RX 9000 (RDNA4, desde ROCm 6.4) — la RX 9060 XT de 16 GB es hoy una de las formas más baratas de conseguir VRAM suficiente para modelos medianos.

El rendimiento es comparable a NVIDIA en inferencia con Ollama y llama.cpp. Linux (Ubuntu LTS) sigue siendo la plataforma más fiable para ROCm; en Windows la compatibilidad depende del modelo concreto de GPU.

Tabla de modelos por VRAM disponible (2026)

4-6 GB VRAM: Llama 3.2 3B, Gemma 3 4B, Qwen3 4B (cuantizados). Para pruebas y tareas simples.

8-10 GB VRAM: Llama 3.1 8B, Qwen3 8B, DeepSeek-R1 8B (Q4). El punto de entrada real: chat fluido y calidad decente.

16 GB VRAM (RTX 5060 Ti 16 GB, RX 9060 XT/9070): Qwen3 14B holgado, Gemma 3 27B y Mistral Small 24B cuantizados, gpt-oss-20b. El salto de calidad grande por menos de 600 €.

24 GB VRAM (RTX 3090/4090): Qwen3 32B y la clase 30B con contexto amplio; Qwen3 30B-A3B (mezcla de expertos) a gran velocidad. Nivel suficiente para trabajo serio diario.

32 GB VRAM (RTX 5090): todo lo anterior con contexto muy largo y margen para embeddings o un segundo modelo cargado.

48+ GB VRAM (multi-GPU o GPUs profesionales): Llama 3.3 70B y modelos frontier abiertos (gpt-oss-120b en configuraciones grandes). Producción enterprise.

¿Cuánto pesa Ollama y cuánto ocupa cada modelo en disco?

Ollama en sí pesa poco: el instalador ronda 1 GB y la aplicación con su runtime ocupa entre 1 y 2 GB según el sistema. Lo que de verdad llena el disco son los modelos: cada uno se descarga completo y se queda en tu máquina.

En la cuantización Q4 que Ollama usa por defecto, los tamaños orientativos son: un modelo de 7-8B ocupa unos 4-5 GB (Llama 3.1 8B, Qwen3 8B), uno de 12-14B entre 8 y 10 GB, uno de 27-32B entre 17 y 20 GB (Gemma 3 27B, Qwen3 32B) y un 70B unos 40-43 GB (Llama 3.3 70B). Con dos o tres modelos instalados es fácil pasar de 50 GB, así que reserva al menos 100 GB de SSD si vas a experimentar — y que sea NVMe: la carga inicial del modelo a la GPU es lectura pura de disco.

Llamada de herramientas (tool calling) en Ollama: qué hardware pide

El tool calling (llamada de herramientas o function calling) permite que el modelo no solo responda texto: puede invocar funciones que tú defines — buscar en una base de datos, consultar una API, ejecutar una acción — y usar el resultado en su respuesta. Es la base de los agentes de IA y Ollama lo soporta de forma nativa en su API (parámetro 'tools', compatible con el formato de OpenAI).

No todos los modelos lo hacen igual de bien: en 2026, las familias con mejor tool calling en Ollama son Qwen3, Llama 3.x y gpt-oss. Los modelos por debajo de 8B cometen más errores eligiendo herramientas o formateando argumentos.

En hardware, el tool calling no pide una GPU distinta, pero sí más contexto: cada herramienta definida y cada resultado intermedio consumen ventana de contexto, y el contexto vive en VRAM (la caché KV). Para un uso con varias herramientas y conversaciones largas, recomendamos 16 GB de VRAM como base y modelos de 8B para arriba. Si montas agentes autónomos completos, mira nuestra guía de hardware para OpenClaw.

Productos de esta guía

Preguntas frecuentes

¿Qué GPU necesito para Ollama en 2026?

Para modelos 7-8B, cualquier GPU de 8 GB (RTX 3050/5050). El punto dulce son las de 16 GB — RTX 5060 Ti 16 GB o RX 9060 XT 16 GB — que abren la clase 14-27B. Para Llama 3.3 70B necesitas ~48 GB de VRAM total (dos GPUs de 24 GB o una profesional).

¿Cuáles son los requisitos mínimos de Ollama?

Sin GPU: una CPU x86_64 o ARM64 moderna, 8 GB de RAM (16 recomendado) y 10-15 GB de disco. Funciona, pero a pocos tokens por segundo — para uso real recomendamos una GPU de 8 GB o más.

¿Funciona Ollama sin GPU?

Sí, pero muy lento (pocos tokens por segundo en CPU). Para experimentar está bien; para uso productivo una GPU es imprescindible.

¿Cuánta RAM del sistema necesita Ollama?

Con GPU suficiente, 16 GB de RAM del sistema bastan. Si el modelo hace offload a RAM (porque no cabe en VRAM), necesitas tanta RAM como VRAM falte, más margen para el sistema operativo.

¿Soporta Ollama tool calling (llamada de herramientas)?

Sí, de forma nativa: la API de Ollama acepta el parámetro 'tools' con el mismo formato que OpenAI. Los modelos que mejor lo manejan son Qwen3, Llama 3.x y gpt-oss. Para agentes con varias herramientas, recomendamos 16 GB de VRAM: el contexto extra que consumen las herramientas vive en la memoria de la GPU.

¿Puedo correr Ollama en Windows?

Sí, Ollama tiene instalador y app de escritorio para Windows con soporte CUDA. El rendimiento es equivalente a Linux para inferencia con NVIDIA. Para GPUs AMD y multi-GPU, Linux ofrece mejor soporte.

¿Quieres que te lo montemos?

Te preparamos el equipo a medida: hardware, instalación y puesta en marcha de IA local. Sin compromiso.