Calculadora de VRAM y Hardware para IAs Locales (Ollama & LM Studio)

Calcula cuánta memoria VRAM necesitas para correr Llama 3, DeepSeek-R1 y Qwen 2.5 localmente según el contexto y la cuantización GGUF (Q4, Q8, FP16).

Calculadora de VRAM y Requisitos de Hardware para IAs Locales (Ollama & LM Studio)

Calcula con exactitud matemática cuánta memoria de tarjeta gráfica (VRAM) necesitas para ejecutar modelos abiertos (Llama 3, DeepSeek-R1, Qwen 2.5, Mistral). Calcula el peso de los tensores GGUF más el buffer KV Cache según el contexto deseado.

Ventana de Contexto (Tokens de memoria)8,192 tokens (~6144 palabras)
A mayor contexto, mayor memoria de KV Cache se reserva en la VRAM para no olvidar la conversación.
Memoria VRAM Necesaria
VRAM Total Requerida:Básica (8 GB)
6.74 GB
GPU mínima aconsejada: 8 GB VRAMContexto: 8k
Composición del consumo de VRAM:
Pesos del modelo (Tensores Q4_K_M):4.54 GB
Buffer KV Cache (8,192 tok):+1 GB
Overhead de pantalla y CUDA:+1.2 GB
Tarjetas gráficas recomendadas:
NVIDIA / AMD:
NVIDIA RTX 3060 8GBNVIDIA RTX 4060 8GBAMD Radeon RX 6600 8GB
Apple Mac (Memoria Unificada):

Cualquier Mac con chip M1 / M2 / M3 / M4 con 16 GB de RAM unificada.

¿Tu ordenador no tiene suficiente VRAM?

Puedes rentar una GPU en la nube (RTX 4090 o A100) en plataformas como RunPod o Vast.ai desde solo $0.20 a $0.35 USD / hora para correr modelos gigantes sin comprar nuevo hardware.

Preguntas Frecuentes

Para correr modelos ligeros (Llama 3.2 1B-3B) o modelos estándar de 8B en cuantización Q4_K_M, se necesitan al menos 6 a 8 GB de VRAM libre. Con una tarjeta de 8 GB o 12 GB (como una NVIDIA RTX 3060 12GB o RTX 4060) puedes ejecutar la mayoría de modelos cotidianos con total fluidez a más de 35 tokens por segundo.

Calculadoras y Herramientas Recomendadas

Herramientas afines del mismo clúster para complementar tus cálculos