Saltar al contenido

Mejor GPU para modelos LLM locales

Ejecutar LLM de forma local requiere emparejar los presupuestos de VRAM con los niveles de cuantización y los tamaños de contexto. Utiliza nuestra calculadora en vivo a continuación para estimar el uso de memoria y explorar las guías específicas de cada modelo.

Ver guías de modelos LLM

Alibaba Qwen

Qwen3.8-27B

dense

Un modelo visión-lenguaje denso de 27B cuya atención lineal híbrida mantiene minúscula la caché KV: ejecuta un contexto de 128k+ en una sola tarjeta de 16-24 GB, con ventana nativa de 262k ampliable a 1M.

Parámetros
27B
Activos
27B
Contexto máx.
128k
Ver detalles de modelo y GPU
DeepSeek

DeepSeek-V4-Flash

moe

Un modelo Mixture-of-Experts de 284B con solo 13B de parámetros activos y un contexto de 1M de tokens. Sus pesos requieren varias GPU o descarga a CPU, pero solo se activan 13B por token, así que la generación sigue siendo rápida.

Parámetros
284B
Activos
13B
Contexto máx.
128k
Ver detalles de modelo y GPU
OpenAI

gpt-oss-120b

moe

El modelo Mixture-of-Experts de pesos abiertos de 117B de OpenAI con 5,1B de parámetros activos. Sus pesos nativos MXFP4 caben en una sola GPU de 80-96 GB, y el bajo número de parámetros activos mantiene rápida la generación.

Parámetros
117B
Activos
5.1B
Contexto máx.
32k
Ver detalles de modelo y GPU
Alibaba Qwen

Qwen3.6-Coder-27B

dense

Modelo denso de última generación con profunda comprensión de matemáticas, programación e ingeniería.

Parámetros
27B
Activos
27B
Contexto máx.
32k
Ver detalles de modelo y GPU
Alibaba Qwen

Qwen3.6-35B-A3B

moe

Masivo codificador Mixture-of-Experts optimizado para configuraciones con un objetivo de VRAM de 16GB a 24GB.

Parámetros
35B
Activos
3B
Contexto máx.
32k
Ver detalles de modelo y GPU
Google

Gemma 4 26B-A4B

moe

El modelo MoE de alta densidad de Google diseñado para programación y razonamiento complejos.

Parámetros
26B
Activos
4B
Contexto máx.
64k
Ver detalles de modelo y GPU
Google

Gemma 4 12B

dense

Modelo denso ligero y de alta velocidad, optimizado para configuraciones de consumo estándar.

Parámetros
12B
Activos
12B
Contexto máx.
64k
Ver detalles de modelo y GPU
DeepSeek

DeepSeek-R1-Distill-14B

dense

Razonamiento de primer nivel destilado en un modelo compacto de 14B. Sólido rendimiento en STEM y programación en cualquier GPU de 12GB+.

Parámetros
14B
Activos
14B
Contexto máx.
32k
Ver detalles de modelo y GPU
DeepSeek

DeepSeek-R1-Distill-32B

dense

Potencia de razonamiento de tamaño medio para tarjetas de 24GB. Igual al nivel de los modelos de frontera en matemáticas, programación y lógica.

Parámetros
32B
Activos
32B
Contexto máx.
32k
Ver detalles de modelo y GPU
Mistral AI

Mistral Small 3.1 24B

dense

Modelo denso y eficiente con soporte multilingüe amplio y llamadas a funciones nativas. Cabe en tarjetas de 16GB en Q4.

Parámetros
24B
Activos
24B
Contexto máx.
128k
Ver detalles de modelo y GPU
Meta

Llama 4 Scout 109B-A17B

moe

El buque insignia MoE más accesible de Meta: 17B de parámetros activos ofrecen una sólida calidad en hardware de estación de trabajo.

Parámetros
109B
Activos
17B
Contexto máx.
64k
Ver detalles de modelo y GPU
Tencent

Hy-MT2-7B

dense

Modelo denso de 7B versátil, diseñado para una inferencia local eficiente en GPUs de gama de entrada a media.

Parámetros
7B
Activos
7B
Contexto máx.
32k
Ver detalles de modelo y GPU
OpenAI

gpt-oss-20b

dense

Modelo de razonamiento de consumo de OpenAI, diseñado para ejecutarse sin compromisos en hardware local estándar.

Parámetros
20B
Activos
20B
Contexto máx.
32k
Ver detalles de modelo y GPU
NVIDIA

NVIDIA Nemotron-3-Nano-4B

dense

Modelo NVIDIA de 4B ultracompacto que cabe cómodamente en casi cualquier GPU moderna: ideal para configuraciones edge y portátiles.

Parámetros
4B
Activos
4B
Contexto máx.
32k
Ver detalles de modelo y GPU
Alibaba Qwen

Qwen3-Next-80B-A3B

moe

Enorme Mixture-of-Experts de 80B con solo 3B de parámetros activos — requiere una tarjeta de estación de trabajo de 48GB, pero genera tan rápido como un modelo pequeño.

Parámetros
80B
Activos
3B
Contexto máx.
32k
Ver detalles de modelo y GPU

GPUs para configuración de modelo personalizada

27B
3B14B27B35B70B+
32k tokens
8k32k64k96k128k

Estimación de memoria

VRAM19 GB
Pesos: 15.5GB
KV: 3.5 GB

Preguntas frecuentes

Preguntas comunes sobre la elección de una GPU para la inferencia de LLM locales.

¿Cuánta VRAM necesito realmente para un LLM local en 2026?

Depende del tamaño del modelo y de la cuantización. Un modelo 12B en Q4 cabe en unos 7–8 GB, por lo que una tarjeta de 12GB es viable. Para modelos de 26–27B necesitas de 14–18 GB; una tarjeta de 16GB es la opción ideal. Modelos más grandes de 70B+ necesitan entre 40–80 GB, lo que requiere múltiples GPU o tarjetas de estación de trabajo de gama alta.

¿Qué es la descarga a CPU (offloading) y por qué es lenta?

La descarga a CPU traslada las capas que no caben en la VRAM a la memoria RAM del sistema. El ancho de banda de la RAM del sistema es de 40–80 GB/s, entre 10 y 20 veces más lento que la memoria de la GPU. Para una inferencia fluida, mantén todo el modelo cuantizado en la VRAM.

¿Qué significa la cuantización Q4_K_M o Q8_0?

La cuantización reduce el peso de cada parámetro del modelo de 16 bits a menos bits para ahorrar memoria. Q4_K_M utiliza aproximadamente 4 bits por peso, cerca de la mitad de la VRAM de FP16 con una pérdida de calidad mínima. Q8_0 utiliza 8 bits, ofreciendo una calidad casi sin pérdidas pero requiriendo aproximadamente el doble de VRAM.

¿Qué es un modelo MoE y por qué se ejecuta más rápido de lo que sugiere su tamaño?

Los modelos de Mezcla de Expertos (MoE) tienen una gran cantidad total de parámetros pero solo activan un pequeño subconjunto por cada token. Esto significa que el cálculo de la inferencia y la caché KV escalan con el recuento de parámetros activos, no con el total, por lo que un modelo MoE de 26B puede ejecutarse más rápido que un modelo denso de 7B en el hardware adecuado.

¿Debería elegir una tarjeta GeForce para consumo o una tarjeta de estación de trabajo (workstation)?

Las tarjetas de consumo ofrecen la mejor relación precio-por-GB de VRAM para capacidades estándar de gaming (8–24 GB). Las tarjetas de estación de trabajo ofrecen mayor capacidad de VRAM (32–96 GB) y memoria ECC a un precio significativamente mayor. Elige consumo si tu modelo cabe en 24 GB; opta por estación de trabajo si necesitas 32 GB+.

¿Puedo ejecutar un LLM local en una GPU AMD?

Sí. ROCm es compatible con llama.cpp y Ollama en Linux, y cada vez más en Windows. La Radeon RX 7900 XTX (24 GB) y la Radeon PRO W7900 (48 GB) son opciones sólidas. El rendimiento es comparable al de las tarjetas NVIDIA equivalentes para cargas de trabajo de inferencia.

¿Puedo ejecutar un LLM local en una GPU Intel Arc?

Sí. Las GPU Intel Arc (como la A770 de 16GB) pueden ejecutar LLM locales utilizando la extensión IPEX (Intel Extension for PyTorch) o el motor OpenVINO, compatibles con llama.cpp y Ollama. La A770 de 16GB es una de las opciones más asequibles de 16GB de VRAM en el mercado, ofreciendo un rendimiento de inferencia sólido para presupuestos ajustados, aunque la configuración puede ser un poco más compleja en comparación con NVIDIA CUDA.