Saltar al contenido

Mejor GPU para modelos LLM locales

Ejecutar LLM de forma local requiere emparejar los presupuestos de VRAM con los niveles de cuantización y los tamaños de contexto. Utiliza nuestra calculadora en vivo a continuación para estimar el uso de memoria y explorar las guías específicas de cada modelo.

Ver guías de modelos LLM

Alibaba Qwen

Qwen3.8-27B

dense

Un modelo visión-lenguaje denso de 27B cuya atención lineal híbrida mantiene minúscula la caché KV: ejecuta un contexto de 128k+ en una sola tarjeta de 16-24 GB, con ventana nativa de 262k ampliable a 1M.

Parámetros
27B
Activos
27B
Contexto máx.
128k
Ver detalles de modelo y GPU
DeepSeek

DeepSeek-V4-Flash

moe

Un modelo Mixture-of-Experts de 284B con solo 13B de parámetros activos y un contexto de 1M de tokens. Sus pesos requieren varias GPU o descarga a CPU, pero solo se activan 13B por token, así que la generación sigue siendo rápida.

Parámetros
284B
Activos
13B
Contexto máx.
128k
Ver detalles de modelo y GPU
OpenAI

gpt-oss-120b

moe

El modelo Mixture-of-Experts de pesos abiertos de 117B de OpenAI con 5,1B de parámetros activos. Sus pesos nativos MXFP4 caben en una sola GPU de 80-96 GB, y el bajo número de parámetros activos mantiene rápida la generación.

Parámetros
117B
Activos
5.1B
Contexto máx.
32k
Ver detalles de modelo y GPU
Alibaba Qwen

Qwen3.6-Coder-27B

dense

Modelo denso de última generación con profunda comprensión de matemáticas, programación e ingeniería.

Parámetros
27B
Activos
27B
Contexto máx.
32k
Ver detalles de modelo y GPU
Alibaba Qwen

Qwen3.6-35B-A3B

moe

Masivo codificador Mixture-of-Experts optimizado para configuraciones con un objetivo de VRAM de 16GB a 24GB.

Parámetros
35B
Activos
3B
Contexto máx.
32k
Ver detalles de modelo y GPU
Google

Gemma 4 26B-A4B

moe

El modelo MoE de alta densidad de Google diseñado para programación y razonamiento complejos.

Parámetros
26B
Activos
4B
Contexto máx.
64k
Ver detalles de modelo y GPU
Google

Gemma 4 12B

dense

Modelo denso ligero y de alta velocidad, optimizado para configuraciones de consumo estándar.

Parámetros
12B
Activos
12B
Contexto máx.
64k
Ver detalles de modelo y GPU
DeepSeek

DeepSeek-R1-Distill-14B

dense

Razonamiento de primer nivel destilado en un modelo compacto de 14B. Sólido rendimiento en STEM y programación en cualquier GPU de 12GB+.

Parámetros
14B
Activos
14B
Contexto máx.
32k
Ver detalles de modelo y GPU
DeepSeek

DeepSeek-R1-Distill-32B

dense

Potencia de razonamiento de tamaño medio para tarjetas de 24GB. Igual al nivel de los modelos de frontera en matemáticas, programación y lógica.

Parámetros
32B
Activos
32B
Contexto máx.
32k
Ver detalles de modelo y GPU
Mistral AI

Mistral Small 3.1 24B

dense

Modelo denso y eficiente con soporte multilingüe amplio y llamadas a funciones nativas. Cabe en tarjetas de 16GB en Q4.

Parámetros
24B
Activos
24B
Contexto máx.
128k
Ver detalles de modelo y GPU
Meta

Llama 4 Scout 109B-A17B

moe

El buque insignia MoE más accesible de Meta: 17B de parámetros activos ofrecen una sólida calidad en hardware de estación de trabajo.

Parámetros
109B
Activos
17B
Contexto máx.
64k
Ver detalles de modelo y GPU
Tencent

Hy-MT2-7B

dense

Modelo denso de 7B versátil, diseñado para una inferencia local eficiente en GPUs de gama de entrada a media.

Parámetros
7B
Activos
7B
Contexto máx.
32k
Ver detalles de modelo y GPU
OpenAI

gpt-oss-20b

dense

Modelo de razonamiento de consumo de OpenAI, diseñado para ejecutarse sin compromisos en hardware local estándar.

Parámetros
20B
Activos
20B
Contexto máx.
32k
Ver detalles de modelo y GPU
NVIDIA

NVIDIA Nemotron-3-Nano-4B

dense

Modelo NVIDIA de 4B ultracompacto que cabe cómodamente en casi cualquier GPU moderna: ideal para configuraciones edge y portátiles.

Parámetros
4B
Activos
4B
Contexto máx.
32k
Ver detalles de modelo y GPU
Alibaba Qwen

Qwen3-Next-80B-A3B

moe

Enorme Mixture-of-Experts de 80B con solo 3B de parámetros activos — requiere una tarjeta de estación de trabajo de 48GB, pero genera tan rápido como un modelo pequeño.

Parámetros
80B
Activos
3B
Contexto máx.
32k
Ver detalles de modelo y GPU

GPUs para configuración de modelo personalizada

27B
3B14B27B35B70B+
32k tokens
8k32k64k96k128k

Estimación de memoria

VRAM19 GB
Pesos: 15.5GB
KV: 3.5 GB

Preguntas frecuentes

Preguntas comunes sobre la elección de una GPU para la inferencia de LLM locales.