Mejor GPU para modelos LLM locales
Ejecutar LLM de forma local requiere emparejar los presupuestos de VRAM con los niveles de cuantización y los tamaños de contexto. Utiliza nuestra calculadora en vivo a continuación para estimar el uso de memoria y explorar las guías específicas de cada modelo.
Ver guías de modelos LLM
Qwen3.8-27B
Un modelo visión-lenguaje denso de 27B cuya atención lineal híbrida mantiene minúscula la caché KV: ejecuta un contexto de 128k+ en una sola tarjeta de 16-24 GB, con ventana nativa de 262k ampliable a 1M.
DeepSeek-V4-Flash
Un modelo Mixture-of-Experts de 284B con solo 13B de parámetros activos y un contexto de 1M de tokens. Sus pesos requieren varias GPU o descarga a CPU, pero solo se activan 13B por token, así que la generación sigue siendo rápida.
gpt-oss-120b
El modelo Mixture-of-Experts de pesos abiertos de 117B de OpenAI con 5,1B de parámetros activos. Sus pesos nativos MXFP4 caben en una sola GPU de 80-96 GB, y el bajo número de parámetros activos mantiene rápida la generación.
Qwen3.6-Coder-27B
Modelo denso de última generación con profunda comprensión de matemáticas, programación e ingeniería.
Qwen3.6-35B-A3B
Masivo codificador Mixture-of-Experts optimizado para configuraciones con un objetivo de VRAM de 16GB a 24GB.
Gemma 4 26B-A4B
El modelo MoE de alta densidad de Google diseñado para programación y razonamiento complejos.
Gemma 4 12B
Modelo denso ligero y de alta velocidad, optimizado para configuraciones de consumo estándar.
DeepSeek-R1-Distill-14B
Razonamiento de primer nivel destilado en un modelo compacto de 14B. Sólido rendimiento en STEM y programación en cualquier GPU de 12GB+.
DeepSeek-R1-Distill-32B
Potencia de razonamiento de tamaño medio para tarjetas de 24GB. Igual al nivel de los modelos de frontera en matemáticas, programación y lógica.
Mistral Small 3.1 24B
Modelo denso y eficiente con soporte multilingüe amplio y llamadas a funciones nativas. Cabe en tarjetas de 16GB en Q4.
Llama 4 Scout 109B-A17B
El buque insignia MoE más accesible de Meta: 17B de parámetros activos ofrecen una sólida calidad en hardware de estación de trabajo.
Hy-MT2-7B
Modelo denso de 7B versátil, diseñado para una inferencia local eficiente en GPUs de gama de entrada a media.
gpt-oss-20b
Modelo de razonamiento de consumo de OpenAI, diseñado para ejecutarse sin compromisos en hardware local estándar.
NVIDIA Nemotron-3-Nano-4B
Modelo NVIDIA de 4B ultracompacto que cabe cómodamente en casi cualquier GPU moderna: ideal para configuraciones edge y portátiles.
Qwen3-Next-80B-A3B
Enorme Mixture-of-Experts de 80B con solo 3B de parámetros activos — requiere una tarjeta de estación de trabajo de 48GB, pero genera tan rápido como un modelo pequeño.
GPUs para configuración de modelo personalizada
Estimación de memoria
Preguntas frecuentes
Preguntas comunes sobre la elección de una GPU para la inferencia de LLM locales.