Mejor GPU para modelos LLM locales
Ejecutar LLM de forma local requiere emparejar los presupuestos de VRAM con los niveles de cuantización y los tamaños de contexto. Utiliza nuestra calculadora en vivo a continuación para estimar el uso de memoria y explorar las guías específicas de cada modelo.
Ver guías de modelos LLM
Qwen3.8-27B
Un modelo visión-lenguaje denso de 27B cuya atención lineal híbrida mantiene minúscula la caché KV: ejecuta un contexto de 128k+ en una sola tarjeta de 16-24 GB, con ventana nativa de 262k ampliable a 1M.
DeepSeek-V4-Flash
Un modelo Mixture-of-Experts de 284B con solo 13B de parámetros activos y un contexto de 1M de tokens. Sus pesos requieren varias GPU o descarga a CPU, pero solo se activan 13B por token, así que la generación sigue siendo rápida.
gpt-oss-120b
El modelo Mixture-of-Experts de pesos abiertos de 117B de OpenAI con 5,1B de parámetros activos. Sus pesos nativos MXFP4 caben en una sola GPU de 80-96 GB, y el bajo número de parámetros activos mantiene rápida la generación.
Qwen3.6-Coder-27B
Modelo denso de última generación con profunda comprensión de matemáticas, programación e ingeniería.
Qwen3.6-35B-A3B
Masivo codificador Mixture-of-Experts optimizado para configuraciones con un objetivo de VRAM de 16GB a 24GB.
Gemma 4 26B-A4B
El modelo MoE de alta densidad de Google diseñado para programación y razonamiento complejos.
Gemma 4 12B
Modelo denso ligero y de alta velocidad, optimizado para configuraciones de consumo estándar.
DeepSeek-R1-Distill-14B
Razonamiento de primer nivel destilado en un modelo compacto de 14B. Sólido rendimiento en STEM y programación en cualquier GPU de 12GB+.
DeepSeek-R1-Distill-32B
Potencia de razonamiento de tamaño medio para tarjetas de 24GB. Igual al nivel de los modelos de frontera en matemáticas, programación y lógica.
Mistral Small 3.1 24B
Modelo denso y eficiente con soporte multilingüe amplio y llamadas a funciones nativas. Cabe en tarjetas de 16GB en Q4.
Llama 4 Scout 109B-A17B
El buque insignia MoE más accesible de Meta: 17B de parámetros activos ofrecen una sólida calidad en hardware de estación de trabajo.
Hy-MT2-7B
Modelo denso de 7B versátil, diseñado para una inferencia local eficiente en GPUs de gama de entrada a media.
gpt-oss-20b
Modelo de razonamiento de consumo de OpenAI, diseñado para ejecutarse sin compromisos en hardware local estándar.
NVIDIA Nemotron-3-Nano-4B
Modelo NVIDIA de 4B ultracompacto que cabe cómodamente en casi cualquier GPU moderna: ideal para configuraciones edge y portátiles.
Qwen3-Next-80B-A3B
Enorme Mixture-of-Experts de 80B con solo 3B de parámetros activos — requiere una tarjeta de estación de trabajo de 48GB, pero genera tan rápido como un modelo pequeño.
GPUs para configuración de modelo personalizada
Estimación de memoria
Preguntas frecuentes
Preguntas comunes sobre la elección de una GPU para la inferencia de LLM locales.
¿Cuánta VRAM necesito realmente para un LLM local en 2026?
Depende del tamaño del modelo y de la cuantización. Un modelo 12B en Q4 cabe en unos 7–8 GB, por lo que una tarjeta de 12GB es viable. Para modelos de 26–27B necesitas de 14–18 GB; una tarjeta de 16GB es la opción ideal. Modelos más grandes de 70B+ necesitan entre 40–80 GB, lo que requiere múltiples GPU o tarjetas de estación de trabajo de gama alta.
¿Qué es la descarga a CPU (offloading) y por qué es lenta?
La descarga a CPU traslada las capas que no caben en la VRAM a la memoria RAM del sistema. El ancho de banda de la RAM del sistema es de 40–80 GB/s, entre 10 y 20 veces más lento que la memoria de la GPU. Para una inferencia fluida, mantén todo el modelo cuantizado en la VRAM.
¿Qué significa la cuantización Q4_K_M o Q8_0?
La cuantización reduce el peso de cada parámetro del modelo de 16 bits a menos bits para ahorrar memoria. Q4_K_M utiliza aproximadamente 4 bits por peso, cerca de la mitad de la VRAM de FP16 con una pérdida de calidad mínima. Q8_0 utiliza 8 bits, ofreciendo una calidad casi sin pérdidas pero requiriendo aproximadamente el doble de VRAM.
¿Qué es un modelo MoE y por qué se ejecuta más rápido de lo que sugiere su tamaño?
Los modelos de Mezcla de Expertos (MoE) tienen una gran cantidad total de parámetros pero solo activan un pequeño subconjunto por cada token. Esto significa que el cálculo de la inferencia y la caché KV escalan con el recuento de parámetros activos, no con el total, por lo que un modelo MoE de 26B puede ejecutarse más rápido que un modelo denso de 7B en el hardware adecuado.
¿Debería elegir una tarjeta GeForce para consumo o una tarjeta de estación de trabajo (workstation)?
Las tarjetas de consumo ofrecen la mejor relación precio-por-GB de VRAM para capacidades estándar de gaming (8–24 GB). Las tarjetas de estación de trabajo ofrecen mayor capacidad de VRAM (32–96 GB) y memoria ECC a un precio significativamente mayor. Elige consumo si tu modelo cabe en 24 GB; opta por estación de trabajo si necesitas 32 GB+.
¿Puedo ejecutar un LLM local en una GPU AMD?
Sí. ROCm es compatible con llama.cpp y Ollama en Linux, y cada vez más en Windows. La Radeon RX 7900 XTX (24 GB) y la Radeon PRO W7900 (48 GB) son opciones sólidas. El rendimiento es comparable al de las tarjetas NVIDIA equivalentes para cargas de trabajo de inferencia.
¿Puedo ejecutar un LLM local en una GPU Intel Arc?
Sí. Las GPU Intel Arc (como la A770 de 16GB) pueden ejecutar LLM locales utilizando la extensión IPEX (Intel Extension for PyTorch) o el motor OpenVINO, compatibles con llama.cpp y Ollama. La A770 de 16GB es una de las opciones más asequibles de 16GB de VRAM en el mercado, ofreciendo un rendimiento de inferencia sólido para presupuestos ajustados, aunque la configuración puede ser un poco más compleja en comparación con NVIDIA CUDA.