Melhor GPU para modelos LLM locais
Executar LLMs localmente exige combinar orçamentos de VRAM com níveis de quantização e tamanhos de contexto. Use nossa calculadora em tempo real abaixo para estimar o uso de memória e explorar os guias de modelos específicos.
Ver guias de modelos LLM
Qwen3.8-27B
Um modelo visão-linguagem denso de 27B cuja atenção linear híbrida mantém o cache KV minúsculo — roda um contexto de 128k+ numa única placa de 16-24 GB, com janela nativa de 262k expansível para 1M.
DeepSeek-V4-Flash
Um modelo Mixture-of-Experts de 284B com apenas 13B de parâmetros ativos e contexto de 1M de tokens. Os pesos exigem múltiplas GPUs ou offload de CPU, mas só 13B ativam por token, então a geração continua rápida.
gpt-oss-120b
O modelo Mixture-of-Experts de pesos abertos de 117B da OpenAI com 5,1B de parâmetros ativos. Seus pesos nativos MXFP4 cabem numa única GPU de 80-96 GB, e o baixo número de parâmetros ativos mantém a geração rápida.
Qwen3.6-Coder-27B
Modelo denso de última geração com profunda compreensão de matemática, programação e engenharia.
Qwen3.6-35B-A3B
Massivo codificador Mixture-of-Experts otimizado para configurações com VRAM alvo de 16GB a 24GB.
Gemma 4 26B-A4B
O principal MoE de alta densidade do Google, projetado para programação e raciocínio complexos.
Gemma 4 12B
Modelo denso leve e de alta velocidade, otimizado para configurações de consumo padrão.
DeepSeek-R1-Distill-14B
Raciocínio de alto nível destilado em um modelo compacto de 14B. Sólido desempenho em STEM e programação em qualquer GPU de 12GB+.
DeepSeek-R1-Distill-32B
Potência de raciocínio de tamanho médio para placas de 24GB. Iguala-se aos modelos de fronteira em matemática, programação e lógica.
Mistral Small 3.1 24B
Modelo denso e eficiente com amplo suporte multilingue e chamadas de função nativas. Cabe em placas de 16GB em Q4.
Llama 4 Scout 109B-A17B
O carro-chefe MoE mais acessível da Meta: 17B de parâmetros ativos oferecem uma qualidade sólida em hardware de estação de trabalho.
Hy-MT2-7B
Modelo denso de 7B versátil, criado para inferência local eficiente em GPUs de nível básico a intermediário.
gpt-oss-20b
Modelo de raciocínio de consumo da OpenAI, projetado para rodar sem compromisos em hardware local padrão.
NVIDIA Nemotron-3-Nano-4B
Modelo NVIDIA de 4B ultracompacto que cabe confortavelmente em quase qualquer GPU moderna — ideal para configurações edge e portáteis.
Qwen3-Next-80B-A3B
Enorme Mixture-of-Experts de 80B com apenas 3B de parâmetros ativos — requer uma placa workstation de 48GB, mas gera tão rápido quanto um modelo pequeno.
GPUs para configuração de modelo personalizada
Estimativa de memória
Perguntas frequentes
Perguntas comuns sobre a escolha de uma GPU para inferência local de LLM.