Melhor GPU para modelos LLM locais
Executar LLMs localmente exige combinar orçamentos de VRAM com níveis de quantização e tamanhos de contexto. Use nossa calculadora em tempo real abaixo para estimar o uso de memória e explorar os guias de modelos específicos.
Ver guias de modelos LLM
Qwen3.8-27B
Um modelo visão-linguagem denso de 27B cuja atenção linear híbrida mantém o cache KV minúsculo — roda um contexto de 128k+ numa única placa de 16-24 GB, com janela nativa de 262k expansível para 1M.
DeepSeek-V4-Flash
Um modelo Mixture-of-Experts de 284B com apenas 13B de parâmetros ativos e contexto de 1M de tokens. Os pesos exigem múltiplas GPUs ou offload de CPU, mas só 13B ativam por token, então a geração continua rápida.
gpt-oss-120b
O modelo Mixture-of-Experts de pesos abertos de 117B da OpenAI com 5,1B de parâmetros ativos. Seus pesos nativos MXFP4 cabem numa única GPU de 80-96 GB, e o baixo número de parâmetros ativos mantém a geração rápida.
Qwen3.6-Coder-27B
Modelo denso de última geração com profunda compreensão de matemática, programação e engenharia.
Qwen3.6-35B-A3B
Massivo codificador Mixture-of-Experts otimizado para configurações com VRAM alvo de 16GB a 24GB.
Gemma 4 26B-A4B
O principal MoE de alta densidade do Google, projetado para programação e raciocínio complexos.
Gemma 4 12B
Modelo denso leve e de alta velocidade, otimizado para configurações de consumo padrão.
DeepSeek-R1-Distill-14B
Raciocínio de alto nível destilado em um modelo compacto de 14B. Sólido desempenho em STEM e programação em qualquer GPU de 12GB+.
DeepSeek-R1-Distill-32B
Potência de raciocínio de tamanho médio para placas de 24GB. Iguala-se aos modelos de fronteira em matemática, programação e lógica.
Mistral Small 3.1 24B
Modelo denso e eficiente com amplo suporte multilingue e chamadas de função nativas. Cabe em placas de 16GB em Q4.
Llama 4 Scout 109B-A17B
O carro-chefe MoE mais acessível da Meta: 17B de parâmetros ativos oferecem uma qualidade sólida em hardware de estação de trabalho.
Hy-MT2-7B
Modelo denso de 7B versátil, criado para inferência local eficiente em GPUs de nível básico a intermediário.
gpt-oss-20b
Modelo de raciocínio de consumo da OpenAI, projetado para rodar sem compromisos em hardware local padrão.
NVIDIA Nemotron-3-Nano-4B
Modelo NVIDIA de 4B ultracompacto que cabe confortavelmente em quase qualquer GPU moderna — ideal para configurações edge e portáteis.
Qwen3-Next-80B-A3B
Enorme Mixture-of-Experts de 80B com apenas 3B de parâmetros ativos — requer uma placa workstation de 48GB, mas gera tão rápido quanto um modelo pequeno.
GPUs para configuração de modelo personalizada
Estimativa de memória
Perguntas frequentes
Perguntas comuns sobre a escolha de uma GPU para inferência local de LLM.
De quanta VRAM eu realmente preciso para um LLM local em 2026?
Depende do tamanho do modelo e da quantização. Um modelo 12B em Q4 cabe em cerca de 7–8 GB, tornando viável uma placa de 12GB. Para modelos de 26–27B, você precisa de 14–18 GB; uma placa de 16GB é ideal. Modelos maiores de 70B+ precisam de 40–80 GB, exigindo múltiplas GPUs ou placas de estação de trabalho de ponta.
O que é descarregamento para CPU (offloading) e por que é lento?
O descarregamento para CPU move as camadas que não cabem na VRAM para a memória RAM do sistema. A largura de banda da RAM do sistema é de 40–80 GB/s, cerca de 10 a 20 vezes mais lenta que a memória da GPU. Para uma inferência fluida, mantenha todo o modelo quantizado na VRAM.
O que significa quantização Q4_K_M ou Q8_0?
A quantização reduz o peso de cada parâmetro do modelo de 16 bits para menos bits para economizar memória. Q4_K_M usa cerca de 4 bits por peso, reduzindo pela metade a VRAM em relação ao FP16 com perda mínima de qualidade. Q8_0 usa 8 bits, oferecendo qualidade quase sem perdas, mas exigindo cerca do dobro da VRAM.
O que é um modelo MoE e por que ele roda mais rápido do que seu tamanho sugere?
Modelos Mixture-of-Experts (MoE) têm um grande número total de parâmetros, mas ativam apenas um pequeno subconjunto por cada token. Isso significa que o cálculo de inferência e o cachê KV escalam com o recuento de parâmetros ativos, não com o total, de modo que um modelo MoE de 26B pode rodar mais rápido que um modelo denso de 7B em um hardware compatível.
Devo escolher uma placa GeForce de consumo ou uma placa de estação de trabalho (workstation)?
As placas de consumo oferecem a melhor relação preço-por-GB de VRAM para capacidades padrão de gaming (8–24 GB). As placas de estação de trabalho oferecem maior capacidade de VRAM (32–96 GB) e memória ECC a um custo significativamente maior. Escolha consumo se o seu modelo couber em 24 GB; opte por estação de trabalho se precisar de 32 GB+.
Posso executar um LLM local em uma GPU AMD?
Sim. O ROCm oferece suporte para llama.cpp e Ollama no Linux, e cada vez mais no Windows. A Radeon RX 7900 XTX (24 GB) e a Radeon PRO W7900 (48 GB) são opções sólidas. O desempenho é comparável ao das placas NVIDIA equivalentes para cargas de trabalho de inferência.
Posso executar um LLM local em uma GPU Intel Arc?
Sim. As GPUs Intel Arc (como a A770 de 16GB) podem rodar LLMs locais usando a extensão IPEX (Intel Extension for PyTorch) ou o motor OpenVINO, compatíveis com llama.cpp e Ollama. A A770 de 16GB é uma das opções mais acessíveis de 16GB de VRAM no mercado, oferecendo um desempenho de inferência sólido para orçamentos limitados, embora a configuração possa ser um pouco mais complexa em comparação com a NVIDIA CUDA.