Pular para o conteúdo

Melhor GPU para modelos LLM locais

Executar LLMs localmente exige combinar orçamentos de VRAM com níveis de quantização e tamanhos de contexto. Use nossa calculadora em tempo real abaixo para estimar o uso de memória e explorar os guias de modelos específicos.

Ver guias de modelos LLM

Alibaba Qwen

Qwen3.8-27B

dense

Um modelo visão-linguagem denso de 27B cuja atenção linear híbrida mantém o cache KV minúsculo — roda um contexto de 128k+ numa única placa de 16-24 GB, com janela nativa de 262k expansível para 1M.

Parâmetros
27B
Ativos
27B
Contexto máx.
128k
Ver detalhes de modelo e GPU
DeepSeek

DeepSeek-V4-Flash

moe

Um modelo Mixture-of-Experts de 284B com apenas 13B de parâmetros ativos e contexto de 1M de tokens. Os pesos exigem múltiplas GPUs ou offload de CPU, mas só 13B ativam por token, então a geração continua rápida.

Parâmetros
284B
Ativos
13B
Contexto máx.
128k
Ver detalhes de modelo e GPU
OpenAI

gpt-oss-120b

moe

O modelo Mixture-of-Experts de pesos abertos de 117B da OpenAI com 5,1B de parâmetros ativos. Seus pesos nativos MXFP4 cabem numa única GPU de 80-96 GB, e o baixo número de parâmetros ativos mantém a geração rápida.

Parâmetros
117B
Ativos
5.1B
Contexto máx.
32k
Ver detalhes de modelo e GPU
Alibaba Qwen

Qwen3.6-Coder-27B

dense

Modelo denso de última geração com profunda compreensão de matemática, programação e engenharia.

Parâmetros
27B
Ativos
27B
Contexto máx.
32k
Ver detalhes de modelo e GPU
Alibaba Qwen

Qwen3.6-35B-A3B

moe

Massivo codificador Mixture-of-Experts otimizado para configurações com VRAM alvo de 16GB a 24GB.

Parâmetros
35B
Ativos
3B
Contexto máx.
32k
Ver detalhes de modelo e GPU
Google

Gemma 4 26B-A4B

moe

O principal MoE de alta densidade do Google, projetado para programação e raciocínio complexos.

Parâmetros
26B
Ativos
4B
Contexto máx.
64k
Ver detalhes de modelo e GPU
Google

Gemma 4 12B

dense

Modelo denso leve e de alta velocidade, otimizado para configurações de consumo padrão.

Parâmetros
12B
Ativos
12B
Contexto máx.
64k
Ver detalhes de modelo e GPU
DeepSeek

DeepSeek-R1-Distill-14B

dense

Raciocínio de alto nível destilado em um modelo compacto de 14B. Sólido desempenho em STEM e programação em qualquer GPU de 12GB+.

Parâmetros
14B
Ativos
14B
Contexto máx.
32k
Ver detalhes de modelo e GPU
DeepSeek

DeepSeek-R1-Distill-32B

dense

Potência de raciocínio de tamanho médio para placas de 24GB. Iguala-se aos modelos de fronteira em matemática, programação e lógica.

Parâmetros
32B
Ativos
32B
Contexto máx.
32k
Ver detalhes de modelo e GPU
Mistral AI

Mistral Small 3.1 24B

dense

Modelo denso e eficiente com amplo suporte multilingue e chamadas de função nativas. Cabe em placas de 16GB em Q4.

Parâmetros
24B
Ativos
24B
Contexto máx.
128k
Ver detalhes de modelo e GPU
Meta

Llama 4 Scout 109B-A17B

moe

O carro-chefe MoE mais acessível da Meta: 17B de parâmetros ativos oferecem uma qualidade sólida em hardware de estação de trabalho.

Parâmetros
109B
Ativos
17B
Contexto máx.
64k
Ver detalhes de modelo e GPU
Tencent

Hy-MT2-7B

dense

Modelo denso de 7B versátil, criado para inferência local eficiente em GPUs de nível básico a intermediário.

Parâmetros
7B
Ativos
7B
Contexto máx.
32k
Ver detalhes de modelo e GPU
OpenAI

gpt-oss-20b

dense

Modelo de raciocínio de consumo da OpenAI, projetado para rodar sem compromisos em hardware local padrão.

Parâmetros
20B
Ativos
20B
Contexto máx.
32k
Ver detalhes de modelo e GPU
NVIDIA

NVIDIA Nemotron-3-Nano-4B

dense

Modelo NVIDIA de 4B ultracompacto que cabe confortavelmente em quase qualquer GPU moderna — ideal para configurações edge e portáteis.

Parâmetros
4B
Ativos
4B
Contexto máx.
32k
Ver detalhes de modelo e GPU
Alibaba Qwen

Qwen3-Next-80B-A3B

moe

Enorme Mixture-of-Experts de 80B com apenas 3B de parâmetros ativos — requer uma placa workstation de 48GB, mas gera tão rápido quanto um modelo pequeno.

Parâmetros
80B
Ativos
3B
Contexto máx.
32k
Ver detalhes de modelo e GPU

GPUs para configuração de modelo personalizada

27B
3B14B27B35B70B+
32k tokens
8k32k64k96k128k

Estimativa de memória

VRAM19 GB
Pesos: 15.5GB
KV: 3.5 GB

Perguntas frequentes

Perguntas comuns sobre a escolha de uma GPU para inferência local de LLM.

De quanta VRAM eu realmente preciso para um LLM local em 2026?

Depende do tamanho do modelo e da quantização. Um modelo 12B em Q4 cabe em cerca de 7–8 GB, tornando viável uma placa de 12GB. Para modelos de 26–27B, você precisa de 14–18 GB; uma placa de 16GB é ideal. Modelos maiores de 70B+ precisam de 40–80 GB, exigindo múltiplas GPUs ou placas de estação de trabalho de ponta.

O que é descarregamento para CPU (offloading) e por que é lento?

O descarregamento para CPU move as camadas que não cabem na VRAM para a memória RAM do sistema. A largura de banda da RAM do sistema é de 40–80 GB/s, cerca de 10 a 20 vezes mais lenta que a memória da GPU. Para uma inferência fluida, mantenha todo o modelo quantizado na VRAM.

O que significa quantização Q4_K_M ou Q8_0?

A quantização reduz o peso de cada parâmetro do modelo de 16 bits para menos bits para economizar memória. Q4_K_M usa cerca de 4 bits por peso, reduzindo pela metade a VRAM em relação ao FP16 com perda mínima de qualidade. Q8_0 usa 8 bits, oferecendo qualidade quase sem perdas, mas exigindo cerca do dobro da VRAM.

O que é um modelo MoE e por que ele roda mais rápido do que seu tamanho sugere?

Modelos Mixture-of-Experts (MoE) têm um grande número total de parâmetros, mas ativam apenas um pequeno subconjunto por cada token. Isso significa que o cálculo de inferência e o cachê KV escalam com o recuento de parâmetros ativos, não com o total, de modo que um modelo MoE de 26B pode rodar mais rápido que um modelo denso de 7B em um hardware compatível.

Devo escolher uma placa GeForce de consumo ou uma placa de estação de trabalho (workstation)?

As placas de consumo oferecem a melhor relação preço-por-GB de VRAM para capacidades padrão de gaming (8–24 GB). As placas de estação de trabalho oferecem maior capacidade de VRAM (32–96 GB) e memória ECC a um custo significativamente maior. Escolha consumo se o seu modelo couber em 24 GB; opte por estação de trabalho se precisar de 32 GB+.

Posso executar um LLM local em uma GPU AMD?

Sim. O ROCm oferece suporte para llama.cpp e Ollama no Linux, e cada vez mais no Windows. A Radeon RX 7900 XTX (24 GB) e a Radeon PRO W7900 (48 GB) são opções sólidas. O desempenho é comparável ao das placas NVIDIA equivalentes para cargas de trabalho de inferência.

Posso executar um LLM local em uma GPU Intel Arc?

Sim. As GPUs Intel Arc (como a A770 de 16GB) podem rodar LLMs locais usando a extensão IPEX (Intel Extension for PyTorch) ou o motor OpenVINO, compatíveis com llama.cpp e Ollama. A A770 de 16GB é uma das opções mais acessíveis de 16GB de VRAM no mercado, oferecendo um desempenho de inferência sólido para orçamentos limitados, embora a configuração possa ser um pouco mais complexa em comparação com a NVIDIA CUDA.