Pular para o conteúdo

Melhor GPU para Qwen3.6-35B-A3B localmente

Preços em tempo real e recomendações de hardware atualizados para agosto de 2026.

35B
3B
moe

O Qwen3.6-35B-A3B é um modelo de mistura de especialistas: todos os 35B de parâmetros precisam ficar na VRAM, mas apenas 3B são ativados por token — por isso ele gera muito mais rápido que um modelo denso do mesmo tamanho, embora exija a mesma memória.

Para executar o Qwen3.6-35B-A3B localmente você precisa de cerca de 20.5 GB de VRAM com quantização Q4_K_M e um contexto de 32k tokens. A placa com melhor custo-benefício que comporta o modelo é a GeForce RTX 4090 (24 GB), que deve gerar cerca de 154 tokens por segundo.

Ajustar comprimento do contexto

Deslize para tamanhos populares ou digite um valor manualmente.

k tokens
8k
16k
32k
64k
128k
256k
Entrada econômicaQ3_K_M quant
15.1 GB
0.4 GB
VRAM total:15.5 GB

Hardware recomendado

Radeon RX 9060 XT 16GB
1444 tok/sprefill
59 tok/sgeração
BRL 3405.42·16GB de VRAM
Ver placa
GeForce RTX 5060 Ti 16GB
2300 tok/sprefill
98 tok/sgeração
BRL 4600·16GB de VRAM
Ver placa

Os pesos do modelo MoE exigem no mínimo 16GB de VRAM para quantizações Q3.

Ponto de equilíbrio idealQ4_K_M quant
20.1 GB
0.4 GB
VRAM total:20.5 GB

Hardware recomendado

GeForce RTX 4090
4516 tok/sprefill
154 tok/sgeração
BRL 83.17·24GB de VRAM
Ver placa
RTX A5000
1409 tok/sprefill
86 tok/sgeração
BRL 29470.23·24GB de VRAM
Ver placa
GeForce RTX 3090
3320 tok/sprefill
105 tok/sgeração
Esgotado·24GB de VRAM
Ver placa
RTX PRO 4000 Blackwell
3373 tok/sprefill
121 tok/sgeração
Esgotado·24GB de VRAM
Ver placa

Roda totalmente dentro de framebuffers de 24GB. Alta velocidade ativa graças ao caminho de execução MoE.

Quase sem perdasQ8_0 quant
40.3 GB
0.4 GB
VRAM total:40.6 GB

Hardware recomendado

RTX PRO 5000 Blackwell
5295 tok/sprefill
143 tok/sgeração
Esgotado·48GB de VRAM
Ver placa
RTX A6000
1961 tok/sprefill
51 tok/sgeração
Esgotado·48GB de VRAM
Ver placa
Radeon PRO W7900
3106 tok/sprefill
57 tok/sgeração
Esgotado·48GB de VRAM
Ver placa

Exige placas de workstation de 48GB+ para acomodar confortavelmente toda a matriz de pesos Q8.

Outros modelos com o mesmo requisito de VRAM

Como os pesos de Qwen3.6-35B-A3B cabem em uma placa de 24 GB, outros modelos de tamanho semelhante rodam na mesma GPU. A velocidade de geração varia — modelos Mixture-of-Experts são mais rápidos, modelos densos mais lentos — mas todos cabem na mesma VRAM:

Qwen3.5-35B-A3B36BYi 1.5 34B34BQwen3-32B32.8BQwen2.5-32B32.5BQwen2.5-Coder-32B32.5BQwQ-32B32.5B

Otimizando a configuração para Qwen3.6-35B-A3B

Recomendações de quantização

Para tarefas diárias de programação e raciocínio, o Q4_K_M (quantização de 4 bits) oferece o melhor equilíbrio entre qualidade e eficiência de memória: reduz os requisitos de memória em mais de 70% com uma perda de qualidade mínima em comparação com FP16. Os ajustes Q8 e superiores preservam mais fidelidade ao custo de um uso de VRAM significativamente maior, o que pode forçar o descarregamento de camadas e reduzir o desempenho.

Software local recomendado

Recomendamos usar o Ollama como o executor principal para inferência local devido ao seu particionamento de GPU automatizado e otimizações de cache de contexto. Para ajustes avançados ou partições de quantização, o llama.cpp compilado nativamente com Flash Attention fornece o melhor controle granular.

Executando o Qwen3.6-35B-A3B localmente — perguntas frequentes

De quanta VRAM preciso para executar o Qwen3.6-35B-A3B?

Com um contexto de 32k e a quantização do cache KV ativada, o Qwen3.6-35B-A3B precisa de cerca de 20.5 GB de VRAM em Q4_K_M — a quantização indicada para a maioria. Baixar para Q3_K_M reduz para aproximadamente 15.5 GB com alguma perda de qualidade, enquanto Q8_0 exige cerca de 40.6 GB para a melhor qualidade que este modelo consegue entregar.

Em que tamanho de placa de vídeo o Qwen3.6-35B-A3B cabe?

O Qwen3.6-35B-A3B precisa de cerca de 20.5 GB em Q4_K_M, então uma placa de 24 GB é o menor tamanho comum que o mantém inteiramente na VRAM. Abaixo disso é preciso transferir camadas para a RAM do sistema, o que costuma custar a maior parte da sua velocidade de geração.

Qual quantização devo usar para o Qwen3.6-35B-A3B?

Use Q4_K_M, a menos que tenha VRAM sobrando. Ele precisa de cerca de 20.5 GB e perde muito pouca qualidade em relação à precisão total. O Q8_0 exige cerca de 40.6 GB por um ganho de qualidade que quase ninguém percebe ao programar ou conversar. Prefira usar a VRAM restante para um contexto mais longo.

Como o tamanho do contexto afeta a VRAM exigida pelo Qwen3.6-35B-A3B?

Os pesos do modelo são fixos, mas o cache KV cresce linearmente com o contexto. Para o Qwen3.6-35B-A3B com um contexto de 32k, o cache ocupa cerca de 0.4 GB; dobrando para 64k, ele chega a aproximadamente 0.8 GB. Desativar a quantização do cache KV dobra novamente esses valores.

Por que o Qwen3.6-35B-A3B é mais rápido do que seu número de parâmetros sugere?

O Qwen3.6-35B-A3B é um modelo de mistura de especialistas. Todos os seus 35B de parâmetros precisam estar na VRAM, mas apenas 3B são usados para produzir cada token. A velocidade de geração depende de ler esses 3B de parâmetros ativos, então ele se comporta muito mais como um modelo de 3B do que de 35B — embora ainda exija memória para os 35B completos.

A mesma GPU pode rodar outros modelos semelhantes ao Qwen3.6-35B-A3B?

Sim. Qwen3.6-35B-A3B precisa de cerca de 20.5 GB em Q4_K_M, e qualquer modelo cujos pesos caibam na mesma placa roda nela — incluindo Qwen3.5-35B-A3B (36B), Yi 1.5 34B (34B), Qwen3-32B (32.8B), Qwen2.5-32B (32.5B), Qwen2.5-Coder-32B (32.5B), QwQ-32B (32.5B). Os pesos cabem na mesma GPU; a velocidade de geração varia (modelos Mixture-of-Experts são mais rápidos, modelos densos mais lentos).

Como as velocidades de tokens são estimadas

Como calculamos o Índice de Valor da GPU e normalizamos os dados de mercado.

📖

Leitura (Prefill)

A consulta é processada em uma única passagem paralela. Isso é limitado por capacidade de computação: satura os tensor cores da GPU.

leitura tok/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Decodificação (Geração)

Cada novo token exige carregar todos os pesos ativos do modelo a partir da VRAM. Isso é limitado pela largura de banda de memória: a GPU para aguardando dados em vez de computar.

decodificação tok/s ≈ largura de banda × decodeFactor ÷ (pesos + cachê_kv)

Pesos = (activeParams × bits ÷ 8) × 1.15 de sobrecarga. Cachê KV por passo = activeParams × multiplicador × contextK.

Fatores de utilização por arquitetura

Arquitetura
Decodificação
Leitura
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Núcleos pré-tensor (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Esquerda: fator de decodificação — Direita: fator de leitura

Fontes de dados

Os TFLOPS e a largura de banda de memória são lidos do banco de dados de GPUs. Se ausentes, a largura de banda recorre a uma lista predefinida.

Limitações

Estas são estimativas analíticas, não resultados de testes reais. Use-as como uma comparação relativa, não como uma garantia absoluta de desempenho.