Saltar al contenido

Mejor GPU para Qwen3.6-35B-A3B en local

Precios en tiempo real y recomendaciones de hardware actualizados para agosto de 2026.

35B
3B
moe

Qwen3.6-35B-A3B es un modelo de mezcla de expertos: sus 35B de parámetros deben residir por completo en la VRAM, pero solo 3B se activan por token, por lo que genera mucho más rápido que un modelo denso del mismo tamaño aunque exija la misma memoria.

Para ejecutar Qwen3.6-35B-A3B en local necesitas unos 20.5 GB de VRAM con cuantización Q4_K_M y un contexto de 32k tokens. La tarjeta con mejor relación calidad-precio que encaja es la GeForce RTX 3090 (24 GB), que debería generar alrededor de 105 tokens por segundo.

Ajustar longitud de contexto

Desliza para seleccionar tamaños populares o escribe un valor manualmente.

k tokens
8k
16k
32k
64k
128k
256k
Entrada económicaQ3_K_M cuant
15.1 GB
0.4 GB
VRAM total:15.5 GB

Hardware recomendado

Radeon RX 9060 XT 16GB
1444 tok/sprefill
59 tok/sgeneración
CAD 689.99·16GB de VRAM
Ver tarjeta
GeForce RTX 5060 Ti 16GB
2300 tok/sprefill
98 tok/sgeneración
CAD 949.99·16GB de VRAM
Ver tarjeta

Los pesos del modelo MoE requieren 16GB de VRAM como mínimo para las cuantizaciones Q3.

Equilibrio idealQ4_K_M cuant
20.1 GB
0.4 GB
VRAM total:20.5 GB

Hardware recomendado

GeForce RTX 3090
3320 tok/sprefill
105 tok/sgeneración
CAD 2299.99·24GB de VRAM
Ver tarjeta
RTX PRO 4000 Blackwell
3373 tok/sprefill
121 tok/sgeneración
CAD 4632.44·24GB de VRAM
Ver tarjeta
RTX A5000
1409 tok/sprefill
86 tok/sgeneración
CAD 5299·24GB de VRAM
Ver tarjeta
GeForce RTX 4090
4516 tok/sprefill
154 tok/sgeneración
CAD 6137.99·24GB de VRAM
Ver tarjeta

Se ejecuta por completo dentro de framebuffers de 24GB. Alta velocidad activa gracias a la ruta de ejecución MoE.

Casi sin pérdidasQ8_0 cuant
40.3 GB
0.4 GB
VRAM total:40.6 GB

Hardware recomendado

RTX PRO 5000 Blackwell
5295 tok/sprefill
143 tok/sgeneración
CAD 11155.4·48GB de VRAM
Ver tarjeta
RTX A6000
1961 tok/sprefill
51 tok/sgeneración
CAD 11399·48GB de VRAM
Ver tarjeta
Radeon PRO W7900
3106 tok/sprefill
57 tok/sgeneración
Agotado·48GB de VRAM
Ver tarjeta

Requiere tarjetas de estación de trabajo de 48GB+ para alojar cómodamente toda la matriz de pesos Q8.

Otros modelos con el mismo requisito de VRAM

Como los pesos de Qwen3.6-35B-A3B caben en una tarjeta de 24 GB, otros modelos de tamaño similar funcionan en la misma GPU. La velocidad de generación varía — los modelos Mixture-of-Experts son más rápidos, los densos más lentos — pero todos caben en la misma VRAM:

Qwen3.5-35B-A3B36BYi 1.5 34B34BQwen3-32B32.8BQwen2.5-32B32.5BQwen2.5-Coder-32B32.5BQwQ-32B32.5B

Optimización de configuración para Qwen3.6-35B-A3B

Recomendaciones de cuantización

Para tareas diarias de programación y razonamiento, Q4_K_M (cuantización de 4 bits) ofrece el mejor equilibrio entre calidad y eficiencia de memoria: reduce los requisitos de memoria en más del 70% con una pérdida de calidad mínima en comparación con FP16. Los ajustes preestablecidos Q8 y superiores conservan más fidelidad a costa de un uso de VRAM significativamente mayor, lo que puede forzar la descarga de capas y reducir el rendimiento de generación.

Software local recomendado

Recomendamos usar Ollama como el ejecutor principal para la inferencia local debido a su división automática de modelos en GPU y optimizaciones de caché de contexto. Para ajustes finos avanzados o divisiones de cuantización, llama.cpp compilado de forma nativa con Flash Attention proporciona el mejor control granular.

Ejecutar Qwen3.6-35B-A3B en local: preguntas frecuentes

¿Cuánta VRAM necesito para ejecutar Qwen3.6-35B-A3B?

Con un contexto de 32k y la cuantización de la caché KV activada, Qwen3.6-35B-A3B necesita unos 20.5 GB de VRAM en Q4_K_M, la cuantización recomendada para la mayoría. Bajar a Q3_K_M lo reduce a unos 15.5 GB con cierta pérdida de calidad, mientras que Q8_0 requiere unos 40.6 GB para la mejor calidad que puede dar este modelo.

¿En qué tamaño de tarjeta gráfica cabe Qwen3.6-35B-A3B?

Qwen3.6-35B-A3B necesita unos 20.5 GB en Q4_K_M, así que una tarjeta de 24 GB es el tamaño común más pequeño que lo mantiene íntegro en VRAM. Por debajo hay que descargar capas a la RAM del sistema, lo que suele costarte la mayor parte de la velocidad de generación.

¿Qué cuantización debo usar para Qwen3.6-35B-A3B?

Usa Q4_K_M salvo que te sobre VRAM. Necesita unos 20.5 GB y pierde muy poca calidad frente a la precisión completa. Q8_0 requiere unos 40.6 GB para una mejora que casi nadie percibe programando o conversando. Dedica la VRAM sobrante a un contexto más largo.

¿Cómo afecta la longitud del contexto a la VRAM que necesita Qwen3.6-35B-A3B?

Los pesos del modelo son fijos, pero la caché KV crece de forma lineal con el contexto. Para Qwen3.6-35B-A3B con un contexto de 32k la caché ocupa unos 0.4 GB; al doblarlo a 64k sube a unos 0.8 GB. Desactivar la cuantización de la caché KV vuelve a duplicar esas cifras.

¿Por qué Qwen3.6-35B-A3B es más rápido de lo que sugiere su número de parámetros?

Qwen3.6-35B-A3B es un modelo de mezcla de expertos. Sus 35B de parámetros deben residir en VRAM, pero solo 3B intervienen en cada token. La velocidad de generación depende de leer esos 3B activos, así que se comporta mucho más como un modelo de 3B que de 35B, aunque siga necesitando memoria para los 35B completos.

¿Puede la misma GPU ejecutar otros modelos similares a Qwen3.6-35B-A3B?

Sí. Qwen3.6-35B-A3B necesita unos 20.5 GB en Q4_K_M, y cualquier modelo cuyos pesos quepan en la misma tarjeta funciona en ella — incluidos Qwen3.5-35B-A3B (36B), Yi 1.5 34B (34B), Qwen3-32B (32.8B), Qwen2.5-32B (32.5B), Qwen2.5-Coder-32B (32.5B), QwQ-32B (32.5B). Los pesos caben en la misma GPU; la velocidad de generación varía (los modelos Mixture-of-Experts son más rápidos, los densos más lentos).

Cómo se estiman las velocidades de tokens

Cómo calculamos la Puntuación de Valor GPU y normalizamos los datos del mercado.

📖

Lectura (Prefill)

La consulta se procesa en una sola pasada paralela. Esto está limitado por la capacidad de cómputo: satura los núcleos tensor de la GPU.

lectura tok/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Decodificación (Generación)

Cada nuevo token requiere cargar todos los pesos activos del modelo desde la VRAM. Esto está limitado por el ancho de banda de memoria: la GPU se detiene esperando datos en lugar de computar.

decodificación tok/s ≈ ancho de banda × decodeFactor ÷ (pesos + caché_kv)

Pesos = (activeParams × bits ÷ 8) × 1.15 de sobrecarga. Caché KV por paso = activeParams × multiplicador × contextK.

Factores de utilización por arquitectura

Arquitectura
Decodificación
Lectura
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Núcleos pre-tensor (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Izquierda: factor de decodificación — Derecha: factor de lectura

Fuentes de datos

Los TFLOPS y el ancho de banda de memoria se leen de la base de datos de GPU. Si no están disponibles, el ancho de banda recurre a una lista predefinida.

Limitaciones

Estas son estimaciones analíticas, no resultados de pruebas reales. Úsalas como una comparación relativa, no como una garantía absoluta de rendimiento.