Saltar al contenido

Mejor GPU para Qwen3.8-27B en local

Precios en tiempo real y recomendaciones de hardware actualizados para agosto de 2026.

27B
27B
dense

Qwen3.8-27B es un modelo denso: sus 27B de parámetros se activan en cada token, así que la velocidad de generación depende de lo rápido que tu tarjeta pueda leer todos los pesos.

Para ejecutar Qwen3.8-27B en local necesitas unos 19.7 GB de VRAM con cuantización Q4_K_M y un contexto de 128k tokens. La tarjeta con mejor relación calidad-precio que encaja es la GeForce RTX 3090 (24 GB), que debería generar alrededor de 11 tokens por segundo.

Ajustar longitud de contexto

Desliza para seleccionar tamaños populares o escribe un valor manualmente.

k tokens
8k
16k
32k
64k
128k
256k
Entrada económicaQ3_K_M cuant
11.6 GB
4.1 GB
VRAM total:15.8 GB

Hardware recomendado

Radeon RX 9060 XT 16GB
160 tok/sprefill
6 tok/sgeneración
CAD 689.99·16GB de VRAM
Ver tarjeta
GeForce RTX 5060 Ti 16GB
256 tok/sprefill
10 tok/sgeneración
CAD 949.99·16GB de VRAM
Ver tarjeta

Q3 weights are ~12 GB. Because ~three-quarters of the layers use linear attention, the KV cache barely grows with context — even a 128k window adds only ~4 GB, so a 16 GB card holds the whole thing. This hybrid attention is why a 27B model runs long context on mainstream hardware.

Equilibrio idealQ4_K_M cuant
15.5 GB
4.1 GB
VRAM total:19.7 GB

Hardware recomendado

GeForce RTX 3090
369 tok/sprefill
11 tok/sgeneración
CAD 2199.99·24GB de VRAM
Ver tarjeta
GeForce RTX 4090
502 tok/sprefill
16 tok/sgeneración
CAD 6137.99·24GB de VRAM
Ver tarjeta

Q4 weights (~15.5 GB) plus the small hybrid-attention KV cache stay under 20 GB at 128k context. A 24 GB card runs it at the balanced quant with room to push toward the native 262k window.

Casi sin pérdidasQ8_0 cuant
31 GB
4.1 GB
VRAM total:35.2 GB

Hardware recomendado

RTX PRO 5000 Blackwell
588 tok/sprefill
15 tok/sgeneración
CAD 11190.7·48GB de VRAM
Ver tarjeta
RTX A6000
218 tok/sprefill
5 tok/sgeneración
CAD 11399·48GB de VRAM
Ver tarjeta

Near-lossless Q8 weights are ~31 GB. A 48 GB workstation card holds the full precision model with headroom for the extended 262k-1M context this model supports.

Otros modelos con el mismo requisito de VRAM

Como los pesos de Qwen3.8-27B caben en una tarjeta de 24 GB, otros modelos de tamaño similar funcionan en la misma GPU. La velocidad de generación varía — los modelos Mixture-of-Experts son más rápidos, los densos más lentos — pero todos caben en la misma VRAM:

DiffusionGemma 26B-A4B25.2BNemotron-3-Nano-30B-A3B30BNorth-Mini-Code-1.030BGLM-4.7-Flash30.5BQwen3-30B-A3B30.5BQwen3-Coder-30B-A3B30.5B · Qwen3-30B-A3B

Optimización de configuración para Qwen3.8-27B

Recomendaciones de cuantización

Para tareas diarias de programación y razonamiento, Q4_K_M (cuantización de 4 bits) ofrece el mejor equilibrio entre calidad y eficiencia de memoria: reduce los requisitos de memoria en más del 70% con una pérdida de calidad mínima en comparación con FP16. Los ajustes preestablecidos Q8 y superiores conservan más fidelidad a costa de un uso de VRAM significativamente mayor, lo que puede forzar la descarga de capas y reducir el rendimiento de generación.

Software local recomendado

Recomendamos usar Ollama como el ejecutor principal para la inferencia local debido a su división automática de modelos en GPU y optimizaciones de caché de contexto. Para ajustes finos avanzados o divisiones de cuantización, llama.cpp compilado de forma nativa con Flash Attention proporciona el mejor control granular.

Ejecutar Qwen3.8-27B en local: preguntas frecuentes

¿Cuánta VRAM necesito para ejecutar Qwen3.8-27B?

Con un contexto de 128k y la cuantización de la caché KV activada, Qwen3.8-27B necesita unos 19.7 GB de VRAM en Q4_K_M, la cuantización recomendada para la mayoría. Bajar a Q3_K_M lo reduce a unos 15.8 GB con cierta pérdida de calidad, mientras que Q8_0 requiere unos 35.2 GB para la mejor calidad que puede dar este modelo.

¿En qué tamaño de tarjeta gráfica cabe Qwen3.8-27B?

Qwen3.8-27B necesita unos 19.7 GB en Q4_K_M, así que una tarjeta de 24 GB es el tamaño común más pequeño que lo mantiene íntegro en VRAM. Por debajo hay que descargar capas a la RAM del sistema, lo que suele costarte la mayor parte de la velocidad de generación.

¿Qué cuantización debo usar para Qwen3.8-27B?

Usa Q4_K_M salvo que te sobre VRAM. Necesita unos 19.7 GB y pierde muy poca calidad frente a la precisión completa. Q8_0 requiere unos 35.2 GB para una mejora que casi nadie percibe programando o conversando. Dedica la VRAM sobrante a un contexto más largo.

¿Cómo afecta la longitud del contexto a la VRAM que necesita Qwen3.8-27B?

Los pesos del modelo son fijos, pero la caché KV crece de forma lineal con el contexto. Para Qwen3.8-27B con un contexto de 128k la caché ocupa unos 4.1 GB; al doblarlo a 256k sube a unos 8.3 GB. Desactivar la cuantización de la caché KV vuelve a duplicar esas cifras.

¿Puede la misma GPU ejecutar otros modelos similares a Qwen3.8-27B?

Sí. Qwen3.8-27B necesita unos 19.7 GB en Q4_K_M, y cualquier modelo cuyos pesos quepan en la misma tarjeta funciona en ella — incluidos DiffusionGemma 26B-A4B (25.2B), Nemotron-3-Nano-30B-A3B (30B), North-Mini-Code-1.0 (30B), GLM-4.7-Flash (30.5B), Qwen3-30B-A3B (30.5B), Qwen3-Coder-30B-A3B (30.5B, basado en Qwen3-30B-A3B). Los pesos caben en la misma GPU; la velocidad de generación varía (los modelos Mixture-of-Experts son más rápidos, los densos más lentos).

Cómo se estiman las velocidades de tokens

Cómo calculamos la Puntuación de Valor GPU y normalizamos los datos del mercado.

📖

Lectura (Prefill)

La consulta se procesa en una sola pasada paralela. Esto está limitado por la capacidad de cómputo: satura los núcleos tensor de la GPU.

lectura tok/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Decodificación (Generación)

Cada nuevo token requiere cargar todos los pesos activos del modelo desde la VRAM. Esto está limitado por el ancho de banda de memoria: la GPU se detiene esperando datos en lugar de computar.

decodificación tok/s ≈ ancho de banda × decodeFactor ÷ (pesos + caché_kv)

Pesos = (activeParams × bits ÷ 8) × 1.15 de sobrecarga. Caché KV por paso = activeParams × multiplicador × contextK.

Factores de utilización por arquitectura

Arquitectura
Decodificación
Lectura
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Núcleos pre-tensor (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Izquierda: factor de decodificación — Derecha: factor de lectura

Fuentes de datos

Los TFLOPS y el ancho de banda de memoria se leen de la base de datos de GPU. Si no están disponibles, el ancho de banda recurre a una lista predefinida.

Limitaciones

Estas son estimaciones analíticas, no resultados de pruebas reales. Úsalas como una comparación relativa, no como una garantía absoluta de rendimiento.