Saltar al contenido

Mejor GPU para gpt-oss-20b en local

Precios en tiempo real y recomendaciones de hardware actualizados para agosto de 2026.

20B
20B
dense

gpt-oss-20b es un modelo denso: sus 20B de parámetros se activan en cada token, así que la velocidad de generación depende de lo rápido que tu tarjeta pueda leer todos los pesos.

Para ejecutar gpt-oss-20b en local necesitas unos 14.1 GB de VRAM con cuantización Q4_K_M y un contexto de 32k tokens. La tarjeta con mejor relación calidad-precio que encaja es la GeForce RTX 5060 Ti 16GB (16 GB), que debería generar alrededor de 12 tokens por segundo.

Ajustar longitud de contexto

Desliza para seleccionar tamaños populares o escribe un valor manualmente.

k tokens
8k
16k
32k
64k
128k
256k
Entrada económicaQ3_K_M cuant
8.6 GB
2.6 GB
VRAM total:11.2 GB

Hardware recomendado

Arc B580
306 tok/sprefill
13 tok/sgeneración
EUR 322·12GB de VRAM
Ver tarjeta
GeForce RTX 4070
339 tok/sprefill
14 tok/sgeneración
EUR 989.99·12GB de VRAM
Ver tarjeta

Los pesos Q3 (~8,6GB) más la caché KV de 32k alcanzan ~11GB. Las tarjetas de 12GB cubren toda la ventana de contexto con margen.

Equilibrio idealQ4_K_M cuant
11.5 GB
2.6 GB
VRAM total:14.1 GB

Hardware recomendado

GeForce RTX 5060 Ti 16GB
345 tok/sprefill
12 tok/sgeneración
EUR 679.99·16GB de VRAM
Ver tarjeta
GeForce RTX 4060 Ti 16GB
194 tok/sprefill
7 tok/sgeneración
EUR 1029·16GB de VRAM
Ver tarjeta

Los pesos Q4 (~11,5GB) más la caché KV de 32k alcanzan ~14GB. Las tarjetas de 16GB son la configuración principal ideal.

Casi sin pérdidasQ8_0 cuant
23 GB
2.6 GB
VRAM total:25.6 GB

Hardware recomendado

Radeon PRO W7800
344 tok/sprefill
6 tok/sgeneración
EUR 1818.99·32GB de VRAM
Ver tarjeta
RTX PRO 4500 Blackwell
592 tok/sprefill
14 tok/sgeneración
EUR 4509.33·32GB de VRAM
Ver tarjeta
GeForce RTX 5090
1380 tok/sprefill
29 tok/sgeneración
EUR 4716.7·32GB de VRAM
Ver tarjeta
RTX A6000
294 tok/sprefill
8 tok/sgeneración
Agotado·48GB de VRAM
Ver tarjeta

Los pesos Q8 (~23GB) más la caché KV de 32k superan los 24GB. Las tarjetas de 32GB+ ofrecen una precisión casi sin pérdidas sin restricción de VRAM.

Otros modelos con el mismo requisito de VRAM

Como los pesos de gpt-oss-20b caben en una tarjeta de 16 GB, otros modelos de tamaño similar funcionan en la misma GPU. La velocidad de generación varía — los modelos Mixture-of-Experts son más rápidos, los densos más lentos — pero todos caben en la misma VRAM:

InternLM2.5-20B20BCodestral 22B22.2BDiffusionGemma 26B-A4B25.2B

Optimización de configuración para gpt-oss-20b

Recomendaciones de cuantización

Para tareas diarias de programación y razonamiento, Q4_K_M (cuantización de 4 bits) ofrece el mejor equilibrio entre calidad y eficiencia de memoria: reduce los requisitos de memoria en más del 70% con una pérdida de calidad mínima en comparación con FP16. Los ajustes preestablecidos Q8 y superiores conservan más fidelidad a costa de un uso de VRAM significativamente mayor, lo que puede forzar la descarga de capas y reducir el rendimiento de generación.

Software local recomendado

Recomendamos usar Ollama como el ejecutor principal para la inferencia local debido a su división automática de modelos en GPU y optimizaciones de caché de contexto. Para ajustes finos avanzados o divisiones de cuantización, llama.cpp compilado de forma nativa con Flash Attention proporciona el mejor control granular.

Ejecutar gpt-oss-20b en local: preguntas frecuentes

¿Cuánta VRAM necesito para ejecutar gpt-oss-20b?

Con un contexto de 32k y la cuantización de la caché KV activada, gpt-oss-20b necesita unos 14.1 GB de VRAM en Q4_K_M, la cuantización recomendada para la mayoría. Bajar a Q3_K_M lo reduce a unos 11.2 GB con cierta pérdida de calidad, mientras que Q8_0 requiere unos 25.6 GB para la mejor calidad que puede dar este modelo.

¿En qué tamaño de tarjeta gráfica cabe gpt-oss-20b?

gpt-oss-20b necesita unos 14.1 GB en Q4_K_M, así que una tarjeta de 16 GB es el tamaño común más pequeño que lo mantiene íntegro en VRAM. Por debajo hay que descargar capas a la RAM del sistema, lo que suele costarte la mayor parte de la velocidad de generación.

¿Qué cuantización debo usar para gpt-oss-20b?

Usa Q4_K_M salvo que te sobre VRAM. Necesita unos 14.1 GB y pierde muy poca calidad frente a la precisión completa. Q8_0 requiere unos 25.6 GB para una mejora que casi nadie percibe programando o conversando. Dedica la VRAM sobrante a un contexto más largo.

¿Cómo afecta la longitud del contexto a la VRAM que necesita gpt-oss-20b?

Los pesos del modelo son fijos, pero la caché KV crece de forma lineal con el contexto. Para gpt-oss-20b con un contexto de 32k la caché ocupa unos 2.6 GB; al doblarlo a 64k sube a unos 5.1 GB. Desactivar la cuantización de la caché KV vuelve a duplicar esas cifras.

¿Puede la misma GPU ejecutar otros modelos similares a gpt-oss-20b?

Sí. gpt-oss-20b necesita unos 14.1 GB en Q4_K_M, y cualquier modelo cuyos pesos quepan en la misma tarjeta funciona en ella — incluidos InternLM2.5-20B (20B), Codestral 22B (22.2B), DiffusionGemma 26B-A4B (25.2B). Los pesos caben en la misma GPU; la velocidad de generación varía (los modelos Mixture-of-Experts son más rápidos, los densos más lentos).

Cómo se estiman las velocidades de tokens

Cómo calculamos la Puntuación de Valor GPU y normalizamos los datos del mercado.

📖

Lectura (Prefill)

La consulta se procesa en una sola pasada paralela. Esto está limitado por la capacidad de cómputo: satura los núcleos tensor de la GPU.

lectura tok/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Decodificación (Generación)

Cada nuevo token requiere cargar todos los pesos activos del modelo desde la VRAM. Esto está limitado por el ancho de banda de memoria: la GPU se detiene esperando datos en lugar de computar.

decodificación tok/s ≈ ancho de banda × decodeFactor ÷ (pesos + caché_kv)

Pesos = (activeParams × bits ÷ 8) × 1.15 de sobrecarga. Caché KV por paso = activeParams × multiplicador × contextK.

Factores de utilización por arquitectura

Arquitectura
Decodificación
Lectura
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Núcleos pre-tensor (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Izquierda: factor de decodificación — Derecha: factor de lectura

Fuentes de datos

Los TFLOPS y el ancho de banda de memoria se leen de la base de datos de GPU. Si no están disponibles, el ancho de banda recurre a una lista predefinida.

Limitaciones

Estas son estimaciones analíticas, no resultados de pruebas reales. Úsalas como una comparación relativa, no como una garantía absoluta de rendimiento.