Saltar al contenido

Mejor GPU para DeepSeek-R1-Distill-32B en local

Precios en tiempo real y recomendaciones de hardware actualizados para agosto de 2026.

32B
32B
dense

DeepSeek-R1-Distill-32B es un modelo denso: sus 32B de parámetros se activan en cada token, así que la velocidad de generación depende de lo rápido que tu tarjeta pueda leer todos los pesos.

Para ejecutar DeepSeek-R1-Distill-32B en local necesitas unos 22.5 GB de VRAM con cuantización Q4_K_M y un contexto de 32k tokens. La tarjeta con mejor relación calidad-precio que encaja es la GeForce RTX 3090 (24 GB), que debería generar alrededor de 10 tokens por segundo.

Ajustar longitud de contexto

Desliza para seleccionar tamaños populares o escribe un valor manualmente.

k tokens
8k
16k
32k
64k
128k
256k
Entrada económicaQ3_K_M cuant
13.8 GB
4.1 GB
VRAM total:17.9 GB

Hardware recomendado

GeForce RTX 3090
311 tok/sprefill
12 tok/sgeneración
CAD 2299.99·24GB de VRAM
Ver tarjeta
RTX PRO 4000 Blackwell
316 tok/sprefill
14 tok/sgeneración
CAD 4632.44·24GB de VRAM
Ver tarjeta
GeForce RTX 4090
423 tok/sprefill
17 tok/sgeneración
CAD 6137.99·24GB de VRAM
Ver tarjeta

Los pesos Q3 (~14GB) más la caché KV GQA de 32k superan los 16GB. Las tarjetas de 24GB son el punto de entrada práctico para este modelo de 32B.

Equilibrio idealQ4_K_M cuant
18.4 GB
4.1 GB
VRAM total:22.5 GB

Hardware recomendado

GeForce RTX 3090
311 tok/sprefill
10 tok/sgeneración
CAD 2299.99·24GB de VRAM
Ver tarjeta
GeForce RTX 4090
423 tok/sprefill
14 tok/sgeneración
CAD 6137.99·24GB de VRAM
Ver tarjeta

Se ejecuta cómodamente en tarjetas de 24GB con Q4. Sólido rendimiento de razonamiento sin restricciones de VRAM.

Casi sin pérdidasQ8_0 cuant
36.8 GB
4.1 GB
VRAM total:40.9 GB

Hardware recomendado

RTX PRO 5000 Blackwell
496 tok/sprefill
13 tok/sgeneración
CAD 11155.4·48GB de VRAM
Ver tarjeta
RTX A6000
184 tok/sprefill
5 tok/sgeneración
CAD 11399·48GB de VRAM
Ver tarjeta

La precisión completa requiere tarjetas de nivel estación de trabajo de 48GB+ solo para la matriz de pesos.

Otros modelos con el mismo requisito de VRAM

Como los pesos de DeepSeek-R1-Distill-32B caben en una tarjeta de 24 GB, otros modelos de tamaño similar funcionan en la misma GPU. La velocidad de generación varía — los modelos Mixture-of-Experts son más rápidos, los densos más lentos — pero todos caben en la misma VRAM:

OpenReasoning-Nemotron-32B32B · Qwen2.5-32BQwen2.5-32B32.5BQwen2.5-Coder-32B32.5BQwQ-32B32.5BQwen3-32B32.8BGemma 4 31B31B

Optimización de configuración para DeepSeek-R1-Distill-32B

Recomendaciones de cuantización

Para tareas diarias de programación y razonamiento, Q4_K_M (cuantización de 4 bits) ofrece el mejor equilibrio entre calidad y eficiencia de memoria: reduce los requisitos de memoria en más del 70% con una pérdida de calidad mínima en comparación con FP16. Los ajustes preestablecidos Q8 y superiores conservan más fidelidad a costa de un uso de VRAM significativamente mayor, lo que puede forzar la descarga de capas y reducir el rendimiento de generación.

Software local recomendado

Recomendamos usar Ollama como el ejecutor principal para la inferencia local debido a su división automática de modelos en GPU y optimizaciones de caché de contexto. Para ajustes finos avanzados o divisiones de cuantización, llama.cpp compilado de forma nativa con Flash Attention proporciona el mejor control granular.

Ejecutar DeepSeek-R1-Distill-32B en local: preguntas frecuentes

¿Cuánta VRAM necesito para ejecutar DeepSeek-R1-Distill-32B?

Con un contexto de 32k y la cuantización de la caché KV activada, DeepSeek-R1-Distill-32B necesita unos 22.5 GB de VRAM en Q4_K_M, la cuantización recomendada para la mayoría. Bajar a Q3_K_M lo reduce a unos 17.9 GB con cierta pérdida de calidad, mientras que Q8_0 requiere unos 40.9 GB para la mejor calidad que puede dar este modelo.

¿En qué tamaño de tarjeta gráfica cabe DeepSeek-R1-Distill-32B?

DeepSeek-R1-Distill-32B necesita unos 22.5 GB en Q4_K_M, así que una tarjeta de 24 GB es el tamaño común más pequeño que lo mantiene íntegro en VRAM. Por debajo hay que descargar capas a la RAM del sistema, lo que suele costarte la mayor parte de la velocidad de generación.

¿Qué cuantización debo usar para DeepSeek-R1-Distill-32B?

Usa Q4_K_M salvo que te sobre VRAM. Necesita unos 22.5 GB y pierde muy poca calidad frente a la precisión completa. Q8_0 requiere unos 40.9 GB para una mejora que casi nadie percibe programando o conversando. Dedica la VRAM sobrante a un contexto más largo.

¿Cómo afecta la longitud del contexto a la VRAM que necesita DeepSeek-R1-Distill-32B?

Los pesos del modelo son fijos, pero la caché KV crece de forma lineal con el contexto. Para DeepSeek-R1-Distill-32B con un contexto de 32k la caché ocupa unos 4.1 GB; al doblarlo a 64k sube a unos 8.2 GB. Desactivar la cuantización de la caché KV vuelve a duplicar esas cifras.

¿Puede la misma GPU ejecutar otros modelos similares a DeepSeek-R1-Distill-32B?

Sí. DeepSeek-R1-Distill-32B necesita unos 22.5 GB en Q4_K_M, y cualquier modelo cuyos pesos quepan en la misma tarjeta funciona en ella — incluidos OpenReasoning-Nemotron-32B (32B, basado en Qwen2.5-32B), Qwen2.5-32B (32.5B), Qwen2.5-Coder-32B (32.5B), QwQ-32B (32.5B), Qwen3-32B (32.8B), Gemma 4 31B (31B). Los pesos caben en la misma GPU; la velocidad de generación varía (los modelos Mixture-of-Experts son más rápidos, los densos más lentos).

Cómo se estiman las velocidades de tokens

Cómo calculamos la Puntuación de Valor GPU y normalizamos los datos del mercado.

📖

Lectura (Prefill)

La consulta se procesa en una sola pasada paralela. Esto está limitado por la capacidad de cómputo: satura los núcleos tensor de la GPU.

lectura tok/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Decodificación (Generación)

Cada nuevo token requiere cargar todos los pesos activos del modelo desde la VRAM. Esto está limitado por el ancho de banda de memoria: la GPU se detiene esperando datos en lugar de computar.

decodificación tok/s ≈ ancho de banda × decodeFactor ÷ (pesos + caché_kv)

Pesos = (activeParams × bits ÷ 8) × 1.15 de sobrecarga. Caché KV por paso = activeParams × multiplicador × contextK.

Factores de utilización por arquitectura

Arquitectura
Decodificación
Lectura
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Núcleos pre-tensor (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Izquierda: factor de decodificación — Derecha: factor de lectura

Fuentes de datos

Los TFLOPS y el ancho de banda de memoria se leen de la base de datos de GPU. Si no están disponibles, el ancho de banda recurre a una lista predefinida.

Limitaciones

Estas son estimaciones analíticas, no resultados de pruebas reales. Úsalas como una comparación relativa, no como una garantía absoluta de rendimiento.