Saltar al contenido

Mejor GPU para DeepSeek-R1-Distill-14B en local

Precios en tiempo real y recomendaciones de hardware actualizados para agosto de 2026.

14B
14B
dense

DeepSeek-R1-Distill-14B es un modelo denso: sus 14B de parámetros se activan en cada token, así que la velocidad de generación depende de lo rápido que tu tarjeta pueda leer todos los pesos.

Para ejecutar DeepSeek-R1-Distill-14B en local necesitas unos 9.8 GB de VRAM con cuantización Q4_K_M y un contexto de 32k tokens. La tarjeta con mejor relación calidad-precio que encaja es la Arc B580 (12 GB), que debería generar alrededor de 15 tokens por segundo.

Ajustar longitud de contexto

Desliza para seleccionar tamaños populares o escribe un valor manualmente.

k tokens
8k
16k
32k
64k
128k
256k
Entrada económicaQ3_K_M cuant
6 GB
1.8 GB
VRAM total:7.8 GB

Hardware recomendado

Arc B580
438 tok/sprefill
18 tok/sgeneración
CAD 429.99·12GB de VRAM
Ver tarjeta
GeForce RTX 5060
493 tok/sprefill
21 tok/sgeneración
CAD 519.99·8GB de VRAM
Ver tarjeta

Cabe en tarjetas de gama de entrada de 8GB para un uso básico. El contexto y la velocidad de tokens estarán limitados pero serán funcionales.

Equilibrio idealQ4_K_M cuant
8 GB
1.8 GB
VRAM total:9.8 GB

Hardware recomendado

Arc B580
438 tok/sprefill
15 tok/sgeneración
CAD 429.99·12GB de VRAM
Ver tarjeta
GeForce RTX 4070
484 tok/sprefill
16 tok/sgeneración
CAD 1019.99·12GB de VRAM
Ver tarjeta

Se ejecuta con fluidez en tarjetas de 12GB–16GB con buen margen de contexto. El nivel ideal de relación precio-rendimiento.

Casi sin pérdidasQ8_0 cuant
16.1 GB
1.8 GB
VRAM total:17.9 GB

Hardware recomendado

GeForce RTX 3090
711 tok/sprefill
13 tok/sgeneración
CAD 2299.99·24GB de VRAM
Ver tarjeta
GeForce RTX 4090
968 tok/sprefill
19 tok/sgeneración
CAD 6137.99·24GB de VRAM
Ver tarjeta

Precisión casi sin pérdidas. Los pesos por sí solos necesitan ~16GB, así que las tarjetas de 24GB dan holgura para el contexto.

Otros modelos con el mismo requisito de VRAM

Como los pesos de DeepSeek-R1-Distill-14B caben en una tarjeta de 12 GB, otros modelos de tamaño similar funcionan en la misma GPU. La velocidad de generación varía — los modelos Mixture-of-Experts son más rápidos, los densos más lentos — pero todos caben en la misma VRAM:

Phi-3 Medium14BPhi-414BQwen2.5-14B14.7BQwen3-14B14.8BMistral NeMo 12B12B

Optimización de configuración para DeepSeek-R1-Distill-14B

Recomendaciones de cuantización

Para tareas diarias de programación y razonamiento, Q4_K_M (cuantización de 4 bits) ofrece el mejor equilibrio entre calidad y eficiencia de memoria: reduce los requisitos de memoria en más del 70% con una pérdida de calidad mínima en comparación con FP16. Los ajustes preestablecidos Q8 y superiores conservan más fidelidad a costa de un uso de VRAM significativamente mayor, lo que puede forzar la descarga de capas y reducir el rendimiento de generación.

Software local recomendado

Recomendamos usar Ollama como el ejecutor principal para la inferencia local debido a su división automática de modelos en GPU y optimizaciones de caché de contexto. Para ajustes finos avanzados o divisiones de cuantización, llama.cpp compilado de forma nativa con Flash Attention proporciona el mejor control granular.

Ejecutar DeepSeek-R1-Distill-14B en local: preguntas frecuentes

¿Cuánta VRAM necesito para ejecutar DeepSeek-R1-Distill-14B?

Con un contexto de 32k y la cuantización de la caché KV activada, DeepSeek-R1-Distill-14B necesita unos 9.8 GB de VRAM en Q4_K_M, la cuantización recomendada para la mayoría. Bajar a Q3_K_M lo reduce a unos 7.8 GB con cierta pérdida de calidad, mientras que Q8_0 requiere unos 17.9 GB para la mejor calidad que puede dar este modelo.

¿En qué tamaño de tarjeta gráfica cabe DeepSeek-R1-Distill-14B?

DeepSeek-R1-Distill-14B necesita unos 9.8 GB en Q4_K_M, así que una tarjeta de 12 GB es el tamaño común más pequeño que lo mantiene íntegro en VRAM. Por debajo hay que descargar capas a la RAM del sistema, lo que suele costarte la mayor parte de la velocidad de generación.

¿Qué cuantización debo usar para DeepSeek-R1-Distill-14B?

Usa Q4_K_M salvo que te sobre VRAM. Necesita unos 9.8 GB y pierde muy poca calidad frente a la precisión completa. Q8_0 requiere unos 17.9 GB para una mejora que casi nadie percibe programando o conversando. Dedica la VRAM sobrante a un contexto más largo.

¿Cómo afecta la longitud del contexto a la VRAM que necesita DeepSeek-R1-Distill-14B?

Los pesos del modelo son fijos, pero la caché KV crece de forma lineal con el contexto. Para DeepSeek-R1-Distill-14B con un contexto de 32k la caché ocupa unos 1.8 GB; al doblarlo a 64k sube a unos 3.6 GB. Desactivar la cuantización de la caché KV vuelve a duplicar esas cifras.

¿Puede la misma GPU ejecutar otros modelos similares a DeepSeek-R1-Distill-14B?

Sí. DeepSeek-R1-Distill-14B necesita unos 9.8 GB en Q4_K_M, y cualquier modelo cuyos pesos quepan en la misma tarjeta funciona en ella — incluidos Phi-3 Medium (14B), Phi-4 (14B), Qwen2.5-14B (14.7B), Qwen3-14B (14.8B), Mistral NeMo 12B (12B). Los pesos caben en la misma GPU; la velocidad de generación varía (los modelos Mixture-of-Experts son más rápidos, los densos más lentos).

Cómo se estiman las velocidades de tokens

Cómo calculamos la Puntuación de Valor GPU y normalizamos los datos del mercado.

📖

Lectura (Prefill)

La consulta se procesa en una sola pasada paralela. Esto está limitado por la capacidad de cómputo: satura los núcleos tensor de la GPU.

lectura tok/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Decodificación (Generación)

Cada nuevo token requiere cargar todos los pesos activos del modelo desde la VRAM. Esto está limitado por el ancho de banda de memoria: la GPU se detiene esperando datos en lugar de computar.

decodificación tok/s ≈ ancho de banda × decodeFactor ÷ (pesos + caché_kv)

Pesos = (activeParams × bits ÷ 8) × 1.15 de sobrecarga. Caché KV por paso = activeParams × multiplicador × contextK.

Factores de utilización por arquitectura

Arquitectura
Decodificación
Lectura
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Núcleos pre-tensor (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Izquierda: factor de decodificación — Derecha: factor de lectura

Fuentes de datos

Los TFLOPS y el ancho de banda de memoria se leen de la base de datos de GPU. Si no están disponibles, el ancho de banda recurre a una lista predefinida.

Limitaciones

Estas son estimaciones analíticas, no resultados de pruebas reales. Úsalas como una comparación relativa, no como una garantía absoluta de rendimiento.