Passer au contenu

Meilleur GPU pour les modèles LLM locaux

Exécuter des LLM en local nécessite d'adapter le budget VRAM aux niveaux de quantification et aux tailles de contexte. Utilisez notre calculateur en direct ci-dessous pour estimer l'empreinte mémoire et parcourir les guides par modèle.

Parcourir les guides de modèles LLM

Alibaba Qwen

Qwen3.8-27B

dense

Un modèle vision-langage dense de 27B dont l'attention linéaire hybride réduit fortement le cache KV — il fait tourner un contexte de 128k+ sur une seule carte de 16-24 Go, avec une fenêtre native de 262k extensible à 1M.

Paramètres
27B
Actifs
27B
Contexte max
128k
Voir les détails du modèle et des GPU
DeepSeek

DeepSeek-V4-Flash

moe

Un modèle Mixture-of-Experts de 284B avec seulement 13B de paramètres actifs et un contexte de 1M de tokens. Ses poids nécessitent plusieurs GPU ou un déchargement CPU, mais seuls 13B s'activent par token, donc la génération reste rapide.

Paramètres
284B
Actifs
13B
Contexte max
128k
Voir les détails du modèle et des GPU
OpenAI

gpt-oss-120b

moe

Le modèle Mixture-of-Experts open-weight de 117B d'OpenAI avec 5,1B de paramètres actifs. Ses poids MXFP4 natifs tiennent sur un seul GPU de 80-96 Go, et le faible nombre de paramètres actifs accélère la génération.

Paramètres
117B
Actifs
5.1B
Contexte max
32k
Voir les détails du modèle et des GPU
Alibaba Qwen

Qwen3.6-Coder-27B

dense

Modèle dense de pointe avec une compréhension approfondie des mathématiques, du codage et de l'ingénierie.

Paramètres
27B
Actifs
27B
Contexte max
32k
Voir les détails du modèle et des GPU
Alibaba Qwen

Qwen3.6-35B-A3B

moe

Énorme codeur Mixture-of-Experts optimisé pour les configurations ciblant 16 à 24 Go de VRAM.

Paramètres
35B
Actifs
3B
Contexte max
32k
Voir les détails du modèle et des GPU
Google

Gemma 4 26B-A4B

moe

Le MoE haute densité de Google, conçu pour le codage et le raisonnement complexes.

Paramètres
26B
Actifs
4B
Contexte max
64k
Voir les détails du modèle et des GPU
Google

Gemma 4 12B

dense

Modèle dense léger et rapide, optimisé pour les configurations grand public standard.

Paramètres
12B
Actifs
12B
Contexte max
64k
Voir les détails du modèle et des GPU
DeepSeek

DeepSeek-R1-Distill-14B

dense

Raisonnement de pointe condensé dans un modèle 14B compact. Performances STEM et codage solides sur n'importe quel GPU 12 Go+.

Paramètres
14B
Actifs
14B
Contexte max
32k
Voir les détails du modèle et des GPU
DeepSeek

DeepSeek-R1-Distill-32B

dense

Puissance de raisonnement intermédiaire pour cartes 24 Go. Égale les modèles frontières en maths, codage et logique.

Paramètres
32B
Actifs
32B
Contexte max
32k
Voir les détails du modèle et des GPU
Mistral AI

Mistral Small 3.1 24B

dense

Modèle dense efficace avec support multilingue étendu et appels de fonction natifs. Tient sur les cartes 16 Go en Q4.

Paramètres
24B
Actifs
24B
Contexte max
128k
Voir les détails du modèle et des GPU
Meta

Llama 4 Scout 109B-A17B

moe

Le vaisseau amiral MoE le plus accessible de Meta — 17 paramètres actifs offrent une qualité solide sur du matériel professionnel.

Paramètres
109B
Actifs
17B
Contexte max
64k
Voir les détails du modèle et des GPU
Tencent

Hy-MT2-7B

dense

Modèle dense 7B polyvalent conçu pour une inférence locale efficace sur les GPU d'entrée à moyenne gamme.

Paramètres
7B
Actifs
7B
Contexte max
32k
Voir les détails du modèle et des GPU
OpenAI

gpt-oss-20b

dense

Le modèle de raisonnement grand public d'OpenAI, conçu pour fonctionner sans compromis sur du matériel local standard.

Paramètres
20B
Actifs
20B
Contexte max
32k
Voir les détails du modèle et des GPU
NVIDIA

NVIDIA Nemotron-3-Nano-4B

dense

Modèle NVIDIA 4B ultra-compact qui tient confortablement sur presque tous les GPU modernes — idéal pour les configurations mobiles et embarquées.

Paramètres
4B
Actifs
4B
Contexte max
32k
Voir les détails du modèle et des GPU
Alibaba Qwen

Qwen3-Next-80B-A3B

moe

Énorme Mixture-of-Experts de 80B avec seulement 3B de paramètres actifs — nécessite une carte station de travail de 48 Go, mais génère aussi vite qu'un petit modèle.

Paramètres
80B
Actifs
3B
Contexte max
32k
Voir les détails du modèle et des GPU

GPU pour configuration de modèle personnalisée

27B
3B14B27B35B70B+
32k tokens
8k32k64k96k128k

Foire aux questions

Questions fréquentes sur le choix d'un GPU pour l'inférence LLM locale.