Passer au contenu

Meilleur GPU pour les modèles LLM locaux

Exécuter des LLM en local nécessite d'adapter le budget VRAM aux niveaux de quantification et aux tailles de contexte. Utilisez notre calculateur en direct ci-dessous pour estimer l'empreinte mémoire et parcourir les guides par modèle.

Parcourir les guides de modèles LLM

Alibaba Qwen

Qwen3.8-27B

dense

Un modèle vision-langage dense de 27B dont l'attention linéaire hybride réduit fortement le cache KV — il fait tourner un contexte de 128k+ sur une seule carte de 16-24 Go, avec une fenêtre native de 262k extensible à 1M.

Paramètres
27B
Actifs
27B
Contexte max
128k
Voir les détails du modèle et des GPU
DeepSeek

DeepSeek-V4-Flash

moe

Un modèle Mixture-of-Experts de 284B avec seulement 13B de paramètres actifs et un contexte de 1M de tokens. Ses poids nécessitent plusieurs GPU ou un déchargement CPU, mais seuls 13B s'activent par token, donc la génération reste rapide.

Paramètres
284B
Actifs
13B
Contexte max
128k
Voir les détails du modèle et des GPU
OpenAI

gpt-oss-120b

moe

Le modèle Mixture-of-Experts open-weight de 117B d'OpenAI avec 5,1B de paramètres actifs. Ses poids MXFP4 natifs tiennent sur un seul GPU de 80-96 Go, et le faible nombre de paramètres actifs accélère la génération.

Paramètres
117B
Actifs
5.1B
Contexte max
32k
Voir les détails du modèle et des GPU
Alibaba Qwen

Qwen3.6-Coder-27B

dense

Modèle dense de pointe avec une compréhension approfondie des mathématiques, du codage et de l'ingénierie.

Paramètres
27B
Actifs
27B
Contexte max
32k
Voir les détails du modèle et des GPU
Alibaba Qwen

Qwen3.6-35B-A3B

moe

Énorme codeur Mixture-of-Experts optimisé pour les configurations ciblant 16 à 24 Go de VRAM.

Paramètres
35B
Actifs
3B
Contexte max
32k
Voir les détails du modèle et des GPU
Google

Gemma 4 26B-A4B

moe

Le MoE haute densité de Google, conçu pour le codage et le raisonnement complexes.

Paramètres
26B
Actifs
4B
Contexte max
64k
Voir les détails du modèle et des GPU
Google

Gemma 4 12B

dense

Modèle dense léger et rapide, optimisé pour les configurations grand public standard.

Paramètres
12B
Actifs
12B
Contexte max
64k
Voir les détails du modèle et des GPU
DeepSeek

DeepSeek-R1-Distill-14B

dense

Raisonnement de pointe condensé dans un modèle 14B compact. Performances STEM et codage solides sur n'importe quel GPU 12 Go+.

Paramètres
14B
Actifs
14B
Contexte max
32k
Voir les détails du modèle et des GPU
DeepSeek

DeepSeek-R1-Distill-32B

dense

Puissance de raisonnement intermédiaire pour cartes 24 Go. Égale les modèles frontières en maths, codage et logique.

Paramètres
32B
Actifs
32B
Contexte max
32k
Voir les détails du modèle et des GPU
Mistral AI

Mistral Small 3.1 24B

dense

Modèle dense efficace avec support multilingue étendu et appels de fonction natifs. Tient sur les cartes 16 Go en Q4.

Paramètres
24B
Actifs
24B
Contexte max
128k
Voir les détails du modèle et des GPU
Meta

Llama 4 Scout 109B-A17B

moe

Le vaisseau amiral MoE le plus accessible de Meta — 17 paramètres actifs offrent une qualité solide sur du matériel professionnel.

Paramètres
109B
Actifs
17B
Contexte max
64k
Voir les détails du modèle et des GPU
Tencent

Hy-MT2-7B

dense

Modèle dense 7B polyvalent conçu pour une inférence locale efficace sur les GPU d'entrée à moyenne gamme.

Paramètres
7B
Actifs
7B
Contexte max
32k
Voir les détails du modèle et des GPU
OpenAI

gpt-oss-20b

dense

Le modèle de raisonnement grand public d'OpenAI, conçu pour fonctionner sans compromis sur du matériel local standard.

Paramètres
20B
Actifs
20B
Contexte max
32k
Voir les détails du modèle et des GPU
NVIDIA

NVIDIA Nemotron-3-Nano-4B

dense

Modèle NVIDIA 4B ultra-compact qui tient confortablement sur presque tous les GPU modernes — idéal pour les configurations mobiles et embarquées.

Paramètres
4B
Actifs
4B
Contexte max
32k
Voir les détails du modèle et des GPU
Alibaba Qwen

Qwen3-Next-80B-A3B

moe

Énorme Mixture-of-Experts de 80B avec seulement 3B de paramètres actifs — nécessite une carte station de travail de 48 Go, mais génère aussi vite qu'un petit modèle.

Paramètres
80B
Actifs
3B
Contexte max
32k
Voir les détails du modèle et des GPU

GPU pour configuration de modèle personnalisée

27B
3B14B27B35B70B+
32k tokens
8k32k64k96k128k

Estimation de l'empreinte

VRAM19 Go
P : 15.5Go
KV : 3.5 Go

Foire aux questions

Questions fréquentes sur le choix d'un GPU pour l'inférence LLM locale.

De combien de VRAM ai-je vraiment besoin pour un LLM local en 2026 ?

Cela dépend de la taille du modèle et de la quantification. Un modèle 12B en Q4 tient dans environ 7 à 8 Go, ce qui rend une carte 12 Go exploitable. Pour des modèles 26–27B, il vous faut 14–18 Go — une carte 16 Go est le sweet spot. Les modèles 70B+ nécessitent 40 à 80 Go, ce qui demande plusieurs GPU ou des cartes workstation haut de gamme.

Qu'est-ce que le déchargement CPU et pourquoi est-ce lent ?

Le déchargement CPU déplace les couches qui ne tiennent pas dans la VRAM vers la RAM système. La bande passante de la RAM système est de 40 à 80 Go/s — environ 10 à 20 fois plus lente que la mémoire GPU. Pour une inférence fluide, conservez l'intégralité du modèle quantifié dans la VRAM.

Que signifient Q4_K_M ou Q8_0 en quantification ?

La quantification réduit chaque poids du modèle de 16 bits à moins de bits pour économiser de la mémoire. Q4_K_M utilise environ 4 bits par poids — environ la moitié de la VRAM du FP16 avec une perte de qualité minime. Q8_0 utilise 8 bits, produisant une qualité quasi sans perte mais nécessitant environ deux fois plus de VRAM.

Qu'est-ce qu'un modèle MoE et pourquoi fonctionne-t-il plus vite que sa taille ne le suggère ?

Les modèles Mixture-of-Experts (MoE) ont un nombre total de paramètres élevé mais n'en activent qu'un petit sous-ensemble par token. Cela signifie que le calcul d'inférence et le cache KV évoluent avec le nombre de paramètres actifs, pas le total — donc un modèle MoE de 26B peut fonctionner plus vite qu'un modèle dense de 7B sur du matériel capable.

Dois-je choisir une carte GeForce grand public ou une carte workstation ?

Les cartes grand public offrent le meilleur rapport prix/Go de VRAM pour les quantités de gaming (8–24 Go). Les cartes workstation offrent une capacité VRAM plus élevée (32–96 Go) et de la mémoire ECC, à un coût nettement supérieur. Choisissez une carte grand public si votre modèle tient dans 24 Go ; optez pour une workstation si vous avez besoin de 32 Go ou plus.

Puis-je exécuter un LLM local sur un GPU AMD ?

Oui. ROCm prend en charge llama.cpp et Ollama sous Linux, et de plus en plus sous Windows. Les Radeon RX 7900 XTX (24 Go) et Radeon PRO W7900 (48 Go) sont d'excellents choix. Les performances sont comparables aux cartes NVIDIA équivalentes pour les charges d'inférence.

Puis-je exécuter un LM local sur un GPU Intel Arc ?

Oui. Les GPU Intel Arc (comme l'A770 16 Go) peuvent exécuter des LLM locaux en utilisant IPEX (Intel Extension for PyTorch) ou le backend OpenVINO, qui est pris en charge par llama.cpp et Ollama. L'A770 16 Go est l'une des options de VRAM de 16 Go les plus abordables du marché, offrant de solides performances d'inférence pour les petits budgets, bien que la configuration puisse être légèrement plus complexe que celle de CUDA de NVIDIA.