Passer au contenu

Meilleur GPU pour Gemma 4 12B en local

Prix en temps réel et recommandations matérielles mises à jour pour août 2026.

12B
12B
dense

Gemma 4 12B est un modèle dense : ses 12 milliards de paramètres s'activent à chaque token, la vitesse de génération dépend donc de la rapidité avec laquelle votre carte peut lire l'ensemble des poids.

Pour exécuter Gemma 4 12B en local, il vous faut environ 10 Go de VRAM en quantification Q4_K_M avec un contexte de 64k tokens. La carte offrant le meilleur rapport qualité-prix est la Arc B580 (12 Go), qui devrait générer environ 13 tokens par seconde.

Ajuster la longueur du contexte

Glissez vers les tailles courantes ou saisissez une valeur manuellement.

k tokens
8k
16k
32k
64k
128k
256k
Entrée de gammeQ3_K_M quant
5.2 GB
3.1 GB
VRAM totale :8.2 GB

Matériel recommandé

Arc B580
511 tok/sprefill
15 tok/sgénération
EUR 307.73·12Go de VRAM
Voir la fiche
GeForce RTX 4070
564 tok/sprefill
17 tok/sgénération
EUR 999.99·12Go de VRAM
Voir la fiche

À 64k de contexte, les poids + le cache KV atteignent ~8 Go — les cartes de 12 Go offrent une marge confortable.

Équilibre parfaitQ4_K_M quant
6.9 GB
3.1 GB
VRAM totale :10 GB

Matériel recommandé

Arc B580
511 tok/sprefill
13 tok/sgénération
EUR 307.73·12Go de VRAM
Voir la fiche
GeForce RTX 5060 Ti 16GB
575 tok/sprefill
15 tok/sgénération
EUR 470.65·16Go de VRAM
Voir la fiche

Le Q4_K_M est le choix par défaut équilibré — il tient confortablement sur des cartes de 12-16 Go avec de la place pour une grande fenêtre de contexte.

Quasi sans perteQ8_0 quant
13.8 GB
3.1 GB
VRAM totale :16.9 GB

Matériel recommandé

GeForce RTX 3090
830 tok/sprefill
13 tok/sgénération
EUR 1849·24Go de VRAM
Voir la fiche
GeForce RTX 4090
1129 tok/sprefill
19 tok/sgénération
EUR 2324.99·24Go de VRAM
Voir la fiche
RTX A5000
352 tok/sprefill
11 tok/sgénération
EUR 2438·24Go de VRAM
Voir la fiche
RTX PRO 4000 Blackwell
843 tok/sprefill
15 tok/sgénération
EUR 2930.62·24Go de VRAM
Voir la fiche

Le Q8_0 est quasi sans perte pour un modèle 12B. Les cartes de 24 Go accueillent l'intégralité des poids plus un long contexte.

Autres modèles ayant les mêmes besoins en VRAM

Comme les poids de Gemma 4 12B tiennent sur une carte de 12 Go, d'autres modèles de taille similaire fonctionnent sur le même GPU. La vitesse de génération varie — les modèles Mixture-of-Experts sont plus rapides, les modèles denses plus lents — mais tous se chargent dans la même VRAM :

Mistral NeMo 12B12BSOLAR 10.7B10.7BPhi-3 Medium14BPhi-414B

Configuration optimale pour Gemma 4 12B

Recommandations de quantification

Pour le codage et le raisonnement au quotidien, la Q4_K_M (quantification 4 bits) offre le meilleur équilibre entre qualité et efficacité mémoire — elle réduit les besoins en mémoire de plus de 70 % avec une perte de qualité minimale par rapport au FP16. Les préréglages Q8 et supérieurs préservent davantage de fidélité au prix d'une utilisation VRAM nettement plus élevée, ce qui peut forcer le déchargement des couches et nuire au débit.

Logiciel local recommandé

Nous recommandons Ollama comme exécuteur principal pour l'inférence locale grâce à son découpage automatique des modèles GPU et ses optimisations du cache de contexte. Pour les réglages avancés ou les fractionnements de quantification, llama.cpp avec Flash Attention compilé nativement offre le meilleur contrôle granulaire.

Exécuter Gemma 4 12B en local — FAQ

De combien de VRAM ai-je besoin pour exécuter Gemma 4 12B ?

Avec un contexte de 64k et la quantification du cache KV activée, Gemma 4 12B nécessite environ 10 Go de VRAM en Q4_K_M — la quantification à privilégier dans la plupart des cas. En Q3_K_M, ce chiffre descend à environ 8.2 Go au prix d'une certaine qualité, tandis que Q8_0 demande environ 16.9 Go pour la meilleure qualité possible avec ce modèle.

Sur quelle taille de carte graphique Gemma 4 12B tient-il ?

Gemma 4 12B nécessite environ 10 Go en Q4_K_M : une carte de 12 Go est donc la plus petite taille courante qui le conserve entièrement en VRAM. En dessous, il faut décharger des couches vers la RAM système, ce qui vous coûte généralement l'essentiel de votre vitesse de génération.

Quelle quantification choisir pour Gemma 4 12B ?

Utilisez Q4_K_M sauf si vous avez de la VRAM en réserve. Il demande environ 10 Go et ne perd presque rien face à la pleine précision. Q8_0 exige environ 16.9 Go pour un gain de qualité que peu de gens perçoivent en programmation ou en conversation. Consacrez plutôt la VRAM restante à un contexte plus long.

Quel est l'impact de la longueur de contexte sur la VRAM requise par Gemma 4 12B ?

Les poids du modèle sont fixes, mais le cache KV croît linéairement avec le contexte. Pour Gemma 4 12B avec un contexte de 64k, le cache pèse environ 3.1 Go ; en doublant à 128k, il atteint environ 6.1 Go. Désactiver la quantification du cache KV double encore ces valeurs.

Le même GPU peut-il exécuter d'autres modèles similaires à Gemma 4 12B ?

Oui. Gemma 4 12B nécessite environ 10 Go en Q4_K_M, et tout modèle dont les poids tiennent sur la même carte fonctionne dessus — y compris Mistral NeMo 12B (12B), SOLAR 10.7B (10.7B), Phi-3 Medium (14B), Phi-4 (14B). Les poids tiennent dans le même GPU ; la vitesse de génération varie (les modèles Mixture-of-Experts sont plus rapides, les modèles denses plus lents).

Comment les vitesses de tokens sont estimées

Deux métriques sont affichées par GPU : Lecture tok/s (la vitesse à laquelle le modèle ingère votre prompt) et Décodage tok/s (la vitesse à laquelle il renvoie les tokens). Elles modélisent des goulots d'étranglement fondamentalement différents.

📖

Lecture (Prefill)

Le prompt est traité en un seul passage parallèle. Il est limitée par le calcul : il sature les tensor cores du GPU.

lecture tok/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Décodage (Génération)

Chaque nouveau token nécessite de charger l'intégralité des poids actifs du modèle depuis la VRAM. Ce processus est limitée par la bande passante mémoire : le GPU attend les données, il ne calcule pas.

décodage tok/s ≈ bande passante × decodeFactor ÷ (poids + kv_cache)

Poids = (activeParams × bits ÷ 8) × 1,15 de surcharge. Cache KV par étape = activeParams × multiplicateur × contextK.

Facteurs d'utilisation par architecture

Architecture
Décodage
Lecture
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Pré-tensor-core (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Gauche : facteur de décodage — Droite : facteur de lecture

Sources des données

Les TFLOPS et la bande passante mémoire proviennent de la base de données GPU. En leur absence, la bande passante se rabat sur un dictionnaire codé en dur.

Limites

Il s'agit d'estimations analytiques, pas de résultats de benchmarks. Utilisez-les comme une comparaison relative, pas comme une garantie de performance absolue.