Passer au contenu

Meilleur GPU pour gpt-oss-120b en local

Prix en temps réel et recommandations matérielles mises à jour pour août 2026.

117B
5.1B
moe

gpt-oss-120b est un modèle à mélange d'experts : ses 117 milliards de paramètres doivent tous tenir en VRAM, mais seuls 5.1 milliards s'activent par token — il génère donc bien plus vite qu'un modèle dense de même taille, tout en exigeant autant de mémoire.

Pour exécuter gpt-oss-120b en local, il vous faut environ 67.9 Go de VRAM en quantification Q4_K_M avec un contexte de 32k tokens. La carte offrant le meilleur rapport qualité-prix est la RTX PRO 6000 Blackwell (96 Go), qui devrait générer environ 190 tokens par seconde.

Ajuster la longueur du contexte

Glissez vers les tailles courantes ou saisissez une valeur manuellement.

k tokens
8k
16k
32k
64k
128k
256k
Entrée de gammeQ3_K_M quant
50.5 GB
0.7 GB
VRAM totale :51.1 GB

Matériel recommandé

RTX PRO 6000 Blackwell
5392 tok/sprefill
230 tok/sgénération
EUR 13999·96Go de VRAM
Voir la fiche

Q3 weights are ~50 GB — past every consumer card, so the 96 GB RTX PRO 6000 Blackwell is the single-GPU entry point. With only 5.1B params active per token, llama.cpp expert-offload (--n-cpu-moe) is the cheaper route: keep the hot path on a 24-48 GB card and page the experts from system RAM.

Équilibre parfaitQ4_K_M quant
67.3 GB
0.7 GB
VRAM totale :67.9 GB

Matériel recommandé

RTX PRO 6000 Blackwell
5392 tok/sprefill
190 tok/sgénération
EUR 13999·96Go de VRAM
Voir la fiche

Q4 weights are ~67 GB, close to the model's native MXFP4 (~63 GB) format. A single 96 GB RTX PRO 6000 Blackwell (or an 80 GB data-center card) runs it at full quality and context; only 5.1B active parameters keep decode fast despite the 117B total.

Quasi sans perteQ8_0 quant
134.5 GB
0.7 GB
VRAM totale :135.2 GB

Matériel recommandé

Aucun GPU compatible trouvé dans la base de données. Parcourir tous les GPU

Q8 needs ~135 GB — a multi-GPU or unified-memory setup. gpt-oss ships in MXFP4 and is already near-lossless at that ~4-bit format, so Q8 is rarely worth the extra hardware.

Autres modèles ayant les mêmes besoins en VRAM

Comme les poids de gpt-oss-120b tiennent sur une carte de 96 Go, d'autres modèles de taille similaire fonctionnent sur le même GPU. La vitesse de génération varie — les modèles Mixture-of-Experts sont plus rapides, les modèles denses plus lents — mais tous se chargent dans la même VRAM :

Qwen3.5-122B-A10B122BDBRX132BMixtral 8x22B141B

Configuration optimale pour gpt-oss-120b

Recommandations de quantification

Pour le codage et le raisonnement au quotidien, la Q4_K_M (quantification 4 bits) offre le meilleur équilibre entre qualité et efficacité mémoire — elle réduit les besoins en mémoire de plus de 70 % avec une perte de qualité minimale par rapport au FP16. Les préréglages Q8 et supérieurs préservent davantage de fidélité au prix d'une utilisation VRAM nettement plus élevée, ce qui peut forcer le déchargement des couches et nuire au débit.

Logiciel local recommandé

Nous recommandons Ollama comme exécuteur principal pour l'inférence locale grâce à son découpage automatique des modèles GPU et ses optimisations du cache de contexte. Pour les réglages avancés ou les fractionnements de quantification, llama.cpp avec Flash Attention compilé nativement offre le meilleur contrôle granulaire.

Exécuter gpt-oss-120b en local — FAQ

De combien de VRAM ai-je besoin pour exécuter gpt-oss-120b ?

Avec un contexte de 32k et la quantification du cache KV activée, gpt-oss-120b nécessite environ 67.9 Go de VRAM en Q4_K_M — la quantification à privilégier dans la plupart des cas. En Q3_K_M, ce chiffre descend à environ 51.1 Go au prix d'une certaine qualité, tandis que Q8_0 demande environ 135.2 Go pour la meilleure qualité possible avec ce modèle.

Sur quelle taille de carte graphique gpt-oss-120b tient-il ?

gpt-oss-120b nécessite environ 67.9 Go en Q4_K_M, soit plus qu'une seule carte grand public de 24 Go. Il vous faut une carte station de travail, une configuration multi-GPU ou une quantification plus agressive — sinon les couches débordent vers la RAM système et la génération ralentit fortement.

Quelle quantification choisir pour gpt-oss-120b ?

Utilisez Q4_K_M sauf si vous avez de la VRAM en réserve. Il demande environ 67.9 Go et ne perd presque rien face à la pleine précision. Q8_0 exige environ 135.2 Go pour un gain de qualité que peu de gens perçoivent en programmation ou en conversation. Consacrez plutôt la VRAM restante à un contexte plus long.

Quel est l'impact de la longueur de contexte sur la VRAM requise par gpt-oss-120b ?

Les poids du modèle sont fixes, mais le cache KV croît linéairement avec le contexte. Pour gpt-oss-120b avec un contexte de 32k, le cache pèse environ 0.7 Go ; en doublant à 64k, il atteint environ 1.3 Go. Désactiver la quantification du cache KV double encore ces valeurs.

Pourquoi gpt-oss-120b est-il plus rapide que son nombre de paramètres ne le laisse penser ?

gpt-oss-120b est un modèle à mélange d'experts. Ses 117 milliards de paramètres doivent tous résider en VRAM, mais seuls 5.1 milliards servent à produire chaque token. La vitesse de génération dépend de la lecture de ces 5.1 milliards de paramètres actifs : le modèle se comporte donc bien plus comme un modèle de 5.1 milliards que de 117 milliards — tout en réclamant la mémoire des 117 milliards complets.

Le même GPU peut-il exécuter d'autres modèles similaires à gpt-oss-120b ?

Oui. gpt-oss-120b nécessite environ 67.9 Go en Q4_K_M, et tout modèle dont les poids tiennent sur la même carte fonctionne dessus — y compris Qwen3.5-122B-A10B (122B), DBRX (132B), Mixtral 8x22B (141B). Les poids tiennent dans le même GPU ; la vitesse de génération varie (les modèles Mixture-of-Experts sont plus rapides, les modèles denses plus lents).

Comment les vitesses de tokens sont estimées

Deux métriques sont affichées par GPU : Lecture tok/s (la vitesse à laquelle le modèle ingère votre prompt) et Décodage tok/s (la vitesse à laquelle il renvoie les tokens). Elles modélisent des goulots d'étranglement fondamentalement différents.

📖

Lecture (Prefill)

Le prompt est traité en un seul passage parallèle. Il est limitée par le calcul : il sature les tensor cores du GPU.

lecture tok/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Décodage (Génération)

Chaque nouveau token nécessite de charger l'intégralité des poids actifs du modèle depuis la VRAM. Ce processus est limitée par la bande passante mémoire : le GPU attend les données, il ne calcule pas.

décodage tok/s ≈ bande passante × decodeFactor ÷ (poids + kv_cache)

Poids = (activeParams × bits ÷ 8) × 1,15 de surcharge. Cache KV par étape = activeParams × multiplicateur × contextK.

Facteurs d'utilisation par architecture

Architecture
Décodage
Lecture
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Pré-tensor-core (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Gauche : facteur de décodage — Droite : facteur de lecture

Sources des données

Les TFLOPS et la bande passante mémoire proviennent de la base de données GPU. En leur absence, la bande passante se rabat sur un dictionnaire codé en dur.

Limites

Il s'agit d'estimations analytiques, pas de résultats de benchmarks. Utilisez-les comme une comparaison relative, pas comme une garantie de performance absolue.