Beste GPU für gpt-oss-120b lokal
Echtzeit-Preise und Hardware-Empfehlungen aktualisiert für August 2026.
gpt-oss-120b ist ein Mixture-of-Experts-Modell: Alle 117 Mrd. Parameter müssen im VRAM liegen, aber nur 5.1 Mrd. werden pro Token aktiviert — es generiert daher deutlich schneller als ein dichtes Modell gleicher Größe, benötigt aber ebenso viel Speicher.
Um gpt-oss-120b lokal auszuführen, benötigen Sie rund 67.9 GB VRAM bei Q4_K_M-Quantisierung und einem Kontext von 32k Token. Die preislich attraktivste passende Karte ist die RTX PRO 6000 Blackwell (96 GB), die etwa 190 Token pro Sekunde erzeugen dürfte.
Kontextlänge anpassen
Zu gängigen Größen schieben oder manuell einen Wert eingeben.
Empfohlene Hardware
Q3 weights are ~50 GB — past every consumer card, so the 96 GB RTX PRO 6000 Blackwell is the single-GPU entry point. With only 5.1B params active per token, llama.cpp expert-offload (--n-cpu-moe) is the cheaper route: keep the hot path on a 24-48 GB card and page the experts from system RAM.
Empfohlene Hardware
Q4 weights are ~67 GB, close to the model's native MXFP4 (~63 GB) format. A single 96 GB RTX PRO 6000 Blackwell (or an 80 GB data-center card) runs it at full quality and context; only 5.1B active parameters keep decode fast despite the 117B total.
Empfohlene Hardware
Keine passenden GPUs gefunden für Alle GPUs durchsuchen
Q8 needs ~135 GB — a multi-GPU or unified-memory setup. gpt-oss ships in MXFP4 and is already near-lossless at that ~4-bit format, so Q8 is rarely worth the extra hardware.
Andere Modelle mit demselben VRAM-Bedarf
Da die Gewichte von gpt-oss-120b auf eine 96-GB-Karte passen, laufen andere Modelle ähnlicher Größe auf derselben GPU. Die Generierungsgeschwindigkeit variiert — Mixture-of-Experts-Modelle sind schneller, dichte Modelle langsamer — aber alle passen in denselben VRAM:
Setup-Optimierung für gpt-oss-120b
Quantisierungs-Empfehlungen
Für tägliche Coding- und Reasoning-Aufgaben bietet Q4_K_M (4-Bit-Quantisierung) die beste Balance aus Qualität und Speichereffizienz – es reduziert den Speicherbedarf um über 70 % bei minimalem Qualitätsverlust im Vergleich zu FP16. Q8 und höhere Voreinstellungen bewahren mehr Details auf Kosten eines deutlich höheren VRAM-Bedarfs, was das Auslagern von Schichten erzwingen und den Durchsatz verringern kann.
Empfohlene lokale Software
Wir empfehlen Ollama als primären Runner für die lokale Inferenz aufgrund der automatischen GPU-Modellaufteilung und der Optimierung des Kontext-Caches. Für fortgeschrittenes Fine-Tuning oder Quantisierungsaufteilungen bietet das nativ kompilierte llama.cpp mit Flash Attention die beste granulare Kontrolle.
gpt-oss-120b lokal ausführen — FAQ
Wie viel VRAM brauche ich, um gpt-oss-120b auszuführen?
Bei einem Kontext von 32k und aktivierter KV-Cache-Quantisierung benötigt gpt-oss-120b etwa 67.9 GB VRAM bei Q4_K_M — die Quantisierung, die für die meisten die richtige Wahl ist. Q3_K_M senkt den Bedarf auf rund 51.1 GB bei etwas geringerer Qualität, Q8_0 verlangt rund 135.2 GB für die beste Qualität, die dieses Modell liefern kann.
Auf welche Grafikkartengröße passt gpt-oss-120b?
gpt-oss-120b benötigt bei Q4_K_M etwa 67.9 GB — mehr als eine einzelne Consumer-Karte mit 24 GB bietet. Sie brauchen eine Workstation-Karte, ein Multi-GPU-Setup oder eine aggressivere Quantisierung; andernfalls wandern Layer in den Systemspeicher und die Generierung wird drastisch langsamer.
Welche Quantisierung sollte ich für gpt-oss-120b verwenden?
Nehmen Sie Q4_K_M, sofern Sie kein VRAM übrig haben. Es benötigt etwa 67.9 GB und verliert gegenüber voller Präzision kaum Qualität. Q8_0 verlangt rund 135.2 GB für einen Qualitätsgewinn, den die wenigsten beim Programmieren oder Chatten bemerken. Investieren Sie übriges VRAM lieber in einen längeren Kontext.
Wie wirkt sich die Kontextlänge auf den VRAM-Bedarf von gpt-oss-120b aus?
Die Modellgewichte sind fix, der KV-Cache wächst jedoch linear mit dem Kontext. Bei gpt-oss-120b und einem Kontext von 32k belegt der Cache etwa 0.7 GB; eine Verdopplung auf 64k bringt ihn auf rund 1.3 GB. Ohne KV-Cache-Quantisierung verdoppeln sich diese Werte erneut.
Warum ist gpt-oss-120b schneller, als seine Parameterzahl vermuten lässt?
gpt-oss-120b ist ein Mixture-of-Experts-Modell. Seine 117 Mrd. Parameter müssen zwar vollständig im VRAM liegen, doch nur 5.1 Mrd. erzeugen jedes einzelne Token. Die Generierungsgeschwindigkeit hängt daran, diese 5.1 Mrd. aktiven Parameter zu lesen — das Modell verhält sich also eher wie ein 5.1-Mrd.- als ein 117-Mrd.-Modell, benötigt aber weiterhin Speicher für die vollen 117 Mrd.
Kann dieselbe GPU andere Modelle ausführen, die gpt-oss-120b ähneln?
Ja. gpt-oss-120b benötigt etwa 67.9 GB bei Q4_K_M, und jedes Modell, dessen Gewichte auf dieselbe Karte passen, läuft darauf — einschließlich Qwen3.5-122B-A10B (122B), DBRX (132B), Mixtral 8x22B (141B). Die Gewichte passen in dieselbe GPU; die Generierungsgeschwindigkeit variiert (Mixture-of-Experts-Modelle sind schneller, dichte Modelle langsamer).
▸Wie Token-Geschwindigkeiten geschätzt werden
Wie wir den GPU-Wertungs-Score berechnen und Marktdaten normalisieren.
Lesen (Prefill)
Der Prompt wird in einem einzigen parallelen Durchgang verarbeitet. Dies ist rechenleistungsbegrenzt (compute-bound): Es lastet die Tensor-Kerne der GPU aus.
Decode (Generierung)
Jedes neue Token erfordert das Laden aller aktiven Modellgewichte aus dem VRAM. Dies ist speicherbandbreitenbegrenzt (memory-bandwidth-bound): Die GPU wartet auf Daten, anstatt zu rechnen.
Gewichte = (activeParams × Bits ÷ 8) × 1,15 Overhead. KV-Cache pro Schritt = activeParams × Multiplikator × contextK.
Architektur-Nutzungsfaktoren
Links: Decode-Faktor — Rechts: Read-Faktor
Datenquellen
TFLOPS und Speicherbandbreite werden aus der GPU-Datenbank ausgelesen. Falls nicht vorhanden, fällt die Bandbreite auf ein hartcodiertes Wörterbuch zurück.
Einschränkungen
Dies sind analytische Schätzungen, keine tatsächlichen Benchmark-Ergebnisse. Verwende sie als relativen Vergleich, nicht als absolute Leistungsgarantie.