Zum Inhalt springen

Beste GPU für gpt-oss-20b lokal

Echtzeit-Preise und Hardware-Empfehlungen aktualisiert für August 2026.

20B
20B
dense

gpt-oss-20b ist ein dichtes Modell: Alle 20 Mrd. Parameter werden bei jedem Token aktiviert, die Generierungsgeschwindigkeit hängt also davon ab, wie schnell Ihre Karte die vollständigen Gewichte lesen kann.

Um gpt-oss-20b lokal auszuführen, benötigen Sie rund 14.1 GB VRAM bei Q4_K_M-Quantisierung und einem Kontext von 32k Token. Die preislich attraktivste passende Karte ist die GeForce RTX 5060 Ti 16GB (16 GB), die etwa 12 Token pro Sekunde erzeugen dürfte.

Kontextlänge anpassen

Zu gängigen Größen schieben oder manuell einen Wert eingeben.

k tokens
8k
16k
32k
64k
128k
256k
Budget-EinstiegQ3_K_M Quant
8.6 GB
2.6 GB
Gesamter VRAM:11.2 GB

Empfohlene Hardware

Arc B580
306 tok/sPrefill
13 tok/sGenerierung
EUR 379·12GB VRAM
Karte anzeigen
GeForce RTX 4070
339 tok/sPrefill
14 tok/sGenerierung
EUR 989.99·12GB VRAM
Karte anzeigen

Q3-Gewichte (~8,6GB) plus 32k-KV-Cache erreichen rund 11GB. 12GB-Karten decken das vollständige Kontextfenster mit Spielraum ab.

Ausgewogener Sweet SpotQ4_K_M Quant
11.5 GB
2.6 GB
Gesamter VRAM:14.1 GB

Empfohlene Hardware

GeForce RTX 5060 Ti 16GB
345 tok/sPrefill
12 tok/sGenerierung
EUR 523.76·16GB VRAM
Karte anzeigen
GeForce RTX 4060 Ti 16GB
194 tok/sPrefill
7 tok/sGenerierung
EUR 989.99·16GB VRAM
Karte anzeigen

Q4-Gewichte (~11,5GB) plus 32k-KV-Cache erreichen rund 14GB. 16GB-Karten sind das ideale Mainstream-Setup.

Nahezu verlustfreiQ8_0 Quant
23 GB
2.6 GB
Gesamter VRAM:25.6 GB

Empfohlene Hardware

Radeon PRO W7800
344 tok/sPrefill
6 tok/sGenerierung
EUR 2181.85·32GB VRAM
Karte anzeigen
GeForce RTX 5090
1380 tok/sPrefill
29 tok/sGenerierung
EUR 4142.02·32GB VRAM
Karte anzeigen
RTX PRO 4500 Blackwell
592 tok/sPrefill
14 tok/sGenerierung
EUR 4506.49·32GB VRAM
Karte anzeigen
RTX A6000
294 tok/sPrefill
8 tok/sGenerierung
EUR 6741.99·48GB VRAM
Karte anzeigen

Q8-Gewichte (~23GB) plus 32k-KV-Cache überschreiten 24GB. Karten mit 32GB+ liefern nahezu verlustfreie Präzision ohne VRAM-Beschränkung.

Andere Modelle mit demselben VRAM-Bedarf

Da die Gewichte von gpt-oss-20b auf eine 16-GB-Karte passen, laufen andere Modelle ähnlicher Größe auf derselben GPU. Die Generierungsgeschwindigkeit variiert — Mixture-of-Experts-Modelle sind schneller, dichte Modelle langsamer — aber alle passen in denselben VRAM:

InternLM2.5-20B20BCodestral 22B22.2BDiffusionGemma 26B-A4B25.2B

Setup-Optimierung für gpt-oss-20b

Quantisierungs-Empfehlungen

Für tägliche Coding- und Reasoning-Aufgaben bietet Q4_K_M (4-Bit-Quantisierung) die beste Balance aus Qualität und Speichereffizienz – es reduziert den Speicherbedarf um über 70 % bei minimalem Qualitätsverlust im Vergleich zu FP16. Q8 und höhere Voreinstellungen bewahren mehr Details auf Kosten eines deutlich höheren VRAM-Bedarfs, was das Auslagern von Schichten erzwingen und den Durchsatz verringern kann.

Empfohlene lokale Software

Wir empfehlen Ollama als primären Runner für die lokale Inferenz aufgrund der automatischen GPU-Modellaufteilung und der Optimierung des Kontext-Caches. Für fortgeschrittenes Fine-Tuning oder Quantisierungsaufteilungen bietet das nativ kompilierte llama.cpp mit Flash Attention die beste granulare Kontrolle.

gpt-oss-20b lokal ausführen — FAQ

Wie viel VRAM brauche ich, um gpt-oss-20b auszuführen?

Bei einem Kontext von 32k und aktivierter KV-Cache-Quantisierung benötigt gpt-oss-20b etwa 14.1 GB VRAM bei Q4_K_M — die Quantisierung, die für die meisten die richtige Wahl ist. Q3_K_M senkt den Bedarf auf rund 11.2 GB bei etwas geringerer Qualität, Q8_0 verlangt rund 25.6 GB für die beste Qualität, die dieses Modell liefern kann.

Auf welche Grafikkartengröße passt gpt-oss-20b?

gpt-oss-20b benötigt bei Q4_K_M etwa 14.1 GB. Eine 16-GB-Karte ist damit die kleinste gängige Größe, die das Modell vollständig im VRAM hält. Darunter müssen Layer in den Systemspeicher ausgelagert werden, was in der Regel den Großteil der Generierungsgeschwindigkeit kostet.

Welche Quantisierung sollte ich für gpt-oss-20b verwenden?

Nehmen Sie Q4_K_M, sofern Sie kein VRAM übrig haben. Es benötigt etwa 14.1 GB und verliert gegenüber voller Präzision kaum Qualität. Q8_0 verlangt rund 25.6 GB für einen Qualitätsgewinn, den die wenigsten beim Programmieren oder Chatten bemerken. Investieren Sie übriges VRAM lieber in einen längeren Kontext.

Wie wirkt sich die Kontextlänge auf den VRAM-Bedarf von gpt-oss-20b aus?

Die Modellgewichte sind fix, der KV-Cache wächst jedoch linear mit dem Kontext. Bei gpt-oss-20b und einem Kontext von 32k belegt der Cache etwa 2.6 GB; eine Verdopplung auf 64k bringt ihn auf rund 5.1 GB. Ohne KV-Cache-Quantisierung verdoppeln sich diese Werte erneut.

Kann dieselbe GPU andere Modelle ausführen, die gpt-oss-20b ähneln?

Ja. gpt-oss-20b benötigt etwa 14.1 GB bei Q4_K_M, und jedes Modell, dessen Gewichte auf dieselbe Karte passen, läuft darauf — einschließlich InternLM2.5-20B (20B), Codestral 22B (22.2B), DiffusionGemma 26B-A4B (25.2B). Die Gewichte passen in dieselbe GPU; die Generierungsgeschwindigkeit variiert (Mixture-of-Experts-Modelle sind schneller, dichte Modelle langsamer).

Wie Token-Geschwindigkeiten geschätzt werden

Wie wir den GPU-Wertungs-Score berechnen und Marktdaten normalisieren.

📖

Lesen (Prefill)

Der Prompt wird in einem einzigen parallelen Durchgang verarbeitet. Dies ist rechenleistungsbegrenzt (compute-bound): Es lastet die Tensor-Kerne der GPU aus.

Read-Token/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Decode (Generierung)

Jedes neue Token erfordert das Laden aller aktiven Modellgewichte aus dem VRAM. Dies ist speicherbandbreitenbegrenzt (memory-bandwidth-bound): Die GPU wartet auf Daten, anstatt zu rechnen.

Decode-Token/s ≈ Bandbreite × decodeFactor ÷ (Gewichte + KV-Cache)

Gewichte = (activeParams × Bits ÷ 8) × 1,15 Overhead. KV-Cache pro Schritt = activeParams × Multiplikator × contextK.

Architektur-Nutzungsfaktoren

Architektur
Dekodierung
Lesen
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Vor-Tensor-Core (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Links: Decode-Faktor — Rechts: Read-Faktor

Datenquellen

TFLOPS und Speicherbandbreite werden aus der GPU-Datenbank ausgelesen. Falls nicht vorhanden, fällt die Bandbreite auf ein hartcodiertes Wörterbuch zurück.

Einschränkungen

Dies sind analytische Schätzungen, keine tatsächlichen Benchmark-Ergebnisse. Verwende sie als relativen Vergleich, nicht als absolute Leistungsgarantie.