Zum Inhalt springen

Beste GPU für Gemma 4 26B-A4B lokal

Echtzeit-Preise und Hardware-Empfehlungen aktualisiert für August 2026.

26B
4B
moe

Gemma 4 26B-A4B ist ein Mixture-of-Experts-Modell: Alle 26 Mrd. Parameter müssen im VRAM liegen, aber nur 4 Mrd. werden pro Token aktiviert — es generiert daher deutlich schneller als ein dichtes Modell gleicher Größe, benötigt aber ebenso viel Speicher.

Um Gemma 4 26B-A4B lokal auszuführen, benötigen Sie rund 16 GB VRAM bei Q4_K_M-Quantisierung und einem Kontext von 64k Token. Die preislich attraktivste passende Karte ist die Radeon RX 9060 XT 16GB (16 GB), die etwa 28 Token pro Sekunde erzeugen dürfte.

Kontextlänge anpassen

Zu gängigen Größen schieben oder manuell einen Wert eingeben.

k tokens
8k
16k
32k
64k
128k
256k
Budget-EinstiegQ3_K_M Quant
11.2 GB
1 GB
Gesamter VRAM:12.2 GB

Empfohlene Hardware

GeForce RTX 5060 Ti 16GB
1725 tok/sPrefill
53 tok/sGenerierung
CAD 949.99·16GB VRAM
Karte anzeigen
GeForce RTX 4060 Ti 16GB
968 tok/sPrefill
29 tok/sGenerierung
CAD 1090·16GB VRAM
Karte anzeigen

Bei 64k Kontext erreichen Gewichte + KV-Cache rund 12GB — 16GB-Karten bieten zuverlässigen Spielraum für das vollständige Kontextfenster.

Ausgewogener Sweet SpotQ4_K_M Quant
14.9 GB
1 GB
Gesamter VRAM:16 GB

Empfohlene Hardware

Radeon RX 9060 XT 16GB
1083 tok/sPrefill
28 tok/sGenerierung
CAD 689.99·16GB VRAM
Karte anzeigen
GeForce RTX 5060 Ti 16GB
1725 tok/sPrefill
46 tok/sGenerierung
CAD 949.99·16GB VRAM
Karte anzeigen

Die ideale Consumer-Klasse. Hohe aktive Token-Geschwindigkeit dank nativer GQA-Optimierung.

Nahezu verlustfreiQ8_0 Quant
29.9 GB
1 GB
Gesamter VRAM:30.9 GB

Empfohlene Hardware

RTX PRO 4500 Blackwell
2959 tok/sPrefill
61 tok/sGenerierung
CAD 5499.99·32GB VRAM
Karte anzeigen
GeForce RTX 5090
6899 tok/sPrefill
121 tok/sGenerierung
CAD 5999·32GB VRAM
Karte anzeigen
RTX A6000
1471 tok/sPrefill
32 tok/sGenerierung
CAD 11399·48GB VRAM
Karte anzeigen
Radeon PRO W7900
2329 tok/sPrefill
36 tok/sGenerierung
Nicht vorrätig·48GB VRAM
Karte anzeigen

Q8_0 lädt alle 26B Expertengewichte auf einmal (~30 GB). Erfordert eine Karte mit 32 GB+ — die RTX 5090 ist die einzige Consumer-Option; Workstation-Karten bieten mehr Speicherspielraum.

Andere Modelle mit demselben VRAM-Bedarf

Da die Gewichte von Gemma 4 26B-A4B auf eine 16-GB-Karte passen, laufen andere Modelle ähnlicher Größe auf derselben GPU. Die Generierungsgeschwindigkeit variiert — Mixture-of-Experts-Modelle sind schneller, dichte Modelle langsamer — aber alle passen in denselben VRAM:

DiffusionGemma 26B-A4B25.2BQwen3-14B14.8BQwen2.5-14B14.7B

Setup-Optimierung für Gemma 4 26B-A4B

Quantisierungs-Empfehlungen

Für tägliche Coding- und Reasoning-Aufgaben bietet Q4_K_M (4-Bit-Quantisierung) die beste Balance aus Qualität und Speichereffizienz – es reduziert den Speicherbedarf um über 70 % bei minimalem Qualitätsverlust im Vergleich zu FP16. Q8 und höhere Voreinstellungen bewahren mehr Details auf Kosten eines deutlich höheren VRAM-Bedarfs, was das Auslagern von Schichten erzwingen und den Durchsatz verringern kann.

Empfohlene lokale Software

Wir empfehlen Ollama als primären Runner für die lokale Inferenz aufgrund der automatischen GPU-Modellaufteilung und der Optimierung des Kontext-Caches. Für fortgeschrittenes Fine-Tuning oder Quantisierungsaufteilungen bietet das nativ kompilierte llama.cpp mit Flash Attention die beste granulare Kontrolle.

Gemma 4 26B-A4B lokal ausführen — FAQ

Wie viel VRAM brauche ich, um Gemma 4 26B-A4B auszuführen?

Bei einem Kontext von 64k und aktivierter KV-Cache-Quantisierung benötigt Gemma 4 26B-A4B etwa 16 GB VRAM bei Q4_K_M — die Quantisierung, die für die meisten die richtige Wahl ist. Q3_K_M senkt den Bedarf auf rund 12.2 GB bei etwas geringerer Qualität, Q8_0 verlangt rund 30.9 GB für die beste Qualität, die dieses Modell liefern kann.

Auf welche Grafikkartengröße passt Gemma 4 26B-A4B?

Gemma 4 26B-A4B benötigt bei Q4_K_M etwa 16 GB. Eine 16-GB-Karte ist damit die kleinste gängige Größe, die das Modell vollständig im VRAM hält. Darunter müssen Layer in den Systemspeicher ausgelagert werden, was in der Regel den Großteil der Generierungsgeschwindigkeit kostet.

Welche Quantisierung sollte ich für Gemma 4 26B-A4B verwenden?

Nehmen Sie Q4_K_M, sofern Sie kein VRAM übrig haben. Es benötigt etwa 16 GB und verliert gegenüber voller Präzision kaum Qualität. Q8_0 verlangt rund 30.9 GB für einen Qualitätsgewinn, den die wenigsten beim Programmieren oder Chatten bemerken. Investieren Sie übriges VRAM lieber in einen längeren Kontext.

Wie wirkt sich die Kontextlänge auf den VRAM-Bedarf von Gemma 4 26B-A4B aus?

Die Modellgewichte sind fix, der KV-Cache wächst jedoch linear mit dem Kontext. Bei Gemma 4 26B-A4B und einem Kontext von 64k belegt der Cache etwa 1 GB; eine Verdopplung auf 128k bringt ihn auf rund 2 GB. Ohne KV-Cache-Quantisierung verdoppeln sich diese Werte erneut.

Warum ist Gemma 4 26B-A4B schneller, als seine Parameterzahl vermuten lässt?

Gemma 4 26B-A4B ist ein Mixture-of-Experts-Modell. Seine 26 Mrd. Parameter müssen zwar vollständig im VRAM liegen, doch nur 4 Mrd. erzeugen jedes einzelne Token. Die Generierungsgeschwindigkeit hängt daran, diese 4 Mrd. aktiven Parameter zu lesen — das Modell verhält sich also eher wie ein 4-Mrd.- als ein 26-Mrd.-Modell, benötigt aber weiterhin Speicher für die vollen 26 Mrd.

Kann dieselbe GPU andere Modelle ausführen, die Gemma 4 26B-A4B ähneln?

Ja. Gemma 4 26B-A4B benötigt etwa 16 GB bei Q4_K_M, und jedes Modell, dessen Gewichte auf dieselbe Karte passen, läuft darauf — einschließlich DiffusionGemma 26B-A4B (25.2B), Qwen3-14B (14.8B), Qwen2.5-14B (14.7B). Die Gewichte passen in dieselbe GPU; die Generierungsgeschwindigkeit variiert (Mixture-of-Experts-Modelle sind schneller, dichte Modelle langsamer).

Wie Token-Geschwindigkeiten geschätzt werden

Wie wir den GPU-Wertungs-Score berechnen und Marktdaten normalisieren.

📖

Lesen (Prefill)

Der Prompt wird in einem einzigen parallelen Durchgang verarbeitet. Dies ist rechenleistungsbegrenzt (compute-bound): Es lastet die Tensor-Kerne der GPU aus.

Read-Token/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Decode (Generierung)

Jedes neue Token erfordert das Laden aller aktiven Modellgewichte aus dem VRAM. Dies ist speicherbandbreitenbegrenzt (memory-bandwidth-bound): Die GPU wartet auf Daten, anstatt zu rechnen.

Decode-Token/s ≈ Bandbreite × decodeFactor ÷ (Gewichte + KV-Cache)

Gewichte = (activeParams × Bits ÷ 8) × 1,15 Overhead. KV-Cache pro Schritt = activeParams × Multiplikator × contextK.

Architektur-Nutzungsfaktoren

Architektur
Dekodierung
Lesen
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Vor-Tensor-Core (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Links: Decode-Faktor — Rechts: Read-Faktor

Datenquellen

TFLOPS und Speicherbandbreite werden aus der GPU-Datenbank ausgelesen. Falls nicht vorhanden, fällt die Bandbreite auf ein hartcodiertes Wörterbuch zurück.

Einschränkungen

Dies sind analytische Schätzungen, keine tatsächlichen Benchmark-Ergebnisse. Verwende sie als relativen Vergleich, nicht als absolute Leistungsgarantie.