Zum Inhalt springen

Beste GPU für Llama 4 Scout 109B-A17B lokal

Echtzeit-Preise und Hardware-Empfehlungen aktualisiert für August 2026.

109B
17B
moe

Llama 4 Scout 109B-A17B ist ein Mixture-of-Experts-Modell: Alle 109 Mrd. Parameter müssen im VRAM liegen, aber nur 17 Mrd. werden pro Token aktiviert — es generiert daher deutlich schneller als ein dichtes Modell gleicher Größe, benötigt aber ebenso viel Speicher.

Um Llama 4 Scout 109B-A17B lokal auszuführen, benötigen Sie rund 67 GB VRAM bei Q4_K_M-Quantisierung und einem Kontext von 64k Token. Die preislich attraktivste passende Karte ist die RTX PRO 6000 Blackwell (96 GB), die etwa 44 Token pro Sekunde erzeugen dürfte.

Kontextlänge anpassen

Zu gängigen Größen schieben oder manuell einen Wert eingeben.

k tokens
8k
16k
32k
64k
128k
256k
Budget-EinstiegQ3_K_M Quant
47 GB
4.4 GB
Gesamter VRAM:51.4 GB

Empfohlene Hardware

RTX PRO 6000 Blackwell
1618 tok/sPrefill
50 tok/sGenerierung
CAD 21770.99·96GB VRAM
Karte anzeigen

Q3-Gewichte (~47GB) plus 64k-KV-Cache überschreiten 48GB. Die RTX PRO 6000 Blackwell (96GB) ist in dieser Klasse die einzige Single-GPU-Option.

Ausgewogener Sweet SpotQ4_K_M Quant
62.7 GB
4.4 GB
Gesamter VRAM:67 GB

Empfohlene Hardware

RTX PRO 6000 Blackwell
1618 tok/sPrefill
44 tok/sGenerierung
CAD 21770.99·96GB VRAM
Karte anzeigen

Q4-Gewichte belegen rund 63GB. Erfordert High-End-Workstation- oder Mac Studio Ultra-Klasse-Hardware.

Nahezu verlustfreiQ8_0 Quant
125.3 GB
4.4 GB
Gesamter VRAM:129.7 GB

Empfohlene Hardware

Keine passenden GPUs gefunden für Alle GPUs durchsuchen

Q8_0 erfordert für dieses 109B-Modell rund 130GB VRAM — keine einzelne Consumer- oder Workstation-GPU kann das aufnehmen. Erwäge einen Multi-GPU-Cluster oder Apple Silicon mit Unified Memory (Mac Studio Ultra).

Andere Modelle mit demselben VRAM-Bedarf

Da die Gewichte von Llama 4 Scout 109B-A17B auf eine 96-GB-Karte passen, laufen andere Modelle ähnlicher Größe auf derselben GPU. Die Generierungsgeschwindigkeit variiert — Mixture-of-Experts-Modelle sind schneller, dichte Modelle langsamer — aber alle passen in denselben VRAM:

Qwen3.5-122B-A10B122BDBRX132BMixtral 8x22B141B

Setup-Optimierung für Llama 4 Scout 109B-A17B

Quantisierungs-Empfehlungen

Für tägliche Coding- und Reasoning-Aufgaben bietet Q4_K_M (4-Bit-Quantisierung) die beste Balance aus Qualität und Speichereffizienz – es reduziert den Speicherbedarf um über 70 % bei minimalem Qualitätsverlust im Vergleich zu FP16. Q8 und höhere Voreinstellungen bewahren mehr Details auf Kosten eines deutlich höheren VRAM-Bedarfs, was das Auslagern von Schichten erzwingen und den Durchsatz verringern kann.

Empfohlene lokale Software

Wir empfehlen Ollama als primären Runner für die lokale Inferenz aufgrund der automatischen GPU-Modellaufteilung und der Optimierung des Kontext-Caches. Für fortgeschrittenes Fine-Tuning oder Quantisierungsaufteilungen bietet das nativ kompilierte llama.cpp mit Flash Attention die beste granulare Kontrolle.

Llama 4 Scout 109B-A17B lokal ausführen — FAQ

Wie viel VRAM brauche ich, um Llama 4 Scout 109B-A17B auszuführen?

Bei einem Kontext von 64k und aktivierter KV-Cache-Quantisierung benötigt Llama 4 Scout 109B-A17B etwa 67 GB VRAM bei Q4_K_M — die Quantisierung, die für die meisten die richtige Wahl ist. Q3_K_M senkt den Bedarf auf rund 51.4 GB bei etwas geringerer Qualität, Q8_0 verlangt rund 129.7 GB für die beste Qualität, die dieses Modell liefern kann.

Auf welche Grafikkartengröße passt Llama 4 Scout 109B-A17B?

Llama 4 Scout 109B-A17B benötigt bei Q4_K_M etwa 67 GB — mehr als eine einzelne Consumer-Karte mit 24 GB bietet. Sie brauchen eine Workstation-Karte, ein Multi-GPU-Setup oder eine aggressivere Quantisierung; andernfalls wandern Layer in den Systemspeicher und die Generierung wird drastisch langsamer.

Welche Quantisierung sollte ich für Llama 4 Scout 109B-A17B verwenden?

Nehmen Sie Q4_K_M, sofern Sie kein VRAM übrig haben. Es benötigt etwa 67 GB und verliert gegenüber voller Präzision kaum Qualität. Q8_0 verlangt rund 129.7 GB für einen Qualitätsgewinn, den die wenigsten beim Programmieren oder Chatten bemerken. Investieren Sie übriges VRAM lieber in einen längeren Kontext.

Wie wirkt sich die Kontextlänge auf den VRAM-Bedarf von Llama 4 Scout 109B-A17B aus?

Die Modellgewichte sind fix, der KV-Cache wächst jedoch linear mit dem Kontext. Bei Llama 4 Scout 109B-A17B und einem Kontext von 64k belegt der Cache etwa 4.4 GB; eine Verdopplung auf 128k bringt ihn auf rund 8.7 GB. Ohne KV-Cache-Quantisierung verdoppeln sich diese Werte erneut.

Warum ist Llama 4 Scout 109B-A17B schneller, als seine Parameterzahl vermuten lässt?

Llama 4 Scout 109B-A17B ist ein Mixture-of-Experts-Modell. Seine 109 Mrd. Parameter müssen zwar vollständig im VRAM liegen, doch nur 17 Mrd. erzeugen jedes einzelne Token. Die Generierungsgeschwindigkeit hängt daran, diese 17 Mrd. aktiven Parameter zu lesen — das Modell verhält sich also eher wie ein 17-Mrd.- als ein 109-Mrd.-Modell, benötigt aber weiterhin Speicher für die vollen 109 Mrd.

Kann dieselbe GPU andere Modelle ausführen, die Llama 4 Scout 109B-A17B ähneln?

Ja. Llama 4 Scout 109B-A17B benötigt etwa 67 GB bei Q4_K_M, und jedes Modell, dessen Gewichte auf dieselbe Karte passen, läuft darauf — einschließlich Qwen3.5-122B-A10B (122B), DBRX (132B), Mixtral 8x22B (141B). Die Gewichte passen in dieselbe GPU; die Generierungsgeschwindigkeit variiert (Mixture-of-Experts-Modelle sind schneller, dichte Modelle langsamer).

Wie Token-Geschwindigkeiten geschätzt werden

Wie wir den GPU-Wertungs-Score berechnen und Marktdaten normalisieren.

📖

Lesen (Prefill)

Der Prompt wird in einem einzigen parallelen Durchgang verarbeitet. Dies ist rechenleistungsbegrenzt (compute-bound): Es lastet die Tensor-Kerne der GPU aus.

Read-Token/s ≈ TFLOPS × readFactor × 400 ÷ activeParams

Decode (Generierung)

Jedes neue Token erfordert das Laden aller aktiven Modellgewichte aus dem VRAM. Dies ist speicherbandbreitenbegrenzt (memory-bandwidth-bound): Die GPU wartet auf Daten, anstatt zu rechnen.

Decode-Token/s ≈ Bandbreite × decodeFactor ÷ (Gewichte + KV-Cache)

Gewichte = (activeParams × Bits ÷ 8) × 1,15 Overhead. KV-Cache pro Schritt = activeParams × Multiplikator × contextK.

Architektur-Nutzungsfaktoren

Architektur
Dekodierung
Lesen
Blackwell, Xe2
0.45
0.55
Ada Lovelace, RDNA 4, Battlemage
0.38
0.48
Ampere, Turing, RDNA 3, Xe-HPG
0.28
0.38
Volta, RDNA 1/2
0.2
0.25
Vor-Tensor-Core (Pascal, Maxwell, Kepler, GCN, Alchemist)
0.12
0.15

Links: Decode-Faktor — Rechts: Read-Faktor

Datenquellen

TFLOPS und Speicherbandbreite werden aus der GPU-Datenbank ausgelesen. Falls nicht vorhanden, fällt die Bandbreite auf ein hartcodiertes Wörterbuch zurück.

Einschränkungen

Dies sind analytische Schätzungen, keine tatsächlichen Benchmark-Ergebnisse. Verwende sie als relativen Vergleich, nicht als absolute Leistungsgarantie.