Zum Inhalt springen

Beste GPU für lokale LLM-Modelle

Das lokale Ausführen von LLMs erfordert die Abstimmung des VRAM-Budgets auf Quantisierungsstufen und Kontextgrößen. Nutze unseren Live-Rechner unten, um den Speicherbedarf abzuschätzen und Modellanleitungen zu durchsuchen.

LLM-Modell-Ratgeber durchsuchen

Alibaba Qwen

Qwen3.8-27B

dense

Ein dichtes 27B-Vision-Language-Modell, dessen hybride lineare Attention den KV-Cache winzig hält — 128k+ Kontext laufen auf einer einzelnen 16-24-GB-Karte, mit nativem 262k-Fenster, erweiterbar auf 1M.

Parameter
27B
Aktiv
27B
Max. Kontext
128k
Modell- und GPU-Details anzeigen
DeepSeek

DeepSeek-V4-Flash

moe

Ein 284B-Mixture-of-Experts-Modell mit nur 13B aktiven Parametern und 1M-Token-Kontext. Die Gewichte erfordern Multi-GPU oder CPU-Offload, doch pro Token sind nur 13B aktiv, sodass die Generierung schnell bleibt.

Parameter
284B
Aktiv
13B
Max. Kontext
128k
Modell- und GPU-Details anzeigen
OpenAI

gpt-oss-120b

moe

OpenAIs 117B-Open-Weight-Mixture-of-Experts-Modell mit 5,1B aktiven Parametern. Die nativen MXFP4-Gewichte passen auf eine einzelne 80-96-GB-GPU, und die geringe Zahl aktiver Parameter hält die Generierung schnell.

Parameter
117B
Aktiv
5.1B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Alibaba Qwen

Qwen3.6-Coder-27B

dense

Hochmodernes dichtes Modell mit tiefem Verständnis für Mathematik, Coding und Ingenieurwesen.

Parameter
27B
Aktiv
27B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Alibaba Qwen

Qwen3.6-35B-A3B

moe

Massiver Mixture-of-Experts Coder, optimiert für Setups mit 16GB–24GB VRAM.

Parameter
35B
Aktiv
3B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Google

Gemma 4 26B-A4B

moe

Googles erstklassiges, hochdichtes MoE-Modell, entwickelt für komplexes Coding und Reasoning.

Parameter
26B
Aktiv
4B
Max. Kontext
64k
Modell- und GPU-Details anzeigen
Google

Gemma 4 12B

dense

Leichtes, schnelles, dichtes Modell, optimiert für Standard-Consumer-Setups.

Parameter
12B
Aktiv
12B
Max. Kontext
64k
Modell- und GPU-Details anzeigen
DeepSeek

DeepSeek-R1-Distill-14B

dense

Erstklassiges Reasoning, destilliert in ein kompaktes 14B-Modell. Starke STEM- und Coding-Leistung auf jeder GPU ab 12 GB.

Parameter
14B
Aktiv
14B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
DeepSeek

DeepSeek-R1-Distill-32B

dense

Mittelgroßes Reasoning-Kraftpaket für 24GB-Karten. Entspricht Frontier-Modellen bei Mathe-, Coding- und Logik-Benchmarks.

Parameter
32B
Aktiv
32B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Mistral AI

Mistral Small 3.1 24B

dense

Effizientes dichtes Modell mit breiter mehrsprachiger Unterstützung und nativem Function Calling. Passt bei Q4 auf 16GB-Karten.

Parameter
24B
Aktiv
24B
Max. Kontext
128k
Modell- und GPU-Details anzeigen
Meta

Llama 4 Scout 109B-A17B

moe

Metas zugänglichstes MoE-Flaggschiff – 17B aktive Parameter liefern starke Qualität auf Workstation-Hardware.

Parameter
109B
Aktiv
17B
Max. Kontext
64k
Modell- und GPU-Details anzeigen
Tencent

Hy-MT2-7B

dense

Vielseitiges 7B-Dense-Modell, das für effiziente lokale Inferenz auf Einsteiger- bis Mittelklasse-GPUs entwickelt wurde.

Parameter
7B
Aktiv
7B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
OpenAI

gpt-oss-20b

dense

OpenAIs Consumer-Reasoning-Modell, entwickelt für kompromisslosen Betrieb auf gängiger lokaler Hardware.

Parameter
20B
Aktiv
20B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
NVIDIA

NVIDIA Nemotron-3-Nano-4B

dense

Ultrakompaktes 4B-NVIDIA-Modell, das bequem auf nahezu jede moderne GPU passt – ideal für Edge- und mobile Setups.

Parameter
4B
Aktiv
4B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Alibaba Qwen

Qwen3-Next-80B-A3B

moe

Riesiges 80B-Mixture-of-Experts mit nur 3B aktiven Parametern — benötigt eine 48GB-Workstation-Karte, generiert aber so schnell wie ein kleines Modell.

Parameter
80B
Aktiv
3B
Max. Kontext
32k
Modell- und GPU-Details anzeigen

GPUs für benutzerdefinierte Modellkonfiguration

27B
3B14B27B35B70B+
32k Token
8k32k64k96k128k

Geschätzter Speicherbedarf

VRAM19 GB
Gewichte: 15.5GB
KV: 3.5 GB

Häufig gestellte Fragen

Häufige Fragen zur Auswahl einer GPU für lokale LLM-Inferenz.

Wie viel VRAM brauche ich tatsächlich für ein lokales LLM im Jahr 2026?

Das hängt von der Modellgröße und der Quantisierung ab. Ein 12B-Modell bei Q4 passt in etwa 7–8 GB, sodass eine 12GB-Karte ausreicht. Für 26–27B-Modelle benötigst du 14–18 GB – eine 16GB-Karte ist der Sweet Spot. Größere 70B+-Modelle erfordern 40–80 GB, was Multi-GPU-Setups oder High-End-Workstation-Karten voraussetzt.

Was ist CPU-Offloading und warum ist es langsam?

Beim CPU-Offloading werden Schichten, die nicht in den VRAM passen, in den Hauptspeicher (System-RAM) verschoben. Die Bandbreite des System-RAMs liegt bei 40–80 GB/s – etwa 10- bis 20-mal langsamer als der GPU-Speicher. Für eine flüssige Generierung sollte das gesamte quantisierte Modell im VRAM liegen.

Was bedeutet Q4_K_M- oder Q8_0-Quantisierung?

Die Quantisierung reduziert die einzelnen Modellgewichte von 16-Bit auf weniger Bits, um Speicher zu sparen. Q4_K_M nutzt etwa 4 Bit pro Gewicht – das halbiert den VRAM-Bedarf im Vergleich zu FP16 bei minimalem Qualitätsverlust. Q8_0 verwendet 8 Bit, was eine nahezu verlustfreie Qualität bietet, aber etwa doppelt so viel VRAM benötigt.

Was ist ein MoE-Modell und warum läuft es schneller, als seine Größe vermuten lässt?

Mixture-of-Experts (MoE) Modelle haben eine hohe Gesamtanzahl an Parametern, aktivieren aber pro Token nur eine kleine Teilmenge. Das bedeutet, dass Rechenaufwand und KV-Cache mit der Anzahl der aktiven Parameter skalieren, nicht mit der Gesamtzahl – somit kann ein 26B-MoE-Modell auf geeigneter Hardware schneller laufen als ein dichtes 7B-Modell.

Sollte ich eine GeForce-Consumer-Karte oder eine Workstation-Karte wählen?

Consumer-Karten bieten das beste Preis-Leistungs-Verhältnis pro GB VRAM in Gaming-Größen (8–24 GB). Workstation-Karten bieten eine höhere VRAM-Kapazität (32–96 GB) und ECC-Speicher zu einem deutlichen Preisaufschlag. Wähle Consumer, wenn das Modell in 24 GB passt; nimm Workstation, wenn du 32 GB+ brauchst.

Kann ich ein lokales LLM auf einer AMD-GPU ausführen?

Ja. ROCm unterstützt llama.cpp und Ollama unter Linux und zunehmend auch unter Windows. Die Radeon RX 7900 XTX (24 GB) und Radeon PRO W7900 (48 GB) sind gute Optionen. Die Leistung ist bei Inferenz-Workloads mit entsprechenden NVIDIA-Karten vergleichbar.

Kann ich ein lokales LLM auf einer Intel Arc-GPU ausführen?

Ja. Intel Arc-GPUs (wie die A770 16GB) können lokale LLMs mithilfe von Intels IPEX (Intel Extension for PyTorch) oder OpenVINO-Backend ausführen, was von llama.cpp und Ollama unterstützt wird. Die A770 16GB ist eine der günstigsten Optionen für 16 GB VRAM auf dem Markt und bietet eine solide Budget-Leistung, auch wenn die Einrichtung etwas aufwändiger sein kann als mit NVIDIA CUDA.