Beste GPU für lokale LLM-Modelle
Das lokale Ausführen von LLMs erfordert die Abstimmung des VRAM-Budgets auf Quantisierungsstufen und Kontextgrößen. Nutze unseren Live-Rechner unten, um den Speicherbedarf abzuschätzen und Modellanleitungen zu durchsuchen.
LLM-Modell-Ratgeber durchsuchen
Qwen3.8-27B
Ein dichtes 27B-Vision-Language-Modell, dessen hybride lineare Attention den KV-Cache winzig hält — 128k+ Kontext laufen auf einer einzelnen 16-24-GB-Karte, mit nativem 262k-Fenster, erweiterbar auf 1M.
DeepSeek-V4-Flash
Ein 284B-Mixture-of-Experts-Modell mit nur 13B aktiven Parametern und 1M-Token-Kontext. Die Gewichte erfordern Multi-GPU oder CPU-Offload, doch pro Token sind nur 13B aktiv, sodass die Generierung schnell bleibt.
gpt-oss-120b
OpenAIs 117B-Open-Weight-Mixture-of-Experts-Modell mit 5,1B aktiven Parametern. Die nativen MXFP4-Gewichte passen auf eine einzelne 80-96-GB-GPU, und die geringe Zahl aktiver Parameter hält die Generierung schnell.
Qwen3.6-Coder-27B
Hochmodernes dichtes Modell mit tiefem Verständnis für Mathematik, Coding und Ingenieurwesen.
Qwen3.6-35B-A3B
Massiver Mixture-of-Experts Coder, optimiert für Setups mit 16GB–24GB VRAM.
Gemma 4 26B-A4B
Googles erstklassiges, hochdichtes MoE-Modell, entwickelt für komplexes Coding und Reasoning.
Gemma 4 12B
Leichtes, schnelles, dichtes Modell, optimiert für Standard-Consumer-Setups.
DeepSeek-R1-Distill-14B
Erstklassiges Reasoning, destilliert in ein kompaktes 14B-Modell. Starke STEM- und Coding-Leistung auf jeder GPU ab 12 GB.
DeepSeek-R1-Distill-32B
Mittelgroßes Reasoning-Kraftpaket für 24GB-Karten. Entspricht Frontier-Modellen bei Mathe-, Coding- und Logik-Benchmarks.
Mistral Small 3.1 24B
Effizientes dichtes Modell mit breiter mehrsprachiger Unterstützung und nativem Function Calling. Passt bei Q4 auf 16GB-Karten.
Llama 4 Scout 109B-A17B
Metas zugänglichstes MoE-Flaggschiff – 17B aktive Parameter liefern starke Qualität auf Workstation-Hardware.
Hy-MT2-7B
Vielseitiges 7B-Dense-Modell, das für effiziente lokale Inferenz auf Einsteiger- bis Mittelklasse-GPUs entwickelt wurde.
gpt-oss-20b
OpenAIs Consumer-Reasoning-Modell, entwickelt für kompromisslosen Betrieb auf gängiger lokaler Hardware.
NVIDIA Nemotron-3-Nano-4B
Ultrakompaktes 4B-NVIDIA-Modell, das bequem auf nahezu jede moderne GPU passt – ideal für Edge- und mobile Setups.
Qwen3-Next-80B-A3B
Riesiges 80B-Mixture-of-Experts mit nur 3B aktiven Parametern — benötigt eine 48GB-Workstation-Karte, generiert aber so schnell wie ein kleines Modell.
GPUs für benutzerdefinierte Modellkonfiguration
Geschätzter Speicherbedarf
Häufig gestellte Fragen
Häufige Fragen zur Auswahl einer GPU für lokale LLM-Inferenz.
Wie viel VRAM brauche ich tatsächlich für ein lokales LLM im Jahr 2026?
Das hängt von der Modellgröße und der Quantisierung ab. Ein 12B-Modell bei Q4 passt in etwa 7–8 GB, sodass eine 12GB-Karte ausreicht. Für 26–27B-Modelle benötigst du 14–18 GB – eine 16GB-Karte ist der Sweet Spot. Größere 70B+-Modelle erfordern 40–80 GB, was Multi-GPU-Setups oder High-End-Workstation-Karten voraussetzt.
Was ist CPU-Offloading und warum ist es langsam?
Beim CPU-Offloading werden Schichten, die nicht in den VRAM passen, in den Hauptspeicher (System-RAM) verschoben. Die Bandbreite des System-RAMs liegt bei 40–80 GB/s – etwa 10- bis 20-mal langsamer als der GPU-Speicher. Für eine flüssige Generierung sollte das gesamte quantisierte Modell im VRAM liegen.
Was bedeutet Q4_K_M- oder Q8_0-Quantisierung?
Die Quantisierung reduziert die einzelnen Modellgewichte von 16-Bit auf weniger Bits, um Speicher zu sparen. Q4_K_M nutzt etwa 4 Bit pro Gewicht – das halbiert den VRAM-Bedarf im Vergleich zu FP16 bei minimalem Qualitätsverlust. Q8_0 verwendet 8 Bit, was eine nahezu verlustfreie Qualität bietet, aber etwa doppelt so viel VRAM benötigt.
Was ist ein MoE-Modell und warum läuft es schneller, als seine Größe vermuten lässt?
Mixture-of-Experts (MoE) Modelle haben eine hohe Gesamtanzahl an Parametern, aktivieren aber pro Token nur eine kleine Teilmenge. Das bedeutet, dass Rechenaufwand und KV-Cache mit der Anzahl der aktiven Parameter skalieren, nicht mit der Gesamtzahl – somit kann ein 26B-MoE-Modell auf geeigneter Hardware schneller laufen als ein dichtes 7B-Modell.
Sollte ich eine GeForce-Consumer-Karte oder eine Workstation-Karte wählen?
Consumer-Karten bieten das beste Preis-Leistungs-Verhältnis pro GB VRAM in Gaming-Größen (8–24 GB). Workstation-Karten bieten eine höhere VRAM-Kapazität (32–96 GB) und ECC-Speicher zu einem deutlichen Preisaufschlag. Wähle Consumer, wenn das Modell in 24 GB passt; nimm Workstation, wenn du 32 GB+ brauchst.
Kann ich ein lokales LLM auf einer AMD-GPU ausführen?
Ja. ROCm unterstützt llama.cpp und Ollama unter Linux und zunehmend auch unter Windows. Die Radeon RX 7900 XTX (24 GB) und Radeon PRO W7900 (48 GB) sind gute Optionen. Die Leistung ist bei Inferenz-Workloads mit entsprechenden NVIDIA-Karten vergleichbar.
Kann ich ein lokales LLM auf einer Intel Arc-GPU ausführen?
Ja. Intel Arc-GPUs (wie die A770 16GB) können lokale LLMs mithilfe von Intels IPEX (Intel Extension for PyTorch) oder OpenVINO-Backend ausführen, was von llama.cpp und Ollama unterstützt wird. Die A770 16GB ist eine der günstigsten Optionen für 16 GB VRAM auf dem Markt und bietet eine solide Budget-Leistung, auch wenn die Einrichtung etwas aufwändiger sein kann als mit NVIDIA CUDA.