Zum Inhalt springen

Beste GPU für lokale LLM-Modelle

Das lokale Ausführen von LLMs erfordert die Abstimmung des VRAM-Budgets auf Quantisierungsstufen und Kontextgrößen. Nutze unseren Live-Rechner unten, um den Speicherbedarf abzuschätzen und Modellanleitungen zu durchsuchen.

LLM-Modell-Ratgeber durchsuchen

Alibaba Qwen

Qwen3.8-27B

dense

Ein dichtes 27B-Vision-Language-Modell, dessen hybride lineare Attention den KV-Cache winzig hält — 128k+ Kontext laufen auf einer einzelnen 16-24-GB-Karte, mit nativem 262k-Fenster, erweiterbar auf 1M.

Parameter
27B
Aktiv
27B
Max. Kontext
128k
Modell- und GPU-Details anzeigen
DeepSeek

DeepSeek-V4-Flash

moe

Ein 284B-Mixture-of-Experts-Modell mit nur 13B aktiven Parametern und 1M-Token-Kontext. Die Gewichte erfordern Multi-GPU oder CPU-Offload, doch pro Token sind nur 13B aktiv, sodass die Generierung schnell bleibt.

Parameter
284B
Aktiv
13B
Max. Kontext
128k
Modell- und GPU-Details anzeigen
OpenAI

gpt-oss-120b

moe

OpenAIs 117B-Open-Weight-Mixture-of-Experts-Modell mit 5,1B aktiven Parametern. Die nativen MXFP4-Gewichte passen auf eine einzelne 80-96-GB-GPU, und die geringe Zahl aktiver Parameter hält die Generierung schnell.

Parameter
117B
Aktiv
5.1B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Alibaba Qwen

Qwen3.6-Coder-27B

dense

Hochmodernes dichtes Modell mit tiefem Verständnis für Mathematik, Coding und Ingenieurwesen.

Parameter
27B
Aktiv
27B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Alibaba Qwen

Qwen3.6-35B-A3B

moe

Massiver Mixture-of-Experts Coder, optimiert für Setups mit 16GB–24GB VRAM.

Parameter
35B
Aktiv
3B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Google

Gemma 4 26B-A4B

moe

Googles erstklassiges, hochdichtes MoE-Modell, entwickelt für komplexes Coding und Reasoning.

Parameter
26B
Aktiv
4B
Max. Kontext
64k
Modell- und GPU-Details anzeigen
Google

Gemma 4 12B

dense

Leichtes, schnelles, dichtes Modell, optimiert für Standard-Consumer-Setups.

Parameter
12B
Aktiv
12B
Max. Kontext
64k
Modell- und GPU-Details anzeigen
DeepSeek

DeepSeek-R1-Distill-14B

dense

Erstklassiges Reasoning, destilliert in ein kompaktes 14B-Modell. Starke STEM- und Coding-Leistung auf jeder GPU ab 12 GB.

Parameter
14B
Aktiv
14B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
DeepSeek

DeepSeek-R1-Distill-32B

dense

Mittelgroßes Reasoning-Kraftpaket für 24GB-Karten. Entspricht Frontier-Modellen bei Mathe-, Coding- und Logik-Benchmarks.

Parameter
32B
Aktiv
32B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Mistral AI

Mistral Small 3.1 24B

dense

Effizientes dichtes Modell mit breiter mehrsprachiger Unterstützung und nativem Function Calling. Passt bei Q4 auf 16GB-Karten.

Parameter
24B
Aktiv
24B
Max. Kontext
128k
Modell- und GPU-Details anzeigen
Meta

Llama 4 Scout 109B-A17B

moe

Metas zugänglichstes MoE-Flaggschiff – 17B aktive Parameter liefern starke Qualität auf Workstation-Hardware.

Parameter
109B
Aktiv
17B
Max. Kontext
64k
Modell- und GPU-Details anzeigen
Tencent

Hy-MT2-7B

dense

Vielseitiges 7B-Dense-Modell, das für effiziente lokale Inferenz auf Einsteiger- bis Mittelklasse-GPUs entwickelt wurde.

Parameter
7B
Aktiv
7B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
OpenAI

gpt-oss-20b

dense

OpenAIs Consumer-Reasoning-Modell, entwickelt für kompromisslosen Betrieb auf gängiger lokaler Hardware.

Parameter
20B
Aktiv
20B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
NVIDIA

NVIDIA Nemotron-3-Nano-4B

dense

Ultrakompaktes 4B-NVIDIA-Modell, das bequem auf nahezu jede moderne GPU passt – ideal für Edge- und mobile Setups.

Parameter
4B
Aktiv
4B
Max. Kontext
32k
Modell- und GPU-Details anzeigen
Alibaba Qwen

Qwen3-Next-80B-A3B

moe

Riesiges 80B-Mixture-of-Experts mit nur 3B aktiven Parametern — benötigt eine 48GB-Workstation-Karte, generiert aber so schnell wie ein kleines Modell.

Parameter
80B
Aktiv
3B
Max. Kontext
32k
Modell- und GPU-Details anzeigen

GPUs für benutzerdefinierte Modellkonfiguration

27B
3B14B27B35B70B+
32k Token
8k32k64k96k128k

Geschätzter Speicherbedarf

VRAM19 GB
Gewichte: 15.5GB
KV: 3.5 GB

Häufig gestellte Fragen

Häufige Fragen zur Auswahl einer GPU für lokale LLM-Inferenz.