LLM-Leistung auf Ollama mit einer 16-GB-VRAM-GPU im Vergleich

LLM-Test der Geschwindigkeit auf einer RTX 4080 mit 16 GB VRAM

Inhaltsverzeichnis

Das lokale Ausführen großer Sprachmodelle bietet Datenschutz, Offline-Fähigkeit und null API-Kosten. Dieser Benchmark zeigt genau, was man von 14 populären LLMs auf Ollama auf einer RTX 4080 erwarten kann.

Mit einer 16-GB-VRAM-GPU stand ich vor einem ständigen Abwägungsprozess: größere Modelle mit potenziell besserer Qualität oder kleinere Modelle mit schnellerer Inferenz. Für weitere Informationen zur LLM-Performance – Durchsatz vs. Latenz, VRAM-Limits, parallele Anfragen und Benchmarks über verschiedene Runtime-Umgebungen hinweg – siehe LLM-Performance: Benchmarks, Engstellen & Optimierung.

Dieser Artikel konzentriert sich auf Ollama. Für die gleiche 16-GB-GPU-Klasse, gemessen mit llama.cpp bei 19K, 32K und 64K Kontext (VRAM, GPU-Auslastung, Tokens pro Sekunde über dichte und MoE-Checkpoints hinweg), siehe 16 GB VRAM LLM Benchmarks mit llama.cpp (Geschwindigkeit und Kontext).

Sobald Durchsatz und VRAM-Aufteilung akzeptabel erscheinen, benötigen agentenartige Workloads noch sinnvolle Temperatur- und Strafvoreinstellungen für Qwen- und Gemma-Stacks; siehe Agentic Inferenz-Parameter für Qwen und Gemma.

LLM performance on Ollama - reranking cockroaches

TL;DR

Hier ist die aktualisierte Vergleichstabelle zur LLM-Performance auf der RTX 4080 16GB mit Ollama 0.17.7, (09.03.2026) hinzugefügt Qwen 3.5 9b, 9bq8, 27b und 35b Modelle:

Modell RAM+VRAM verwendet CPU/GPU-Aufteilung Tokens/Sek.
gpt-oss:20b 14 GB 100% GPU 139,93
qwen3.5:9b 9,3 GB 100% GPU 90,89
ministral-3:14b 13 GB 100% GPU 70,13
qwen3:14b 12 GB 100% GPU 61,85
qwen3.5:9b-q8_0 13 GB 100% GPU 61,22
qwen3-coder:30b 20 GB 25%/75% CPU/GPU 57,17
qwen3-vl:30b-a3b 22 GB 30%/70% CPU/GPU 50,99
glm-4.7-flash 21 GB 27%/73% CPU/GPU 33,86
nemotron-3-nano:30b 25 GB 38%/62% CPU/GPU 32,77
qwen3.5:35b 27 GB 43%/57% CPU/GPU 20,66
devstral-small-2:24b 19 GB 18%/82% CPU/GPU 18,67
mistral-small3.2:24b 19 GB 18%/82% CPU/GPU 18,51
gpt-oss:120b 66 GB 78%/22% CPU/GPU 12,64
qwen3.5:27b 24 GB 43%/57% CPU/GPU 6,48

Wichtige Erkenntnis: Modelle, die vollständig in den VRAM passen, sind dramatisch schneller. GPT-OSS 20B erreicht 139,93 Tokens/Sek., während GPT-OSS 120B mit schwerem CPU-Offloading nur 12,64 Tokens/Sek. schafft – ein 11-facher Geschwindigkeitsunterschied.

Test-Hardware-Setup

Der Benchmark wurde auf dem folgenden System durchgeführt:

  • GPU: NVIDIA RTX 4080 mit 16GB VRAM
  • CPU: Intel Core i7-14700 (8 P-Cores + 12 E-Cores)
  • RAM: 64GB DDR5-6000

Dies repräsentiert eine übliche High-End-Consumer-Konfiguration für lokale LLM-Inferenz. Die 16GB VRAM sind die entscheidende Einschränkung – sie bestimmen, welche Modelle vollständig auf der GPU laufen, im Gegensatz zu denen, die CPU-Offloading benötigen.

Das Verständnis dafür, wie Ollama Intel-CPU-Kerne nutzt, wird wichtig, wenn Modelle die VRAM-Kapazität überschreiten, da die CPU-Leistung die Inferenzgeschwindigkeit der ausgelagerten Layer direkt beeinflusst.

Zweck dieses Benchmarks

Das primäre Ziel war die Messung der Inferenzgeschwindigkeit unter realistischen Bedingungen. Ich wusste aus Erfahrung bereits, dass Mistral Small 3.2 24B bei der Sprachqualität überlegen ist, während Qwen3 14B für meine spezifischen Anwendungsfälle eine bessere Anweisungsbefolgung bietet.

Dieser Benchmark beantwortet die praktische Frage: Wie schnell kann jedes Modell Text generieren und welcher Geschwindigkeitsnachteil entsteht bei Überschreitung der VRAM-Limits?

Die Testparameter waren:

  • Kontextgröße: 19.000 Tokens. Dies ist der Durchschnittswert in meinen Generierungsanfragen.
  • Prompt: “compare weather and climate between capital cities of australia”
  • Metrik: eval rate (Tokens pro Sekunde während der Generierung)

Ollama Installation und Version

Alle Tests nutzten Ollama Version 0.15.2, den neuesten Release zum Zeitpunkt der Tests. Später wurde mit Ollama v 0.17.7 erneut getestet – um Qwen3.5-Modelle hinzuzufügen. Für eine vollständige Referenz der in diesem Benchmark verwendeten Ollama-Befehle, siehe den Ollama Spickzettel.

Um es kurz zusammenzufassen – Ollama auf Linux installieren:

curl -fsSL https://ollama.com/install.sh | sh

Installation verifizieren:

ollama --version

Wenn Sie aufgrund von Speichermangel Modelle auf einem anderen Laufwerk speichern müssen, prüfen Sie wie man Ollama-Modelle auf ein anderes Laufwerk verschiebt.

Getestete Modelle

Die folgenden Modelle wurden benchtmarkt, in alphabetischer Reihenfolge:

Modell Parameter Quantisierung Hinweise
devstral-small-2:24b 24B Q4_K_M Code-fokussiert
glm-4.7-flash 30B Q4_K_M Denkmodell
gpt-oss:20b 20B Q4_K_M Am schnellsten insgesamt
gpt-oss:120b 120B Q4_K_M Am größten getestetes
ministral-3:14b 14B Q4_K_M Effizientes Mistral-Modell
mistral-small3.2:24b 24B Q4_K_M Starke Sprachqualität
nemotron-3-nano:30b 30B Q4_K_M Angebots von NVIDIA
qwen3:14b 14B Q4_K_M Beste Anweisungsbefolgung
qwen3.5:9b 9B Q4_K_M Schnell, vollständig GPU
qwen3.5:9b-q8_0 9B Q8_0 Höhere Qualität, vollständig GPU
qwen3.5:27b 27B Q4_K_M Exzellente Qualität, langsam auf Ollama
qwen3-vl:30b-a3b 30B Q4_K_M Mit Visionsfähigkeiten
qwen3-coder:30b 30B Q4_K_M Code-fokussiert
qwen3.5:35b 35B Q4_K_M Gute Coding-Fähigkeiten

Zum Download eines beliebigen Modells:

ollama pull gpt-oss:20b
ollama pull qwen3:14b

CPU-Offloading verstehen

Wenn die Speicheranforderungen eines Modells den verfügbaren VRAM überschreiten, verteilt Ollama automatisch die Modell-Layer zwischen GPU und System-RAM. Die Ausgabe zeigt dies als prozentuale Aufteilung wie “18%/82% CPU/GPU”.

Dies hat massive Auswirkungen auf die Performance. Jede Token-Generierung erfordert einen Datentransfer zwischen CPU- und GPU-Speicher – eine Engstelle, die sich mit jedem auf die CPU ausgelagerten Layer vervielfacht.

Das Muster ist aus unseren Ergebnissen klar:

  • 100% GPU-Modelle: 61-140 Tokens/Sek.
  • 70-82% GPU-Modelle: 19-51 Tokens/Sek.
  • 22% GPU (meistens CPU): 12,6 Tokens/Sek.

Dies erklärt, warum ein 20B-Parameter-Modell in der Praxis ein 120B-Modell um das 11-Fache übertreffen kann. Wenn Sie planen, mehrere gleichzeitige Anfragen zu bearbeiten, wird das Verständnis davon, wie Ollama parallele Anfragen handhabt, für die Kapazitätsplanung essenziell. Die oben genannte CPU-Offload-Aufteilung ist im Grunde ein KV-Cache- und Gewichts-Budget-Problem in Verkleidung – KV Cache auf 16 GB GPUs geht auf die exakte Mathematik und die OLLAMA_KV_CACHE_TYPE-Einstellungen ein, die es Ihnen ermöglichen, Spielraum zurückzugewinnen, ohne auf ein kleineres Modell umzusteigen.

Detaillierte Benchmark-Ergebnisse

Modelle, die zu 100% auf der GPU laufen

GPT-OSS 20B — Der Geschwindigkeitschampion

ollama run gpt-oss:20b --verbose
/set parameter num_ctx 19000

NAME           SIZE     PROCESSOR    CONTEXT
gpt-oss:20b    14 GB    100% GPU     19000

eval count:           2856 token(s)
eval duration:        20.410517947s
eval rate:            139.93 tokens/s

Mit 139,93 Tokens/Sek. ist GPT-OSS 20B der klare Gewinner für geschwindigkeitskritische Anwendungen. Es verwendet nur 14GB VRAM, was Spielraum für größere Kontextfenster oder andere GPU-Workloads lässt.

Qwen3 14B — Exzellentes Gleichgewicht

ollama run qwen3:14b --verbose
/set parameter num_ctx 19000

NAME         SIZE     PROCESSOR    CONTEXT
qwen3:14b    12 GB    100% GPU     19000

eval count:           3094 token(s)
eval duration:        50.020594575s
eval rate:            61.85 tokens/s

Qwen3 14B bietet in meiner Erfahrung die beste Anweisungsbefolgung mit einem komfortablen Fußabdruck von 12GB Speicher. Mit 61,85 Tokens/Sek. ist es schnell genug für den interaktiven Einsatz.

Für Entwickler, die Qwen3 in Anwendungen integrieren, siehe LLM Strukturierter Output mit Ollama und Qwen3 für das Extrahieren strukturierter JSON-Antworten.

Ministral 3 14B — Schnell und kompakt

ollama run ministral-3:14b --verbose
/set parameter num_ctx 19000

NAME               SIZE     PROCESSOR    CONTEXT
ministral-3:14b    13 GB    100% GPU     19000

eval count:           1481 token(s)
eval duration:        21.11734277s
eval rate:            70.13 tokens/s

Das kleinere Mistral-Modell liefert 70,13 Tokens/Sek., während es vollständig in den VRAM passt. Eine solide Wahl, wenn man Mistral-Familien-Qualität bei maximaler Geschwindigkeit benötigt.

qwen3.5:9b - schnell und neu

ollama run  qwen3.5:9b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia

NAME          ID              SIZE      PROCESSOR    CONTEXT
qwen3.5:9b    6488c96fa5fa    9.3 GB    100% GPU     19000

eval count:           3802 token(s)
eval duration:        41.830174597s
eval rate:            90.89 tokens/s

qwen3.5:9b-q8_0 - q8 Quantisierung

Diese Quantisierung senkt die Leistung von qwen3.5:9b um 30% im Vergleich zu q4.

ollama run  qwen3.5:9b-q8_0 --verbose
/set parameter num_ctx 19000

compare weather and climate between capital cities of australia
NAME               ID              SIZE     PROCESSOR    CONTEXT
qwen3.5:9b-q8_0    441ec31e4d2a    13 GB    100% GPU     19000

eval count:           3526 token(s)
eval duration:        57.595540159s
eval rate:            61.22 tokens/s

Modelle, die CPU-Offloading benötigen

qwen3-coder:30b - das schnellste aus dem 30b LLM-Set, da nur Text

ollama run qwen3-coder:30b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia

NAME               ID              SIZE     PROCESSOR          CONTEXT
qwen3-coder:30b    06c1097efce0    20 GB    25%/75% CPU/GPU    19000
22%/605%

eval count:           559 token(s)
eval duration:        9.77768875s
eval rate:            57.17 tokens/s

Qwen3-VL 30B — Beste teil-ausgelagerte Performance

ollama run qwen3-vl:30b-a3b-instruct --verbose
/set parameter num_ctx 19000

NAME                         SIZE     PROCESSOR          CONTEXT
qwen3-vl:30b-a3b-instruct    22 GB    30%/70% CPU/GPU    19000

eval count:           1450 token(s)
eval duration:        28.439319709s
eval rate:            50.99 tokens/s

Trotz 30% der Layer auf der CPU hält Qwen3-VL 50,99 Tokens/Sek. – schneller als einige 100% GPU-Modelle. Die Visionsfähigkeit fügt Vielseitigkeit für multimodale Aufgaben hinzu.

Mistral Small 3.2 24B — Kompromiss zwischen Qualität und Geschwindigkeit

ollama run mistral-small3.2:24b --verbose
/set parameter num_ctx 19000

NAME                    SIZE     PROCESSOR          CONTEXT
mistral-small3.2:24b    19 GB    18%/82% CPU/GPU    19000

eval count:           831 token(s)
eval duration:        44.899859038s
eval rate:            18.51 tokens/s

Mistral Small 3.2 bietet überlegene Sprachqualität, zahlt aber einen steilen Preis in der Geschwindigkeit. Mit 18,51 Tokens/Sek. fühlt es sich im interaktiven Chat deutlich langsamer an. Es lohnt sich für Aufgaben, bei denen Qualität wichtiger ist als Latenz.

GLM 4.7 Flash — MoE Denkmodell

ollama run glm-4.7-flash --verbose
/set parameter num_ctx 19000

NAME                 SIZE     PROCESSOR          CONTEXT
glm-4.7-flash        21 GB    27%/73% CPU/GPU    19000

eval count:           2446 token(s)
eval duration:        1m12.239164004s
eval rate:            33.86 tokens/s

GLM 4.7 Flash ist ein 30B-A3B Mixture of Experts Modell – 30B Parameter insgesamt, mit nur 3B aktiven pro Token. Als „Denkmodell“ generiert es internes Reasoning vor den Antworten. Die 33,86 Tokens/Sek. umfassen sowohl Denk- als auch Ausgabetokens. Trotz CPU-Offloading hält die MoE-Architektur es relativ schnell.

qwen3.5:35b - Neues Modell mit ordentlicher Self-Hosted-Leistung

ollama run qwen3.5:35b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia

NAME           ID              SIZE     PROCESSOR          CONTEXT
qwen3.5:35b    4af949f8bdf0    27 GB    43%/57% CPU/GPU    19000

eval count:           3418 token(s)
eval duration:        2m45.458926548s
eval rate:            20.66 tokens/s

GPT-OSS 120B — Der Schwergewichtler

ollama run gpt-oss:120b --verbose
/set parameter num_ctx 19000

NAME            SIZE     PROCESSOR          CONTEXT
gpt-oss:120b    66 GB    78%/22% CPU/GPU    19000

eval count:           5008 token(s)
eval duration:        6m36.168233066s
eval rate:            12.64 tokens/s

Das Ausführen eines 120B-Modells auf 16GB VRAM ist technisch möglich, aber schmerzhaft. Mit 78% auf der CPU macht die Geschwindigkeit von 12,64 Tokens/Sek. die interaktive Nutzung frustrierend. Eher geeignet für Batch-Verarbeitung, bei der Latenz keine Rolle spielt.

qwen3.5:27b - Intelligenter, aber langsam auf Ollama

ollama run qwen3.5:27b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia

NAME           ID              SIZE     PROCESSOR          CONTEXT
qwen3.5:27b    193ec05b1e80    24 GB    43%/57% CPU/GPU    19000

eval count:           3370 token(s)
eval duration:        8m40.087510281s
eval rate:            6.48 tokens/s

Ich habe qwen3.5:27b getestet und hatte eine extrem positive Meinung zur Leistung dieses Modells mit OpenCode. Es ist sehr fähig, wissend, wirklich gutes Tool-Calling, obwohl es auf meinem Rechner auf Ollama langsam ist. Ich habe andere LLM Self-Hosting-Plattformen ausprobiert und viel höhere Geschwindigkeiten erzielt. Ich glaube, es ist Zeit, Ollama zu verlassen. Ich werde später etwas darüber schreiben.

Praktische Empfehlungen

Für interaktiven Chat

Nutzen Sie Modelle, die zu 100% in den VRAM passen:

  1. GPT-OSS 20B — Maximale Geschwindigkeit (139,93 t/s)
  2. Ministral 3 14B — Gute Geschwindigkeit mit Mistral-Qualität (70,13 t/s)
  3. Qwen3 14B — Beste Anweisungsbefolgung (61,85 t/s)

Für ein besseres Chat-Erlebnis, betrachten Sie Open-Source Chat UIs für lokale Ollama.

Für Batch-Verarbeitung

Dies ist wieder auf meiner Ausrüstung – 14GB VRAM.

Wenn Geschwindigkeit weniger kritisch ist:

  • Mistral Small 3.2 24B — Überlegene Sprachqualität
  • Qwen3-VL 30B — Vision + Text-Fähigkeit

Wenn Geschwindigkeit überhaupt nicht kritisch ist:

  • Qwen3.5:35b - Gute Coding-Fähigkeiten
  • Qwen3.5:27b - Extrem gut, aber langsam auf Ollama. Ich hatte allerdings ganz guten Erfolg, dieses Modell mit llama.cpp zu hosten.

Für Entwicklung und Coding

Wenn Sie Anwendungen mit Ollama bauen:

Alternative Hosting-Optionen

Wenn Sie sich über die Einschränkungen von Ollama Sorgen machen (siehe Sorgen bezüglich der Ollama-Enshittifizierung), erkunden Sie andere Optionen im Leitfaden für lokales LLM Hosting oder vergleichen Sie Docker Model Runner vs Ollama.

Fazit

Mit 16GB VRAM können Sie fähige LLMs mit beeindruckenden Geschwindigkeiten ausführen – wenn Sie weise wählen. Die wichtigsten Erkenntnisse:

  1. Bleiben Sie innerhalb der VRAM-Limits für den interaktiven Einsatz. Ein 20B-Modell mit 140 Tokens/Sek. schlägt ein 120B-Modell mit 12 Tokens/Sek. für die meisten praktischen Zwecke.

  2. GPT-OSS 20B gewinnt bei reinen Geschwindigkeit, aber Qwen3 14B bietet das beste Gleichgewicht aus Geschwindigkeit und Fähigkeit für Anweisungsbefolgungsaufgaben.

  3. CPU-Offloading funktioniert, aber erwarten Sie 3-10x Verlangsamungen. Akzeptabel für Batch-Verarbeitung, frustrierend für Chat.

  4. Kontextgröße ist wichtig. Der hier verwendete 19K-Kontext erhöht den VRAM-Verbrauch erheblich. Reduzieren Sie den Kontext für eine bessere GPU-Auslastung.

Für AI-gestützte Suche, die lokale LLMs mit Web-Ergebnissen kombiniert, siehe Perplexica mit Ollama self-hosten.

Um weitere Benchmarks, VRAM- und Durchsatz-Kompromisse sowie Performance-Tuning über Ollama und andere Runtimes hinweg zu erkunden, schauen Sie in unser LLM-Performance: Benchmarks, Engstellen & Optimierung Hub.

Interne Ressourcen

Externe Referenzen

Abonnieren

Neue Beiträge zu Systemen, Infrastruktur und KI-Engineering.