Vergleich der Eignung von NVIDIA-GPUs für KI
KI erfordert viel Strom ...
Inmitten des Chaos der modernen Welt vergleiche ich hier die technischen Spezifikationen verschiedener Grafikkarten für KI-Aufgaben (Deep Learning, Objekterkennung und LLMs). Sie sind alle jedoch unglaublich teuer.
Weitere Informationen darüber, wie die Wahl der GPU den LLM-Throughput, die VRAM-Grenzen und Benchmarks über verschiedene Laufzeiten hinweg beeinflusst, finden Sie unter LLM-Leistung: Benchmarks, Engpässe & Optimierung. Für einen umfassenderen Kaufleitfaden für 2026, der auch AMD- und Intel-Optionen einschließt, siehe GPUs für KI im Jahr 2026: NVIDIA, AMD, Intel im Vergleich.

Dies ist ein von KI generiertes Bild. Nehmen Sie es nicht zu ernst…
Werfen wir einen Blick auf andere Optionen, nur um uns umzusehen
| Karte | VRAM | Busbreite | Speicherbandbreite | CUDA-Kerne | Tensor-Kerne | Leistung (W) |
|---|---|---|---|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | 128-bit | 288 GB/s | 4.352 | 136 | 165 |
| RTX 4070 Ti 16GB | 16 GB | 256-bit | 672 GB/s | 7.680 | 240 | 285 |
| RTX 4080 16GB | 16 GB | 256-bit | 716,8 GB/s | 9.728 | 304 | 320 |
| RTX 4080 Super 16GB | 16 GB | 256-bit | 736 GB/s | 10.240 | 320 | 320 |
| RTX 4090 24GB | 24 GB | 384-bit | 1.008 GB/s | 16.384 | 512 | 450 |
| RTX 5060 Ti 16GB | 16 GB | 128-bit | 448 GB/s | 4.608 | 144 | 180 |
| RTX 5070 Ti 16GB | 16 GB | 256-bit | 896 GB/s | 8.960 | 280 | 300 |
| RTX 5080 16GB | 16 GB | 256-bit | 896 GB/s | 10.752 | 336 | ~320 |
| RTX 5090 32GB | 32 GB | 512-bit | 1.792 GB/s | 21.760 | 680 | ~450 |
| RTX 2000 Ada | 16 GB | 128-bit | 224 GB/s | 2.816 | 88 | 70 |
| RTX 4000 Ada | 20 GB | 160-bit | 280 GB/s | 6.144 | 192 | 70 |
| RTX 4500 Ada | 24 GB | 192-bit | 432 GB/s | 7.680 | 240 | 210 |
| RTX 5000 Ada | 32 GB | 256-bit | 576 GB/s | 12.800 | 400 | 250 |
| RTX 6000 Ada | 48 GB | 384-bit | 960 GB/s | 18.176 | 568 | 300 |
Geschätzte LLM-Geschwindigkeit nach GPU (Qwen 3.6 27B als Basis)
Die unten stehende Tabelle schätzt die Generierungs- und Prompt-Throughput-Leistung basierend auf einer einzigen gemessenen Basis (RTX 4080 16GB) und skaliert dann die Ergebnisse unter Verwendung der Anzahl der CUDA-Kerne und der Speicherbandbreite. Dies bietet eine praktische Planungsreferenz beim Vergleich von NVIDIA-Karten für die lokale Inferenz.
| GPU | CUDA-Kerne | Bandbreite | Gesch. Gen. (t/s) | Gesch. Prompt (t/s) | Gesch. MTP max 2 Gen | Gesch. MTP max 2 Prompt |
|---|---|---|---|---|---|---|
| RTX 4080 16GB | 8.192 | 912 GB/s | 45 (gemessen) | 200 (gemessen) | 75 (gemessen) | 151 (gemessen) |
| RTX 4090 24GB | 12.000 | 1.008 GB/s | ~50 | ~260 | ~82 | ~220 |
| RTX 5060 Ti 16GB | 4.608 | 448 GB/s | ~22 | ~100 | ~38 | ~76 |
| RTX 5070 12GB | 6.144 | 672 GB/s | ~34 | ~140 | ~58 | ~114 |
| RTX 5070 Ti 16GB | 8.960 | 896 GB/s | ~44 | ~190 | ~74 | ~145 |
| RTX 5080 16GB | 10.752 | 960 GB/s | ~45 | ~250 | ~76 | ~195 |
| RTX 5090 32GB | 21.760 | 1.792 GB/s | ~85 | ~390 | ~140 | ~310 |
| RTX PRO 4000 24GB | 6.144 | 672 GB/s | ~34 | ~140 | ~58 | ~114 |
| RTX PRO 4500 32GB | 7.680 | 896 GB/s | ~44 | ~175 | ~74 | ~138 |
| RTX PRO 5000 48GB | 12.800 | 1.344 GB/s | ~60 | ~300 | ~100 | ~240 |
| RTX PRO 6000 96GB | 21.760 | 1.792 GB/s | ~85 | ~390 | ~140 | ~310 |
Diese Zahlen sind grobe Schätzungen und keine Benchmark-Ergebnisse für jede einzelne Karte. Die tatsächliche Geschwindigkeit hängt von der Modellgröße, der Quantisierung, der Kontextlänge und dem Software-Stack ab. Die Leistung kann stark sinken, wenn ein Modell nicht vollständig in den VRAM passt und auf den Arbeitsspeicher des CPUs ausgelagert wird.
Für gemessene plattformübergreifende Ergebnisse siehe NVIDIA DGX Spark vs Mac Studio vs RTX-4080. Für Modellwahl basierend auf VRAM-Passfähigkeit siehe Bestes LLM auf 16 GB VRAM GPU.
Speicherbandbreite:
- RTX 5090 (1792 GB/s), dann RTX 4090 (1008 GB/s), dann RTX 6000 Ada (960 GB/s)
Tensor-Kerne:
- RTX 5090 (680), dann RTX 6000 Ada (568), dann RTX 4090 (512)
CUDA-Kerne:
- RTX 5090 (21.760), dann RTX 6000 Ada (18.176), dann RTX 4090 (16.384)
RAM:
- RTX 6000 Ada (48 GB), dann RTX 5090 und RTX 5000 Ada (32 GB), dann RTX 4090 (24 GB)
Preise in Australien
- RTX 6000 Ada: 12.000 AUD
- RTX 5090: 6.000 AUD
- RTX 5000 Ada: 7.000 AUD
- RTX 4090: ausverkauft
Beste Consumer-GPU für LLMs
Ich denke, die RTX 5090 wäre trotzdem die beste Wahl für Machine Learning, Deep Learning, KI und sogar LLMs :)…
Reale Preise
Ein bisschen teuer…

Und die echten Preise für die RTX 5090 liegen 50 % über den Erwartungen. Sehen Sie selbst!
Stand: 15.05.2025


Um LLM-Benchmarks, VRAM-Anforderungen und die Leistungsoptimierung auf verschiedenen GPUs und Laufzeiten zu erkunden, besuchen Sie unser LLM-Leistung: Benchmarks, Engpässe & Optimierung-Hub. Für die Planung von Multi-GPU- und Plattformlösungen siehe KI-Infrastruktur auf Consumer-Hardware und LLM-Leistung und PCIe-Lanes.