Vergleich der Eignung von NVIDIA-GPUs für KI

KI erfordert viel Strom ...

Inhaltsverzeichnis

Inmitten des Chaos der modernen Welt vergleiche ich hier die technischen Spezifikationen verschiedener Grafikkarten für KI-Aufgaben (Deep Learning, Objekterkennung und LLMs). Sie sind alle jedoch unglaublich teuer.

Weitere Informationen darüber, wie die Wahl der GPU den LLM-Throughput, die VRAM-Grenzen und Benchmarks über verschiedene Laufzeiten hinweg beeinflusst, finden Sie unter LLM-Leistung: Benchmarks, Engpässe & Optimierung. Für einen umfassenderen Kaufleitfaden für 2026, der auch AMD- und Intel-Optionen einschließt, siehe GPUs für KI im Jahr 2026: NVIDIA, AMD, Intel im Vergleich.

Von KI generiertes Bild von Grafikkarten, die auf einer GPU ausgeführt werden

Dies ist ein von KI generiertes Bild. Nehmen Sie es nicht zu ernst…

Werfen wir einen Blick auf andere Optionen, nur um uns umzusehen

Karte VRAM Busbreite Speicherbandbreite CUDA-Kerne Tensor-Kerne Leistung (W)
RTX 4060 Ti 16GB 16 GB 128-bit 288 GB/s 4.352 136 165
RTX 4070 Ti 16GB 16 GB 256-bit 672 GB/s 7.680 240 285
RTX 4080 16GB 16 GB 256-bit 716,8 GB/s 9.728 304 320
RTX 4080 Super 16GB 16 GB 256-bit 736 GB/s 10.240 320 320
RTX 4090 24GB 24 GB 384-bit 1.008 GB/s 16.384 512 450
RTX 5060 Ti 16GB 16 GB 128-bit 448 GB/s 4.608 144 180
RTX 5070 Ti 16GB 16 GB 256-bit 896 GB/s 8.960 280 300
RTX 5080 16GB 16 GB 256-bit 896 GB/s 10.752 336 ~320
RTX 5090 32GB 32 GB 512-bit 1.792 GB/s 21.760 680 ~450
RTX 2000 Ada 16 GB 128-bit 224 GB/s 2.816 88 70
RTX 4000 Ada 20 GB 160-bit 280 GB/s 6.144 192 70
RTX 4500 Ada 24 GB 192-bit 432 GB/s 7.680 240 210
RTX 5000 Ada 32 GB 256-bit 576 GB/s 12.800 400 250
RTX 6000 Ada 48 GB 384-bit 960 GB/s 18.176 568 300

Geschätzte LLM-Geschwindigkeit nach GPU (Qwen 3.6 27B als Basis)

Die unten stehende Tabelle schätzt die Generierungs- und Prompt-Throughput-Leistung basierend auf einer einzigen gemessenen Basis (RTX 4080 16GB) und skaliert dann die Ergebnisse unter Verwendung der Anzahl der CUDA-Kerne und der Speicherbandbreite. Dies bietet eine praktische Planungsreferenz beim Vergleich von NVIDIA-Karten für die lokale Inferenz.

GPU CUDA-Kerne Bandbreite Gesch. Gen. (t/s) Gesch. Prompt (t/s) Gesch. MTP max 2 Gen Gesch. MTP max 2 Prompt
RTX 4080 16GB 8.192 912 GB/s 45 (gemessen) 200 (gemessen) 75 (gemessen) 151 (gemessen)
RTX 4090 24GB 12.000 1.008 GB/s ~50 ~260 ~82 ~220
RTX 5060 Ti 16GB 4.608 448 GB/s ~22 ~100 ~38 ~76
RTX 5070 12GB 6.144 672 GB/s ~34 ~140 ~58 ~114
RTX 5070 Ti 16GB 8.960 896 GB/s ~44 ~190 ~74 ~145
RTX 5080 16GB 10.752 960 GB/s ~45 ~250 ~76 ~195
RTX 5090 32GB 21.760 1.792 GB/s ~85 ~390 ~140 ~310
RTX PRO 4000 24GB 6.144 672 GB/s ~34 ~140 ~58 ~114
RTX PRO 4500 32GB 7.680 896 GB/s ~44 ~175 ~74 ~138
RTX PRO 5000 48GB 12.800 1.344 GB/s ~60 ~300 ~100 ~240
RTX PRO 6000 96GB 21.760 1.792 GB/s ~85 ~390 ~140 ~310

Diese Zahlen sind grobe Schätzungen und keine Benchmark-Ergebnisse für jede einzelne Karte. Die tatsächliche Geschwindigkeit hängt von der Modellgröße, der Quantisierung, der Kontextlänge und dem Software-Stack ab. Die Leistung kann stark sinken, wenn ein Modell nicht vollständig in den VRAM passt und auf den Arbeitsspeicher des CPUs ausgelagert wird.

Für gemessene plattformübergreifende Ergebnisse siehe NVIDIA DGX Spark vs Mac Studio vs RTX-4080. Für Modellwahl basierend auf VRAM-Passfähigkeit siehe Bestes LLM auf 16 GB VRAM GPU.

Speicherbandbreite:

  • RTX 5090 (1792 GB/s), dann RTX 4090 (1008 GB/s), dann RTX 6000 Ada (960 GB/s)

Tensor-Kerne:

  • RTX 5090 (680), dann RTX 6000 Ada (568), dann RTX 4090 (512)

CUDA-Kerne:

  • RTX 5090 (21.760), dann RTX 6000 Ada (18.176), dann RTX 4090 (16.384)

RAM:

  • RTX 6000 Ada (48 GB), dann RTX 5090 und RTX 5000 Ada (32 GB), dann RTX 4090 (24 GB)

Preise in Australien

  • RTX 6000 Ada: 12.000 AUD
  • RTX 5090: 6.000 AUD
  • RTX 5000 Ada: 7.000 AUD
  • RTX 4090: ausverkauft

Beste Consumer-GPU für LLMs

Ich denke, die RTX 5090 wäre trotzdem die beste Wahl für Machine Learning, Deep Learning, KI und sogar LLMs :)…

Reale Preise

Ein bisschen teuer…

NVIDIA RTX 5090 Seite

Und die echten Preise für die RTX 5090 liegen 50 % über den Erwartungen. Sehen Sie selbst!

Stand: 15.05.2025

alt text

alt text

Um LLM-Benchmarks, VRAM-Anforderungen und die Leistungsoptimierung auf verschiedenen GPUs und Laufzeiten zu erkunden, besuchen Sie unser LLM-Leistung: Benchmarks, Engpässe & Optimierung-Hub. Für die Planung von Multi-GPU- und Plattformlösungen siehe KI-Infrastruktur auf Consumer-Hardware und LLM-Leistung und PCIe-Lanes.

Abonnieren

Neue Beiträge zu Systemen, Infrastruktur und KI-Engineering.