Vergelijking van de geschiktheid van Nvidia GPU’s voor AI

AI vereist veel energie...

Inhoud

In de warboel van de moderne wereld vergelijk ik hier de technische specificaties van verschillende kaarten die geschikt zijn voor AI-taken (Diep leren, Objectdetectie en LLM’s). Ze zijn echter allemaal ontzettend duur.

Voor meer informatie over hoe de keuze van GPU de LLM-doorvoer, VRAM-beperkingen en benchmarks over verschillende runtimes beïnvloedt, zie LLM-prestaties: benchmarks, bottlenecks en optimalisatie. Voor een bredere aankoopgids voor 2026 die ook AMD- en Intel-opties omvat, zie GPU’s voor AI in 2026: NVIDIA, AMD en Intel vergeleken.

Afbeelding van grafische kaarten gegenereerd door AI die op GPU draait

Dit is een door AI gegenereerde afbeelding. Neem het niet te serieus…

Laten we eens kijken naar andere opties, gewoon om rond te kijken

Kaart VRAM Busbreedte Geheugenbandbreedte CUDA-kernen Tensor-kernen Vermogen (W)
RTX 4060 Ti 16GB 16 GB 128-bit 288 GB/s 4.352 136 165
RTX 4070 Ti 16GB 16 GB 256-bit 672 GB/s 7.680 240 285
RTX 4080 16GB 16 GB 256-bit 716,8 GB/s 9.728 304 320
RTX 4080 Super 16GB 16 GB 256-bit 736 GB/s 10.240 320 320
RTX 4090 24GB 24 GB 384-bit 1008 GB/s 16.384 512 450
RTX 5060 Ti 16GB 16 GB 128-bit 448 GB/s 4.608 144 180
RTX 5070 Ti 16GB 16 GB 256-bit 896 GB/s 8.960 280 300
RTX 5080 16GB 16 GB 256-bit 896 GB/s 10.752 336 ~320
RTX 5090 32GB 32 GB 512-bit 1792 GB/s 21.760 680 ~450
RTX 2000 Ada 16 GB 128-bit 224 GB/s 2.816 88 70
RTX 4000 Ada 20 GB 160-bit 280 GB/s 6.144 192 70
RTX 4500 Ada 24 GB 192-bit 432 GB/s 7.680 240 210
RTX 5000 Ada 32 GB 256-bit 576 GB/s 12.800 400 250
RTX 6000 Ada 48 GB 384-bit 960 GB/s 18.176 568 300

Geschatte LLM-snelheid per GPU (Qwen 3.6 27B als referentie)

De onderstaande tabel schat de generatie- en prompt-doorvoer op basis van één gemeten referentiewaarde (RTX 4080 16GB) en schaalt de resultaten vervolgens op basis van het aantal CUDA-kernen en de geheugenbandbreedte. Dit biedt een praktisch referentiepunt bij het vergelijken van NVIDIA-kaarten voor lokale inferentie.

GPU CUDA-kernen Bandbreedte Geschatte Gen (t/s) Geschatte Prompt (t/s) Geschatte MTP max 2 Gen Geschatte MTP max 2 Prompt
RTX 4080 16GB 8.192 912 GB/s 45 (gemeten) 200 (gemeten) 75 (gemeten) 151 (gemeten)
RTX 4090 24GB 12.000 1.008 GB/s ~50 ~260 ~82 ~220
RTX 5060 Ti 16GB 4.608 448 GB/s ~22 ~100 ~38 ~76
RTX 5070 12GB 6.144 672 GB/s ~34 ~140 ~58 ~114
RTX 5070 Ti 16GB 8.960 896 GB/s ~44 ~190 ~74 ~145
RTX 5080 16GB 10.752 960 GB/s ~45 ~250 ~76 ~195
RTX 5090 32GB 21.760 1.792 GB/s ~85 ~390 ~140 ~310
RTX PRO 4000 24GB 6.144 672 GB/s ~34 ~140 ~58 ~114
RTX PRO 4500 32GB 7.680 896 GB/s ~44 ~175 ~74 ~138
RTX PRO 5000 48GB 12.800 1.344 GB/s ~60 ~300 ~100 ~240
RTX PRO 6000 96GB 21.760 1.792 GB/s ~85 ~390 ~140 ~310

Deze cijfers zijn ruwe schattingen, geen benchmarkresultaten voor elke kaart. De werkelijke snelheid hangt af van de modelgrootte, kwantisatie, contextlengte en softwarestack. De prestaties kunnen sterk afnemen als een model niet volledig in het VRAM past en er wordt overgeschakeld naar CPU-geheugen.

Voor gemeten cross-platform resultaten, zie NVIDIA DGX Spark versus Mac Studio versus RTX-4080. Voor keuzes van modellen die in het VRAM passen, zie Beste LLM op 16 GB VRAM GPU.

Geheugenbandbreedte:

  • RTX 5090 (1792 GB/s), dan RTX 4090 (1008 GB/s), dan RTX 6000 Ada (960 GB/s)

Tensor-kernen:

  • RTX 5090 (680), dan RTX 6000 Ada (568), dan RTX 4090 (512)

CUDA-kernen:

  • RTX 5090 (21.760), dan RTX 6000 Ada (18.176), dan RTX 4090 (16.384)

Geheugen (RAM/VRAM):

  • RTX 6000 Ada (48 GB), dan RTX 5090 en RTX 5000 Ada (32 GB), dan RTX 4090 (24 GB)

Prijzen in Australië

  • RTX 6000 Ada: 12.000 AUD
  • RTX 5090: 6.000 AUD
  • RTX 5000 Ada: 7.000 AUD
  • RTX 4090: uitverkocht

Beste consumenten-GPU voor LLM

Ik denk nog steeds dat de RTX 5090 de beste keuze is voor machine learning, diep leren, AI en zelfs LLM’s :)…

Werkelijke prijzen

Een beetje prijzig…

NVIDIA RTX 5090-pagina

En de werkelijke prijzen van de RTX 5090 zijn 50% hoger dan verwacht. Kijk eens hier!

Dit is van 15/05/2025

alt text

alt text

Om LLM-benchmarks, VRAM-eisen en prestatieafstelling op verschillende GPU’s en runtimes te verkennen, bekijk onze hub LLM-prestaties: benchmarks, bottlenecks en optimalisatie. Voor planning met meerdere GPU’s en platformen, zie AI-infrastructuur op consumentenhardware en LLM-prestaties en PCIe-lanes.

Abonneren

Ontvang nieuwe berichten over systemen, infrastructuur en AI-engineering.