AIにおけるNVIDIA GPUの適性比較
AIは大量の電力を必要とする...
現代の混乱の最中、私は AI タスクに適した 異なるグラボの仕様を比較 しています (ディープラーニング, オブジェクト検出 および LLM)。 ただし、これらはすべて非常に高価です。
GPUの選択がLLMのスループット、VRAMの制限、およびランタイム間のベンチマークに与える影響について詳しくは、LLMパフォーマンス:ベンチマーク、ボトルネック、最適化 を参照してください。AMDやIntelのオプションを含むより広範な2026年の購入ガイドについては、2026年のAI用GPU:NVIDIA、AMD、Intelの比較 を参照してください。

これはAIが生成した画像です。真に受けないでください…
他の選択肢も見てみましょう、まずは概観してみます
| カード | VRAM | バス幅 | メモリ帯域幅 | CUDAコア | テンソルコア | 消費電力 (W) |
|---|---|---|---|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | 128-bit | 288 GB/s | 4,352 | 136 | 165 |
| RTX 4070 Ti 16GB | 16 GB | 256-bit | 672 GB/s | 7,680 | 240 | 285 |
| RTX 4080 16GB | 16 GB | 256-bit | 716.8 GB/s | 9,728 | 304 | 320 |
| RTX 4080 Super 16GB | 16 GB | 256-bit | 736 GB/s | 10,240 | 320 | 320 |
| RTX 4090 24GB | 24 GB | 384-bit | 1008 GB/s | 16,384 | 512 | 450 |
| RTX 5060 Ti 16GB | 16 GB | 128-bit | 448 GB/s | 4,608 | 144 | 180 |
| RTX 5070 Ti 16GB | 16 GB | 256-bit | 896 GB/s | 8,960 | 280 | 300 |
| RTX 5080 16GB | 16 GB | 256-bit | 896 GB/s | 10,752 | 336 | ~320 |
| RTX 5090 32GB | 32 GB | 512-bit | 1792 GB/s | 21,760 | 680 | ~450 |
| RTX 2000 Ada | 16 GB | 128-bit | 224 GB/s | 2,816 | 88 | 70 |
| RTX 4000 Ada | 20 GB | 160-bit | 280 GB/s | 6,144 | 192 | 70 |
| RTX 4500 Ada | 24 GB | 192-bit | 432 GB/s | 7,680 | 240 | 210 |
| RTX 5000 Ada | 32 GB | 256-bit | 576 GB/s | 12,800 | 400 | 250 |
| RTX 6000 Ada | 48 GB | 384-bit | 960 GB/s | 18,176 | 568 | 300 |
GPU別の推定LLM速度(Qwen 3.6 27B ベースライン)
以下の表は、単一の測定ベースライン(RTX 4080 16GB)からの生成およびプロンプトスループットを推定し、その後、CUDAコア数とメモリ帯域幅を使用して結果をスケーリングしています。これは、ローカル推論用のNVIDIAカードを比較する際の実用的な計画参照となります。
| GPU | CUDAコア | 帯域幅 | 推定生成 (t/s) | 推定プロンプト (t/s) | 推定MTP max 2 生成 | 推定MTP max 2 プロンプト |
|---|---|---|---|---|---|---|
| RTX 4080 16GB | 8,192 | 912 GB/s | 45 (測定値) | 200 (測定値) | 75 (測定値) | 151 (測定値) |
| RTX 4090 24GB | 12,000 | 1,008 GB/s | ~50 | ~260 | ~82 | ~220 |
| RTX 5060 Ti 16GB | 4,608 | 448 GB/s | ~22 | ~100 | ~38 | ~76 |
| RTX 5070 12GB | 6,144 | 672 GB/s | ~34 | ~140 | ~58 | ~114 |
| RTX 5070 Ti 16GB | 8,960 | 896 GB/s | ~44 | ~190 | ~74 | ~145 |
| RTX 5080 16GB | 10,752 | 960 GB/s | ~45 | ~250 | ~76 | ~195 |
| RTX 5090 32GB | 21,760 | 1,792 GB/s | ~85 | ~390 | ~140 | ~310 |
| RTX PRO 4000 24GB | 6,144 | 672 GB/s | ~34 | ~140 | ~58 | ~114 |
| RTX PRO 4500 32GB | 7,680 | 896 GB/s | ~44 | ~175 | ~74 | ~138 |
| RTX PRO 5000 48GB | 12,800 | 1,344 GB/s | ~60 | ~300 | ~100 | ~240 |
| RTX PRO 6000 96GB | 21,760 | 1,792 GB/s | ~85 | ~390 | ~140 | ~310 |
これらの数値は概算の推定値であり、すべてのカードのベンチマーク結果ではありません。実際の速度は、モデルのサイズ、量子化、コンテキストの長さ、ソフトウェアスタックに依存します。モデルがVRAMに完全に収まらず、CPUメモリへのオフロードを開始する場合、パフォーマンスは急激に低下する可能性があります。
測定されたクロスプラットフォームの結果については、NVIDIA DGX Spark vs Mac Studio vs RTX-4080 を参照してください。VRAMに収まるモデルの選択については、16 GB VRAM GPU上の最適なLLM を参照してください。
メモリ帯域幅:
- RTX 5090 (1792 GB/s)、次に RTX 4090 (1008 GB/s)、次に RTX 6000 Ada (960 GB/s)
テンソルコア:
- RTX 5090 (680)、次に RTX 6000 Ada (568)、次に RTX 4090 (512)
CUDAコア
- RTX 5090 (21,760)、次に RTX 6000 Ada (18,176)、次に RTX 4090 (16,384)
メモリ
- RTX 6000 Ada (48 GB)、次に RTX 5090 と RTX 5000 Ada (32 GB)、次に RTX 4090 (24GB)
オーストラリアでの価格
- RTX 6000 Ada: 12,000 AUD
- RTX 5090: 6,000 AUD
- RTX 5000 Ada: 7,000 AUD
- RTX 4090: 販売終了
LLM向け最高のコンシューマーGPU
それでも、RTX 5090が機械学習、ディープラーニング、AI、さらにはLLMにとって最善の選択だと思います :)…
実際の価格
少し高価です…

そして、実際のRTX 5090の価格は、予想よりも50%高いです。これを見てください!
2025年5月15日の時点です


LLMベンチマーク、VRAM要件、および異なるGPUとランタイムでのパフォーマンスチューニングを探究するには、当社の LLMパフォーマンス:ベンチマーク、ボトルネック、最適化 ハブをチェックしてください。マルチGPUとプラットフォームの計画については、コンシューマーハードウェア上のAIインフラストラクチャ と LLMパフォーマンスとPCIeレーン を参照してください。