AIにおけるNVIDIA GPUの適性比較

AIは大量の電力を必要とする...

目次

現代の混乱の最中、私は AI タスクに適した 異なるグラボの仕様を比較 しています (ディープラーニング, オブジェクト検出 および LLM)。 ただし、これらはすべて非常に高価です。

GPUの選択がLLMのスループット、VRAMの制限、およびランタイム間のベンチマークに与える影響について詳しくは、LLMパフォーマンス:ベンチマーク、ボトルネック、最適化 を参照してください。AMDやIntelのオプションを含むより広範な2026年の購入ガイドについては、2026年のAI用GPU:NVIDIA、AMD、Intelの比較 を参照してください。

AIがGPU上で実行して生成したグラフィックカードの画像

これはAIが生成した画像です。真に受けないでください…

他の選択肢も見てみましょう、まずは概観してみます

カード VRAM バス幅 メモリ帯域幅 CUDAコア テンソルコア 消費電力 (W)
RTX 4060 Ti 16GB 16 GB 128-bit 288 GB/s 4,352 136 165
RTX 4070 Ti 16GB 16 GB 256-bit 672 GB/s 7,680 240 285
RTX 4080 16GB 16 GB 256-bit 716.8 GB/s 9,728 304 320
RTX 4080 Super 16GB 16 GB 256-bit 736 GB/s 10,240 320 320
RTX 4090 24GB 24 GB 384-bit 1008 GB/s 16,384 512 450
RTX 5060 Ti 16GB 16 GB 128-bit 448 GB/s 4,608 144 180
RTX 5070 Ti 16GB 16 GB 256-bit 896 GB/s 8,960 280 300
RTX 5080 16GB 16 GB 256-bit 896 GB/s 10,752 336 ~320
RTX 5090 32GB 32 GB 512-bit 1792 GB/s 21,760 680 ~450
RTX 2000 Ada 16 GB 128-bit 224 GB/s 2,816 88 70
RTX 4000 Ada 20 GB 160-bit 280 GB/s 6,144 192 70
RTX 4500 Ada 24 GB 192-bit 432 GB/s 7,680 240 210
RTX 5000 Ada 32 GB 256-bit 576 GB/s 12,800 400 250
RTX 6000 Ada 48 GB 384-bit 960 GB/s 18,176 568 300

GPU別の推定LLM速度(Qwen 3.6 27B ベースライン)

以下の表は、単一の測定ベースライン(RTX 4080 16GB)からの生成およびプロンプトスループットを推定し、その後、CUDAコア数とメモリ帯域幅を使用して結果をスケーリングしています。これは、ローカル推論用のNVIDIAカードを比較する際の実用的な計画参照となります。

GPU CUDAコア 帯域幅 推定生成 (t/s) 推定プロンプト (t/s) 推定MTP max 2 生成 推定MTP max 2 プロンプト
RTX 4080 16GB 8,192 912 GB/s 45 (測定値) 200 (測定値) 75 (測定値) 151 (測定値)
RTX 4090 24GB 12,000 1,008 GB/s ~50 ~260 ~82 ~220
RTX 5060 Ti 16GB 4,608 448 GB/s ~22 ~100 ~38 ~76
RTX 5070 12GB 6,144 672 GB/s ~34 ~140 ~58 ~114
RTX 5070 Ti 16GB 8,960 896 GB/s ~44 ~190 ~74 ~145
RTX 5080 16GB 10,752 960 GB/s ~45 ~250 ~76 ~195
RTX 5090 32GB 21,760 1,792 GB/s ~85 ~390 ~140 ~310
RTX PRO 4000 24GB 6,144 672 GB/s ~34 ~140 ~58 ~114
RTX PRO 4500 32GB 7,680 896 GB/s ~44 ~175 ~74 ~138
RTX PRO 5000 48GB 12,800 1,344 GB/s ~60 ~300 ~100 ~240
RTX PRO 6000 96GB 21,760 1,792 GB/s ~85 ~390 ~140 ~310

これらの数値は概算の推定値であり、すべてのカードのベンチマーク結果ではありません。実際の速度は、モデルのサイズ、量子化、コンテキストの長さ、ソフトウェアスタックに依存します。モデルがVRAMに完全に収まらず、CPUメモリへのオフロードを開始する場合、パフォーマンスは急激に低下する可能性があります。

測定されたクロスプラットフォームの結果については、NVIDIA DGX Spark vs Mac Studio vs RTX-4080 を参照してください。VRAMに収まるモデルの選択については、16 GB VRAM GPU上の最適なLLM を参照してください。

メモリ帯域幅:

  • RTX 5090 (1792 GB/s)、次に RTX 4090 (1008 GB/s)、次に RTX 6000 Ada (960 GB/s)

テンソルコア:

  • RTX 5090 (680)、次に RTX 6000 Ada (568)、次に RTX 4090 (512)

CUDAコア

  • RTX 5090 (21,760)、次に RTX 6000 Ada (18,176)、次に RTX 4090 (16,384)

メモリ

  • RTX 6000 Ada (48 GB)、次に RTX 5090 と RTX 5000 Ada (32 GB)、次に RTX 4090 (24GB)

オーストラリアでの価格

  • RTX 6000 Ada: 12,000 AUD
  • RTX 5090: 6,000 AUD
  • RTX 5000 Ada: 7,000 AUD
  • RTX 4090: 販売終了

LLM向け最高のコンシューマーGPU

それでも、RTX 5090が機械学習、ディープラーニング、AI、さらにはLLMにとって最善の選択だと思います :)…

実際の価格

少し高価です…

NVIDIA RTX 5090のページ

そして、実際のRTX 5090の価格は、予想よりも50%高いです。これを見てください!

2025年5月15日の時点です

alt text

alt text

LLMベンチマーク、VRAM要件、および異なるGPUとランタイムでのパフォーマンスチューニングを探究するには、当社の LLMパフォーマンス:ベンチマーク、ボトルネック、最適化 ハブをチェックしてください。マルチGPUとプラットフォームの計画については、コンシューマーハードウェア上のAIインフラストラクチャLLMパフォーマンスとPCIeレーン を参照してください。

有用なリンク

購読する

システム、インフラ、AIエンジニアリングの新記事をお届けします。