Сравнение пригодности GPU от NVIDIA для задач искусственного интеллекта

ИИ требует значительного энергопотребления...

Содержимое страницы

В условиях современной турбулентности я сравниваю технические характеристики различных видеокарт, подходящих для задач ИИ (Глубокое обучение, Обнаружение объектов и Языковые модели). Они все невероятно дороги.

Для получения дополнительной информации о том, как выбор видеокарты влияет на пропускную способность языковых моделей, ограничения видеопамяти и результаты тестирования в различных средах выполнения, см. статью Производительность LLM: бенчмарки, узкие места и оптимизация. Более широкий гид по покупке на 2026 год, включающий варианты от AMD и Intel, доступен в статье Видеокарты для ИИ в 2026 году: сравнение NVIDIA, AMD и Intel.

Изображение видеокарт, сгенерированное ИИ, работающим на GPU

Это изображение сгенерировано ИИ. Не относитесь к нему слишком серьезно…

Давайте взглянем на другие варианты, просто чтобы осмотреться

Видеокарта Видеопамять Шина памяти Пропускная способность памяти Ядра CUDA Ядра Tensor Потребление (Вт)
RTX 4060 Ti 16GB 16 ГБ 128-bit 288 ГБ/с 4,352 136 165
RTX 4070 Ti 16GB 16 ГБ 256-bit 672 ГБ/с 7,680 240 285
RTX 4080 16GB 16 ГБ 256-bit 716.8 ГБ/с 9,728 304 320
RTX 4080 Super 16GB 16 ГБ 256-bit 736 ГБ/с 10,240 320 320
RTX 4090 24GB 24 ГБ 384-bit 1008 ГБ/с 16,384 512 450
RTX 5060 Ti 16GB 16 ГБ 128-bit 448 ГБ/с 4,608 144 180
RTX 5070 Ti 16GB 16 ГБ 256-bit 896 ГБ/с 8,960 280 300
RTX 5080 16GB 16 ГБ 256-bit 896 ГБ/с 10,752 336 ~320
RTX 5090 32GB 32 ГБ 512-bit 1792 ГБ/с 21,760 680 ~450
RTX 2000 Ada 16 ГБ 128-bit 224 ГБ/с 2,816 88 70
RTX 4000 Ada 20 ГБ 160-bit 280 ГБ/с 6,144 192 70
RTX 4500 Ada 24 ГБ 192-bit 432 ГБ/с 7,680 240 210
RTX 5000 Ada 32 ГБ 256-bit 576 ГБ/с 12,800 400 250
RTX 6000 Ada 48 ГБ 384-bit 960 ГБ/с 18,176 568 300

Оценка скорости LLM по видеокарте (базовая линия Qwen 3.6 27B)

В таблице ниже приведена оценка скорости генерации и обработки промптов на основе одного измеренного базового значения (RTX 4080 16GB), после чего результаты масштабируются с использованием количества ядер CUDA и пропускной способности памяти. Это дает практическую ориентировочную таблицу при сравнении видеокарт NVIDIA для локального инференса.

GPU Ядра CUDA Пропускная способность Оц. генерация (ток/с) Оц. промпт (ток/с) Оц. MTP макс 2 генерация Оц. MTP макс 2 промпт
RTX 4080 16GB 8,192 912 ГБ/с 45 (измерено) 200 (измерено) 75 (измерено) 151 (измерено)
RTX 4090 24GB 12,000 1,008 ГБ/с ~50 ~260 ~82 ~220
RTX 5060 Ti 16GB 4,608 448 ГБ/с ~22 ~100 ~38 ~76
RTX 5070 12GB 6,144 672 ГБ/с ~34 ~140 ~58 ~114
RTX 5070 Ti 16GB 8,960 896 ГБ/с ~44 ~190 ~74 ~145
RTX 5080 16GB 10,752 960 ГБ/с ~45 ~250 ~76 ~195
RTX 5090 32GB 21,760 1,792 ГБ/с ~85 ~390 ~140 ~310
RTX PRO 4000 24GB 6,144 672 ГБ/с ~34 ~140 ~58 ~114
RTX PRO 4500 32GB 7,680 896 ГБ/с ~44 ~175 ~74 ~138
RTX PRO 5000 48GB 12,800 1,344 ГБ/с ~60 ~300 ~100 ~240
RTX PRO 6000 96GB 21,760 1,792 ГБ/с ~85 ~390 ~140 ~310

Эти цифры являются приблизительными оценками, а не результатами бенчмарков для каждой конкретной карты. Фактическая скорость зависит от размера модели, квантования, длины контекста и программного стека. Производительность может резко снизиться, если модель не помещается полностью в видеопамяти и начинается выгрузка в оперативную память CPU.

Для измеренных результатов кроссплатформенного тестирования см. NVIDIA DGX Spark против Mac Studio против RTX-4080. Для выбора моделей, помещающихся в 16 ГБ видеопамяти, см. Лучшая LLM для GPU с 16 ГБ VRAM.

Пропускная способность памяти:

  • RTX 5090 (1792 ГБ/с), затем RTX 4090 (1008 ГБ/с), затем RTX 6000 Ada (960 ГБ/с)

Ядра Tensor:

  • RTX 5090 (680), затем RTX 6000 Ada (568), затем RTX 4090 (512)

Ядра CUDA:

  • RTX 5090 (21,760), затем RTX 6000 Ada (18,176), затем RTX 4090 (16,384)

Оперативная память (VRAM):

  • RTX 6000 Ada (48 ГБ), затем RTX 5090 и RTX 5000 Ada (32 ГБ), затем RTX 4090 (24 ГБ)

Цены в Австралии

  • RTX 6000 Ada: 12,000 AUD
  • RTX 5090: 6,000 AUD
  • RTX 5000 Ada: 7,000 AUD
  • RTX 4090: распродана

Лучшая потребительская видеокарта для LLM

Тем не менее, я считаю, что RTX 5090 является лучшим выбором для машинного обучения, глубокого обучения, ИИ и даже языковых моделей :)…

Реальные цены

Довольно дорого…

Страница NVidia RTX 5090

И реальные цены на RTX 5090 на 50% выше ожидаемых. Посмотрите на это!

Дата: 15/05/2025

alt text

alt text

Чтобы изучить бенчмарки языковых моделей, требования к видеопамяти и настройку производительности на различных видеокартах и средах выполнения, посетите наш раздел Производительность LLM: бенчмарки, узкие места и оптимизация. Для планирования инфраструктуры с несколькими GPU и платформами см. Инфраструктура ИИ на потребительском оборудовании и Производительность LLM и линии PCIe.

Полезные ссылки

Подписаться

Получайте новые материалы про системы, инфраструктуру и AI engineering.