Comparando la idoneidad de las GPUs de Nvidia para IA

La IA requiere mucha energía...

Índice

En medio del caos del mundo moderno, aquí estoy comparando las especificaciones técnicas de diferentes tarjetas adecuadas para tareas de IA (Aprendizaje Profundo, Detección de Objetos y Modelos de Lenguaje Grande). Sin embargo, todas son increíblemente caras.

Para más información sobre cómo la elección de la GPU afecta el rendimiento de los LLM, los límites de VRAM y los benchmarks entre diferentes entornos de ejecución, consulte Rendimiento de LLM: Benchmarks, Cuellos de Botella y Optimización. Para una guía de compra más amplia de 2026 que incluya opciones de AMD e Intel, consulte GPUs para IA en 2026: NVIDIA, AMD, Intel Comparadas.

Imagen de tarjetas gráficas generada por IA ejecutándose en GPU

Esta es una imagen generada por IA. No la tomes demasiado en serio…

Echemos un vistazo a otras opciones, solo para mirar alrededor

Tarjeta VRAM Ancho de Bus Ancho de Banda de Memoria Núcleos CUDA Núcleos Tensor Potencia (W)
RTX 4060 Ti 16GB 16 GB 128-bit 288 GB/s 4,352 136 165
RTX 4070 Ti 16GB 16 GB 256-bit 672 GB/s 7,680 240 285
RTX 4080 16GB 16 GB 256-bit 716.8 GB/s 9,728 304 320
RTX 4080 Super 16GB 16 GB 256-bit 736 GB/s 10,240 320 320
RTX 4090 24GB 24 GB 384-bit 1008 GB/s 16,384 512 450
RTX 5060 Ti 16GB 16 GB 128-bit 448 GB/s 4,608 144 180
RTX 5070 Ti 16GB 16 GB 256-bit 896 GB/s 8,960 280 300
RTX 5080 16GB 16 GB 256-bit 896 GB/s 10,752 336 ~320
RTX 5090 32GB 32 GB 512-bit 1792 GB/s 21,760 680 ~450
RTX 2000 Ada 16 GB 128-bit 224 GB/s 2,816 88 70
RTX 4000 Ada 20 GB 160-bit 280 GB/s 6,144 192 70
RTX 4500 Ada 24 GB 192-bit 432 GB/s 7,680 240 210
RTX 5000 Ada 32 GB 256-bit 576 GB/s 12,800 400 250
RTX 6000 Ada 48 GB 384-bit 960 GB/s 18,176 568 300

Velocidad estimada de LLM por GPU (línea base Qwen 3.6 27B)

La tabla siguiente estima el rendimiento de generación y de prompts a partir de una línea base medida (RTX 4080 16GB), y luego escala los resultados utilizando la cantidad de núcleos CUDA y el ancho de banda de memoria. Esto proporciona una referencia práctica de planificación al comparar tarjetas NVIDIA para inferencia local.

GPU Núcleos CUDA Ancho de Banda Gen. Est. (t/s) Prompt Est. (t/s) MTP máx 2 Gen Est. MTP máx 2 Prompt Est.
RTX 4080 16GB 8,192 912 GB/s 45 (medido) 200 (medido) 75 (medido) 151 (medido)
RTX 4090 24GB 12,000 1,008 GB/s ~50 ~260 ~82 ~220
RTX 5060 Ti 16GB 4,608 448 GB/s ~22 ~100 ~38 ~76
RTX 5070 12GB 6,144 672 GB/s ~34 ~140 ~58 ~114
RTX 5070 Ti 16GB 8,960 896 GB/s ~44 ~190 ~74 ~145
RTX 5080 16GB 10,752 960 GB/s ~45 ~250 ~76 ~195
RTX 5090 32GB 21,760 1,792 GB/s ~85 ~390 ~140 ~310
RTX PRO 4000 24GB 6,144 672 GB/s ~34 ~140 ~58 ~114
RTX PRO 4500 32GB 7,680 896 GB/s ~44 ~175 ~74 ~138
RTX PRO 5000 48GB 12,800 1,344 GB/s ~60 ~300 ~100 ~240
RTX PRO 6000 96GB 21,760 1,792 GB/s ~85 ~390 ~140 ~310

Estos números son estimaciones aproximadas, no resultados de benchmarks para cada tarjeta. La velocidad real depende del tamaño del modelo, la cuantización, la longitud del contexto y el stack de software. El rendimiento puede caer drásticamente si un modelo no cabe completamente en la VRAM y comienza a volcar memoria a la CPU.

Para resultados medidos entre plataformas, consulte NVIDIA DGX Spark vs Mac Studio vs RTX-4080. Para elegir modelos que quepan en la VRAM, consulte Mejor LLM en GPU con 16 GB de VRAM.

Ancho de Banda de Memoria:

  • RTX 5090 (1792 GB/s), luego RTX 4090 (1008 GB/s), luego RTX 6000 Ada (960 GB/s)

Núcleos Tensor:

  • RTX 5090 (680), luego RTX 6000 Ada (568), luego RTX 4090 (512)

Núcleos CUDA

  • RTX 5090 (21,760), luego RTX 6000 Ada (18,176), luego RTX 4090 (16,384)

RAM

  • RTX 6000 Ada (48 GB), luego RTX 5090 y RTX 5000 Ada (32 GB), luego RTX 4090 (24GB)

Precios en Australia

  • RTX 6000 Ada: 12,000 AUD
  • RTX 5090: 6,000 AUD
  • RTX 5000 Ada: 7,000 AUD
  • RTX 4090: agotado

Mejor GPU de consumo para LLM

Aún así, creo que la RTX 5090 sería la mejor opción para aprendizaje automático, aprendizaje profundo, IA e incluso LLM :)…

Precios Reales

Un poco caro…

Página de NVidia RTX 5090

Y los precios reales de la RTX 5090 son un 50% más altos de lo esperado. ¡Mira esto!

Esto es de 15/05/2025

alt text

alt text

Para explorar benchmarks de LLM, requisitos de VRAM y ajuste de rendimiento en diferentes GPUs y entornos de ejecución, visite nuestro centro de Rendimiento de LLM: Benchmarks, Cuellos de Botella y Optimización. Para la planificación de multi-GPU y plataformas, consulte Infraestructura de IA en Hardware de Consumo y Rendimiento de LLM y Pistas PCIe.

Enlaces útiles

Suscribirse

Recibe nuevas publicaciones sobre sistemas, infraestructura e ingeniería de IA.