Comparando la idoneidad de las GPUs de Nvidia para IA
La IA requiere mucha energía...
En medio del caos del mundo moderno, aquí estoy comparando las especificaciones técnicas de diferentes tarjetas adecuadas para tareas de IA (Aprendizaje Profundo, Detección de Objetos y Modelos de Lenguaje Grande). Sin embargo, todas son increíblemente caras.
Para más información sobre cómo la elección de la GPU afecta el rendimiento de los LLM, los límites de VRAM y los benchmarks entre diferentes entornos de ejecución, consulte Rendimiento de LLM: Benchmarks, Cuellos de Botella y Optimización. Para una guía de compra más amplia de 2026 que incluya opciones de AMD e Intel, consulte GPUs para IA en 2026: NVIDIA, AMD, Intel Comparadas.

Esta es una imagen generada por IA. No la tomes demasiado en serio…
Echemos un vistazo a otras opciones, solo para mirar alrededor
| Tarjeta | VRAM | Ancho de Bus | Ancho de Banda de Memoria | Núcleos CUDA | Núcleos Tensor | Potencia (W) |
|---|---|---|---|---|---|---|
| RTX 4060 Ti 16GB | 16 GB | 128-bit | 288 GB/s | 4,352 | 136 | 165 |
| RTX 4070 Ti 16GB | 16 GB | 256-bit | 672 GB/s | 7,680 | 240 | 285 |
| RTX 4080 16GB | 16 GB | 256-bit | 716.8 GB/s | 9,728 | 304 | 320 |
| RTX 4080 Super 16GB | 16 GB | 256-bit | 736 GB/s | 10,240 | 320 | 320 |
| RTX 4090 24GB | 24 GB | 384-bit | 1008 GB/s | 16,384 | 512 | 450 |
| RTX 5060 Ti 16GB | 16 GB | 128-bit | 448 GB/s | 4,608 | 144 | 180 |
| RTX 5070 Ti 16GB | 16 GB | 256-bit | 896 GB/s | 8,960 | 280 | 300 |
| RTX 5080 16GB | 16 GB | 256-bit | 896 GB/s | 10,752 | 336 | ~320 |
| RTX 5090 32GB | 32 GB | 512-bit | 1792 GB/s | 21,760 | 680 | ~450 |
| RTX 2000 Ada | 16 GB | 128-bit | 224 GB/s | 2,816 | 88 | 70 |
| RTX 4000 Ada | 20 GB | 160-bit | 280 GB/s | 6,144 | 192 | 70 |
| RTX 4500 Ada | 24 GB | 192-bit | 432 GB/s | 7,680 | 240 | 210 |
| RTX 5000 Ada | 32 GB | 256-bit | 576 GB/s | 12,800 | 400 | 250 |
| RTX 6000 Ada | 48 GB | 384-bit | 960 GB/s | 18,176 | 568 | 300 |
Velocidad estimada de LLM por GPU (línea base Qwen 3.6 27B)
La tabla siguiente estima el rendimiento de generación y de prompts a partir de una línea base medida (RTX 4080 16GB), y luego escala los resultados utilizando la cantidad de núcleos CUDA y el ancho de banda de memoria. Esto proporciona una referencia práctica de planificación al comparar tarjetas NVIDIA para inferencia local.
| GPU | Núcleos CUDA | Ancho de Banda | Gen. Est. (t/s) | Prompt Est. (t/s) | MTP máx 2 Gen Est. | MTP máx 2 Prompt Est. |
|---|---|---|---|---|---|---|
| RTX 4080 16GB | 8,192 | 912 GB/s | 45 (medido) | 200 (medido) | 75 (medido) | 151 (medido) |
| RTX 4090 24GB | 12,000 | 1,008 GB/s | ~50 | ~260 | ~82 | ~220 |
| RTX 5060 Ti 16GB | 4,608 | 448 GB/s | ~22 | ~100 | ~38 | ~76 |
| RTX 5070 12GB | 6,144 | 672 GB/s | ~34 | ~140 | ~58 | ~114 |
| RTX 5070 Ti 16GB | 8,960 | 896 GB/s | ~44 | ~190 | ~74 | ~145 |
| RTX 5080 16GB | 10,752 | 960 GB/s | ~45 | ~250 | ~76 | ~195 |
| RTX 5090 32GB | 21,760 | 1,792 GB/s | ~85 | ~390 | ~140 | ~310 |
| RTX PRO 4000 24GB | 6,144 | 672 GB/s | ~34 | ~140 | ~58 | ~114 |
| RTX PRO 4500 32GB | 7,680 | 896 GB/s | ~44 | ~175 | ~74 | ~138 |
| RTX PRO 5000 48GB | 12,800 | 1,344 GB/s | ~60 | ~300 | ~100 | ~240 |
| RTX PRO 6000 96GB | 21,760 | 1,792 GB/s | ~85 | ~390 | ~140 | ~310 |
Estos números son estimaciones aproximadas, no resultados de benchmarks para cada tarjeta. La velocidad real depende del tamaño del modelo, la cuantización, la longitud del contexto y el stack de software. El rendimiento puede caer drásticamente si un modelo no cabe completamente en la VRAM y comienza a volcar memoria a la CPU.
Para resultados medidos entre plataformas, consulte NVIDIA DGX Spark vs Mac Studio vs RTX-4080. Para elegir modelos que quepan en la VRAM, consulte Mejor LLM en GPU con 16 GB de VRAM.
Ancho de Banda de Memoria:
- RTX 5090 (1792 GB/s), luego RTX 4090 (1008 GB/s), luego RTX 6000 Ada (960 GB/s)
Núcleos Tensor:
- RTX 5090 (680), luego RTX 6000 Ada (568), luego RTX 4090 (512)
Núcleos CUDA
- RTX 5090 (21,760), luego RTX 6000 Ada (18,176), luego RTX 4090 (16,384)
RAM
- RTX 6000 Ada (48 GB), luego RTX 5090 y RTX 5000 Ada (32 GB), luego RTX 4090 (24GB)
Precios en Australia
- RTX 6000 Ada: 12,000 AUD
- RTX 5090: 6,000 AUD
- RTX 5000 Ada: 7,000 AUD
- RTX 4090: agotado
Mejor GPU de consumo para LLM
Aún así, creo que la RTX 5090 sería la mejor opción para aprendizaje automático, aprendizaje profundo, IA e incluso LLM :)…
Precios Reales
Un poco caro…

Y los precios reales de la RTX 5090 son un 50% más altos de lo esperado. ¡Mira esto!
Esto es de 15/05/2025


Para explorar benchmarks de LLM, requisitos de VRAM y ajuste de rendimiento en diferentes GPUs y entornos de ejecución, visite nuestro centro de Rendimiento de LLM: Benchmarks, Cuellos de Botella y Optimización. Para la planificación de multi-GPU y plataformas, consulte Infraestructura de IA en Hardware de Consumo y Rendimiento de LLM y Pistas PCIe.