NVIDIA GeForce RTX 5090 D

NVIDIA GeForce RTX 5090 D
Análisis de la tarjeta gráfica NVIDIA GeForce RTX 5090 D

NVIDIA GeForce RTX 5090 D: recortaron AI, pero casi no tocaron los juegos

La GeForce RTX 5090 D ha llegado al mercado chino debido a las restricciones de exportación de Estados Unidos. A diferencia de la RTX 4090 D, NVIDIA casi no ha recortado su parte dedicada a los juegos: la cantidad de núcleos CUDA, la memoria y los bloques principales de la GPU se mantienen al nivel de la RTX 5090 normal. La principal limitación afecta a la rendimiento en AI.

¿Qué exactamente se recortó en la RTX 5090 D?

La RTX 5090 D conserva 21,760 núcleos CUDA, 680 Tensor Cores, 170 RT Cores, 32 GB de GDDR7, un bus de memoria de 512 bits y un límite de potencia de 575 vatios.

La principal diferencia radica en el rendimiento declarado de los núcleos Tensor: 2375 AI TOPS en la RTX 5090 D contra 3352 AI TOPS en la RTX 5090 normal, es decir, aproximadamente un 29% menos.

En juegos, esta limitación casi no interfiere: la rasterización, el ray tracing y el subsistema de memoria en la RTX 5090 D no están recortados.

Rendimiento de la RTX 5090 D en concreto

El rendimiento de la RTX 5090 D es especialmente revelador en las pruebas de modelos de socios.

Tarjeta gráfica 3DMark Time Spy Extreme Graphics 3DMark Port Royal
Colorful iGame GeForce RTX 5090 D Advanced 32GB 25,497 36,497
ZOTAC GeForce RTX 5090 D SOLID OC 32GB 25,901 35,252
GALAX GeForce RTX 5090 D Xingyao LUNA OC 24,946 34,017

Los resultados se obtuvieron en diferentes sistemas de prueba, por lo que no conviene comparar los modelos por varios cientos de puntos directamente. La variación entre las tres tarjetas es de solo unos pocos por ciento, la cual es la diferencia habitual entre diferentes versiones de una misma GPU.

El overclocking de fábrica ofrece un beneficio mínimo, por lo tanto, es mejor elegir una RTX 5090 D concreta en función del enfriamiento, ruido, dimensiones y límite de potencia.

RTX 5090 D en 4K

El 4K es el modo más representativo para la RTX 5090 D: en 1440p y especialmente en 1080p, el resultado cada vez más se ve limitado por la CPU o el motor del juego.

Los resultados con DLSS 4 Multi Frame Generation se deben separar de las pruebas normales: la generación de fotogramas incrementa drásticamente el contador de FPS, pero la tarjeta gráfica no comienza a renderizar fotogramas tan rápidamente. Por lo tanto, para una comparación directa, los resultados de la RTX 5090 D son más reveladores en pruebas sin Frame Generation.

¿Por qué la RTX 5090 D original necesita 32 GB?

La RTX 5090 D original cuenta con 32 GB de GDDR7, un bus de 512 bits y un ancho de banda de 1792 GB/s.

En la mayoría de los juegos modernos, los 32 GB no son siempre necesarios, pero esta cantidad será útil en renderizados 3D, edición de video, escenas complejas y al ejecutar modelos de AI locales.

Sin embargo, para tareas computacionales, la RTX 5090 D ya no es un análogo completo de la RTX 5090 normal. El rendimiento declarado en AI para la versión D es menor, y la diferencia real depende de la aplicación y el formato de cálculo.

En tareas de AI, las limitaciones de la versión D son notablemente más importantes que en los juegos.

575 W requieren una alimentación y refrigeración serias

La RTX 5090 D conservó el TGP de 575 vatios de la RTX 5090 normal. Las versiones de socios con límites de potencia ampliados pueden consumir aún más.

Se necesitará una fuente de alimentación potente, un chasis bien ventilado y suficiente espacio para la tarjeta gráfica masiva. Los modelos grandes de socios ocupan hasta cuatro ranuras y pesan más de 2.5 kg.

Para tarjetas tan pesadas, el soporte para la tarjeta gráfica ya no es un accesorio decorativo.

RTX 5090 D y RTX 5090 D V2 - no son lo mismo

La RTX 5090 D original incluye:

  • 32 GB de GDDR7;
  • un bus de 512 bits;
  • un ancho de banda de 1792 GB/s.

Posteriormente, apareció la RTX 5090 D V2: los mismos 21,760 núcleos CUDA, pero ahora con 24 GB de GDDR7 y un bus de 384 bits. El ancho de banda de memoria se redujo a 1344 GB/s.

La V2 apareció tras un nuevo endurecimiento de las restricciones de exportación y reemplazó efectivamente la versión original en el mercado chino.

En juegos, la reducción de memoria y ancho de banda generalmente tiene un impacto menor que en las cargas de trabajo, pero para AI y tareas profesionales pesadas, la diferencia es más notable. Por lo tanto, la designación V2 no se puede interpretar como una simple revisión de la misma tarjeta.

Conclusión

La RTX 5090 D original casi no cede ante la RTX 5090 en lo que respecta a juegos: las principales limitaciones que impuso NVIDIA se trasladaron a los cálculos de AI.

Si la RTX 5090 normal tiene el mismo precio, no tiene sentido elegir la D. Pero a un precio más bajo, la RTX 5090 D original de 32 GB casi no pierde nada en juegos.

Lo principal al comprar es no confundirla con la RTX 5090 D V2. La V2 ya tiene 24 GB de memoria y un bus de 384 bits: no es una revisión cosmética, sino una versión de la tarjeta que ha cambiado notablemente.

Básico

Nombre de Etiqueta
NVIDIA
Plataforma
Desktop
Fecha de Lanzamiento
January 2025
Nombre del modelo
GeForce RTX 5090 D
Generación
GeForce 50
Reloj base
2017 MHz
Reloj de impulso
2407 MHz
Interfaz de bus
PCIe 5.0 x16
Transistores
92 billion
Núcleos RT
170
Núcleos tensor
?
Los Tensor Cores son unidades de procesamiento especializadas diseñadas específicamente para el aprendizaje profundo, proporcionando un rendimiento de entrenamiento e inferencia más alto en comparación con el entrenamiento FP32. Permiten cálculos rápidos en áreas como la visión por computadora, el procesamiento del lenguaje natural, el reconocimiento de voz, la conversión de texto a voz y las recomendaciones personalizadas. Las dos aplicaciones más destacadas de los Tensor Cores son DLSS (Deep Learning Super Sampling) y AI Denoiser para la reducción de ruido.
680
TMUs
?
Las unidades de mapeo de texturas (TMUs) funcionan como componentes de la GPU, capaces de rotar, escalar y distorsionar imágenes binarias, para luego colocarlas como texturas sobre cualquier plano de un modelo 3D dado. Este proceso se llama mapeo de texturas.
680
Fundición
TSMC
Tamaño proceso
4 nm
Arquitectura
Blackwell

Especificaciones de Memoria

Tamaño de memoria
32GB
Tipo de memoria
GDDR7
Bus de memoria
?
La anchura del bus de memoria se refiere al número de bits de datos que la memoria de video puede transferir en un solo ciclo de reloj. Cuanto mayor sea la anchura del bus, mayor será la cantidad de datos que se pueden transmitir instantáneamente, lo que lo convierte en uno de los parámetros cruciales de la memoria de video. El ancho de banda de memoria se calcula como: Ancho de banda de memoria = Frecuencia de memoria x Anchura de bus de memoria / 8. Por lo tanto, cuando las frecuencias de memoria son similares, la anchura del bus de memoria determinará el tamaño del ancho de banda de memoria.
512bit
Reloj de memoria
1750 MHz
Ancho de banda
?
La "ancho de banda de memoria" se refiere a la tasa de transferencia de datos entre el chip gráfico y la memoria de video. Se mide en bytes por segundo, y la fórmula para calcularlo es: ancho de banda de memoria = frecuencia de trabajo × ancho de bus de memoria / 8 bits.
1.79TB/s

Pantalla y multimedia

Salidas
1x HDMI 2.1b
3x DisplayPort 2.1b

Rendimiento teórico

Tasa de píxeles
?
La tasa de llenado de píxeles se refiere al número de píxeles que una unidad de procesamiento gráfico (GPU) puede renderizar por segundo, medida en MPíxeles/s (millones de píxeles por segundo) o GPíxeles/s (miles de millones de píxeles por segundo). Es la métrica más comúnmente utilizada para evaluar el rendimiento de procesamiento de píxeles de una tarjeta gráfica.
423.6 GPixel/s
Tasa de texturas
?
La tasa de llenado de texturas se refiere al número de elementos del mapa de textura (texels) que una GPU puede asignar a píxeles en un solo segundo.
1637 GTexel/s
FP16 (mitad)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
104.8 TFLOPS
FP64 (doble)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
1.637 TFLOPS
FP32 (flotante)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
104.8 TFLOPS

Misceláneos

Cuenta de SM
?
Múltiples Procesadores de Transmisión (SP), junto con otros recursos, forman un Multiprocesador de Transmisión (SM), que también se conoce como el núcleo principal de una GPU. Estos recursos adicionales incluyen componentes como planificadores de bloques, registros y memoria compartida. El SM puede considerarse como el corazón de la GPU, similar a un núcleo de CPU, donde los registros y la memoria compartida son recursos escasos dentro del SM.
170
Unidades de sombreado
?
La unidad de procesamiento más fundamental es el Procesador de Secuencias (SP), donde se ejecutan instrucciones y tareas específicas. Las GPU realizan cómputo paralelo, lo que significa que varios SP trabajan simultáneamente para procesar tareas.
21760
Caché L1
128 KB (per SM)
Caché L2
96 MB
TDP
575W
Vulkan Versión
?
Vulkan es una API de gráficos y computación multiplataforma de Khronos Group, ofrece alto rendimiento y bajo consumo de CPU. Permite a los desarrolladores controlar la GPU directamente, reduce el overhead de renderización y soporta multi-threading y procesadores multi-núcleo.
1.4
OpenCL Versión
3.0
OpenGL
4.6
CUDA
12.0
DirectX
12 Ultimate (12_2)
Conectores de alimentación
1x 16-pin
ROPs
?
La tubería de operaciones raster (ROPs) es principalmente responsable de manejar los cálculos de iluminación y reflexión en los juegos, así como de administrar efectos como el anti-aliasing (AA), alta resolución, humo y fuego. Cuanto más exigentes sean el anti-aliasing y los efectos de iluminación en un juego, mayores serán los requisitos de rendimiento para los ROPs; de lo contrario, puede resultar en una caída brusca en la velocidad de fotogramas.
176
Modelo de sombreado
6.8
PSU sugerida
1000 W

Clasificaciones

FP32 (flotante)
Puntaje
104.8 TFLOPS
3DMark Steel Nomad
Puntaje
14475
Blender
Puntaje
14853.7
Vulkan
Puntaje
382809
OpenCL
Puntaje
385013

Comparado con Otras GPU

FP32 (flotante) / TFLOPS
163.4 +55.9%
105.525 +0.7%
79.478 -24.2%
65.572 -37.4%
3DMark Steel Nomad
14544 +0.5%
9237 -36.2%
8858 -38.8%
Blender
15026.3 +1.2%
1265.43 -91.5%
630 -95.8%
Vulkan
152166 -60.3%
100987 -73.6%
76392 -80%
49804 -87%
OpenCL
388405 +0.9%
126692 -67.1%
90580 -76.5%
66428 -82.7%