NVIDIA GeForce RTX 5090

NVIDIA GeForce RTX 5090
Test de la carte graphique NVIDIA GeForce RTX 5090

NVIDIA GeForce RTX 5090 : 32 Go GDDR7 à 575 W

La GeForce RTX 5090 est une carte graphique qui ne cherche pas à sembler être un achat rationnel. Ses tâches sont le 4K dans les paramètres maximaux, le ray tracing lourd, l'IA locale et le rendu professionnel. Cependant, dans le cadre d'une mise à jour massive des caractéristiques, l'augmentation du FPS de jeu standard s'est avérée relativement modeste : le nombre de cœurs CUDA a augmenté d'environ un tiers, la bande passante de la mémoire a presque augmenté de 78 %, le TGP a grimpé à 575 W, et l'avantage par rapport à la RTX 4090 sans génération de cadres est généralement d'environ 25 à 30 %.

Ainsi, il convient de dissocier le rendu standard et les résultats avec DLSS ici. La Multi Frame Generation montre les capacités de Blackwell et de DLSS, mais ne double pas les performances du GPU lui-même.

Caractéristiques de la GeForce RTX 5090

La RTX 5090 repose sur l'architecture Blackwell GB202. La carte est dotée de 21 760 cœurs CUDA, de 32 Go de GDDR7 et d'un bus mémoire de 512 bits. La bande passante atteint 1792 Go/s - presque 1,8 To/s. Elle utilise également des cœurs Tensor de cinquième génération et des cœurs RT de quatrième génération.

Caractéristique GeForce RTX 5090 GeForce RTX 4090
Architecture Blackwell Ada Lovelace
Cœurs CUDA 21 760 16 384
Mémoire vidéo 32 Go GDDR7 24 Go GDDR6X
Bus mémoire 512 bits 384 bits
Bande passante 1792 Go/s environ 1008 Go/s
Fréquence Boost 2,41 GHz 2,52 GHz
PCI Express PCIe 5.0 PCIe 4.0
TGP 575 W 450 W
Prix de départ 1999 $ 1599 $

La RTX 4090 a une fréquence Boost déclarée plus élevée, il est donc peu judicieux de comparer les générations uniquement par rapport aux gigahertz. La RTX 5090 a reçu environ un tiers de cœurs CUDA supplémentaires, 8 Go de mémoire en plus et une bande passante presque 78 % supérieure.

Benchmarks de la GeForce RTX 5090

Carte graphique 3DMark Time Spy Extreme Graphics Founders Edition
NVIDIA GeForce RTX 5090 Founders Edition ~25 431 -
MSI GeForce RTX 5090 SUPRIM SOC ~26 345 +3,6%
ASUS ROG Astral GeForce RTX 5090 OC ~26 504 +4,2%
GIGABYTE AORUS GeForce RTX 5090 MASTER ~26 741 +5,2%

Même les versions overclockées d'usine gagnent seulement quelques pour cent par rapport à la Founders Edition. Dans les tests de ray tracing, l'écart reste tout aussi faible.

Il convient de choisir entre ROG Astral, SUPRIM, AORUS MASTER et Founders Edition en fonction du refroidissement, du niveau de bruit, des dimensions et de la limite de puissance, et non dans l'attente d'un FPS nettement plus élevé. Un énorme système de refroidissement ne rend pas le GB202 des dizaines de pour-cent plus rapide.

RTX 5090 contre RTX 4090 dans les jeux

En 4K, la RTX 5090 dépasse généralement la RTX 4090 d'environ 25 à 30 % sans génération de cadres. Dans certains projets lourds, l'écart dépasse 30 %, tandis qu'en 1440p, il est souvent limité par le processeur.

Dans Black Myth : Wukong à 4K, on obtient environ 62 FPS contre environ 47 FPS - soit environ +32 % en faveur de la RTX 5090.

Il n'y a pas de doublement des performances de la RTX 4090 en rendu standard ici.

Dans les jeux, la RTX 5090 est avant tout nécessaire pour le 4K. En 1080p et souvent en 1440p, le gain est déjà limité par le processeur. Plus la résolution est élevée et plus le ray tracing ou le path tracing sont lourds, mieux se révèle la réserve de puissance de calcul du nouveau GPU.

DLSS et Multi Frame Generation

Blackwell a reçu la Multi Frame Generation : entre les cadres entièrement rendus, plusieurs cadres supplémentaires peuvent être créés. Grâce à cette technologie, le compteur de FPS peut augmenter de manière exponentielle.

Mais il est impossible de mettre ces résultats sur un pied d'égalité avec le FPS standard.

La Multi Frame Generation améliore la fluidité visuelle, mais ne transforme pas 60 FPS d'origine en 200 FPS avec un temps de réponse de contrôle correspondant. Par conséquent, les résultats avec MFG ne peuvent pas être pris comme un indicateur d'un gain de performances du GPU lui-même.

L'écart maximal de la RTX 5090 se manifeste en 4K avec un ray tracing lourd, un path tracing et un rendu via des réseaux neuronaux.

32 Go ne sont pas tant nécessaires aux jeux qu'aux tâches professionnelles

Pour les jeux, 8 Go supplémentaires changent rarement le FPS final. Dans l'IA locale et les scènes 3D lourdes, la différence entre 24 et 32 Go peut déterminer si une tâche tiendra dans la mémoire vidéo ou non.

Dans Blender, la RTX 5090 peut devancer la RTX 4090 d'environ 35 à 40 %, et dans certaines charges de travail AI, le gain est également nettement plus élevé que dans la rasterisation standard.

L'architecture Blackwell a reçu le support FP4, et la performance AI annoncée de la RTX 5090 atteint 3352 TOPS. Associée à 32 Go de VRAM, cela élargit la gamme de modèles et de charges de travail qui peuvent être exécutés entièrement sur le GPU.

La RTX 5090 a également trois NVENC de neuvième génération et deux NVDEC de sixième génération. Trois encodeurs matériels sont particulièrement utiles lors du montage, du streaming et du codage parallèle de plusieurs flux vidéo.

575 W - le principal compromis

La RTX 4090 ne pouvait déjà plus être qualifiée d'économique, mais la RTX 5090 a porté le TGP de 450 à 575 W.

Le TGP a augmenté d'environ 28 %, soit presque dans la même proportion que la performance de jeu moyenne en 4K. En termes de performance par watt, cette transition semble beaucoup plus modeste que l'augmentation du nombre de cœurs CUDA et de la bande passante de la mémoire.

Pour un système avec une RTX 5090, une alimentation d'environ 1000 W est recommandée, bien que les besoins réels dépendent du processeur et des autres composants.

De plus, la Founders Edition est restée une carte à deux emplacements d'une longueur d'environ 304 mm grâce à un PCB retravaillé et à un système de refroidissement Double Flow Through. La plupart des RTX 5090 partenaires sont sensiblement plus grandes.

Dans un contexte de modèles énormes à trois ou quatre emplacements, c'est un sérieux atout de la Founders Edition.

Il convient de vérifier le nombre de ROP sur les premières RTX 5090

Parmi les premières RTX 5090, il y avait des exemplaires avec un nombre de ROP inférieur à celui prévu dans la spécification.

Une RTX 5090 normale doit avoir 176 ROP. Selon NVIDIA, le problème a touché moins de 0,5 % des RTX 5090, RTX 5090D et RTX 5070 Ti et pouvait réduire les performances graphiques d'environ 4 %.

Dans les nouveaux lots, le problème a été corrigé, mais lors de l'achat d'une RTX 5090 ancienne ou d'occasion, il vaut toujours la peine de vérifier avec GPU-Z : le programme doit indiquer 176 ROPs.

Conclusion

La RTX 5090 se justifie dans les tâches où la RTX 4090 est déjà insuffisante : un 4K lourd avec path tracing, une IA locale et des scènes 3D pouvant occuper plus de 24 Go de VRAM.

Dans les jeux standard, la différence est beaucoup plus modeste. Avec une augmentation du TGP de 450 à 575 W et un prix de départ passant de 1599 $ à 1999 $, l'avantage par rapport à la RTX 4090 sans génération de cadres est généralement d'environ 25 à 30 %.

Les avantages de la RTX 5090 ne se limitent pas au FPS : elle dispose de 32 Go de GDDR7, d'une bande passante de près de 1,8 To/s, de nouveaux blocs RT et Tensor, de FP4, de trois NVENC et de Multi Frame Generation.

Pour le propriétaire d'une RTX 4090, changer de carte uniquement pour le FPS de jeu standard est difficile à justifier. Mais dans un nouveau système pour le 4K lourd, l'IA locale ou des charges de travail qui nécessitent déjà plus de 24 Go de VRAM, les avantages de la RTX 5090 deviennent beaucoup plus compréhensibles.

Payer plus cher pour une version haut de gamme de la RTX 5090 uniquement pour l'overclocking d'usine est presque inutile : la différence avec la Founders Edition est généralement de seulement 3 à 5 %. Le choix de l'exécution particulière doit se faire en fonction du refroidissement, du niveau de bruit, des dimensions et du prix.

Basique

Nom de l'étiquette
NVIDIA
Plate-forme
Desktop
Date de lancement
January 2025
GPU Lithography
TSMC 4N
Nom du modèle
GeForce RTX 5090
Génération
GeForce 50
Horloge de base
2010 MHz
Horloge Boost
2407 MHz
Interface de bus
PCIe Gen 5
Transistors
92.2
Cœurs RT
170, 4th Gen
Cœurs de Tensor
?
Les Tensor Cores sont des unités de traitement spécialisées conçues spécifiquement pour l'apprentissage en profondeur, offrant des performances supérieures en matière d'entraînement et d'inférence par rapport à l'entraînement FP32. Ils permettent des calculs rapides dans des domaines tels que la vision par ordinateur, le traitement du langage naturel, la reconnaissance vocale, la conversion texte-parole et les recommandations personnalisées. Les deux applications les plus remarquables des Tensor Cores sont DLSS (Deep Learning Super Sampling) et AI Denoiser pour la réduction du bruit.
680, 5th Gen
TMUs
?
Les unités de mappage de texture (TMUs) sont des composants du GPU qui sont capables de faire pivoter, mettre à l'échelle et déformer des images binaires, puis de les placer en tant que textures sur n'importe quel plan d'un modèle 3D donné. Ce processus est appelé mappage de texture.
680
Fonderie
TSMC
Architecture
NVIDIA Blackwell / GB202

Spécifications de la mémoire

Taille de Mémoire
32 GB GDDR7
Type de Mémoire
GDDR7
Bus de Mémoire
?
La largeur du bus mémoire fait référence au nombre de bits de données que la mémoire vidéo peut transférer lors d'un seul cycle d'horloge. Plus la largeur du bus est grande, plus la quantité de données qui peut être transmise instantanément est importante, ce qui en fait l'un des paramètres cruciaux de la mémoire vidéo. La bande passante mémoire est calculée comme suit : Bande passante mémoire = Fréquence mémoire x Largeur du bus mémoire / 8. Par conséquent, lorsque les fréquences mémoire sont similaires, la largeur du bus mémoire déterminera la taille de la bande passante mémoire.
512-bit
Bande Passante
?
La bande passante mémoire fait référence au débit de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde, et la formule pour la calculer est : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits. En français: La bande passante mémoire désigne le taux de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde et la formule pour la calculer est la suivante : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits.
1792 GB/s

Affichage et multimédia

Sorties
1x HDMI 2.1b
3x DisplayPort 2.1b with UHBR20

Performance théorique

Taux de Pixel
?
Le taux de remplissage des pixels désigne le nombre de pixels qu'une unité de traitement graphique (GPU) peut rendre par seconde, mesuré en MPixels/s (million de pixels par seconde) ou en GPixels/s (milliard de pixels par seconde). C'est la mesure la plus couramment utilisée pour évaluer les performances de traitement des pixels d'une carte graphique.
423.6 GPixel/s
Taux de Texture
?
Le taux de remplissage de texture fait référence au nombre d'éléments de texture (texels) qu'un GPU peut mapper sur des pixels en une seule seconde.
1636.8 GTexel/s
FP16 (demi)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
104.8 TFLOPS
FP64 (double précision)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
1.613 TFLOPS
FP32 (flottant)
?
Une mesure importante pour mesurer les performances du GPU est la capacité de calcul en virgule flottante. Les nombres à virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de traitement multimédia et graphique, tandis que les nombres à virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui exige une large plage numérique et une grande précision. Les nombres à virgule flottante demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable.
104.8 TFLOPS

Divers

Nombre de SM
?
Plusieurs processeurs de flux (SPs), ainsi que d'autres ressources, forment un multiprocesseur de flux (SM), également appelé cœur principal du GPU. Ces ressources supplémentaires comprennent des composants tels que des ordonnanceurs de warp, des registres et de la mémoire partagée. Le SM peut être considéré comme le cœur du GPU, similaire à un cœur de CPU, les registres et la mémoire partagée étant des ressources limitées au sein du SM.
170
Unités d'Ombrage
?
L'unité de traitement la plus fondamentale est le processeur en continu (SP), où des instructions et des tâches spécifiques sont exécutées. Les GPU effectuent des calculs parallèles, ce qui signifie que plusieurs SP fonctionnent simultanément pour traiter les tâches.
21760
Cache L1
128 KB (per SM)
Cache L2
96 MB
TDP
575 W TGP
Version Vulkan
?
Vulkan est une API graphique et de calcul multiplateforme du groupe Khronos, offrant des performances élevées et une faible surcharge du processeur. Il permet aux développeurs de contrôler directement le GPU, réduit les frais de rendu et prend en charge les processeurs multithread et multicœurs.
1.4
Version OpenCL
3.0
OpenGL
4.6
CUDA
CUDA Compute Capability 12.0
DirectX
12 Ultimate (12_2)
Connecteurs d'alimentation
1x 16-pin (12V-2x6)
ROPs
?
Le pipeline des opérations de rasterisation (ROPs) est principalement responsable de la gestion des calculs d'éclairage et de réflexion dans les jeux, ainsi que de la gestion d'effets tels que l'anti-aliasing (AA), la haute résolution, la fumée et le feu. Plus les effets d'anti-aliasing et d'éclairage sont exigeants dans un jeu, plus les exigences de performances pour les ROPs sont élevées ; sinon, cela peut entraîner une chute importante du taux de rafraîchissement.
176
Modèle de shader
6.7
Alimentation suggérée
1000 W

Benchmarks

FP32 (flottant)
Score
104.8 TFLOPS
3DMark Steel Nomad
Score
14544
Blender
Score
15026.3
Vulkan
Score
366095
OpenCL
Score
368974

Comparé aux autres GPU

FP32 (flottant) / TFLOPS
163.4 +55.9%
105.525 +0.7%
79.478 -24.2%
65.572 -37.4%
3DMark Steel Nomad
14475 -0.5%
9237 -36.5%
8858 -39.1%
Blender
3548 -76.4%
1265.43 -91.6%
630 -95.8%
Vulkan
382809 +4.6%
100987 -72.4%
76392 -79.1%
49804 -86.4%
OpenCL
388405 +5.3%
126692 -65.7%
90580 -75.5%
66428 -82%