NVIDIA L40S
vs
NVIDIA L20

vs
Comparaison de cartes graphiques NVIDIA L40S vs NVIDIA L20

Résultat de la comparaison des GPU

NVIDIA L40S vs NVIDIA L20 : mémoire identique, performance différente

Les NVIDIA L40S et L20 sont basées sur l'architecture Ada Lovelace et sont équipées de 48 Go de mémoire GDDR6 avec ECC. Elles ont un bus de 384 bits, une bande passante de 864 Go/s et une interface PCIe 4.0 x16. Sur ces caractéristiques, les modèles semblent proches, mais le L40S appartient à une catégorie nettement plus élevée.

Il dispose de plus de cœurs CUDA, Tensor et RT, ce qui le rend mieux adapté à l'IA générative, à l'inférence intensive, au rendu et aux stations de travail virtuelles. Le L20 conserve une grande capacité de mémoire, mais il est significativement inférieur en vitesse de calcul.

Différences principales

Caractéristique NVIDIA L40S NVIDIA L20
Architecture Ada Lovelace Ada Lovelace
Cœurs CUDA 18 176 11 776
Cœurs Tensor 568 368
Cœurs RT 142 92
Performance FP32 91,6 TFLOPS environ 59,3 TFLOPS
Mémoire 48 Go GDDR6 ECC 48 Go GDDR6 ECC
Bande passante mémoire 864 Go/s 864 Go/s
Interface PCIe 4.0 x16 PCIe 4.0 x16
Puissance maximale 350 W environ 300 W
Refroidissement passif passif

Le L40S contient environ 54 % de cœurs CUDA en plus. Un avantage comparable est constaté dans les calculs FP32, et dans les opérations tensor, l'écart peut être encore plus important.

Que permettent 48 Go de mémoire

Le principal avantage du L20 est sa capacité de mémoire similaire à celle du L40S. Cela permet de charger de grands modèles de langage, des scènes complexes, des ensembles de données volumineux et plusieurs postes de travail virtuels.

Cependant, le volume de mémoire détermine avant tout si une tâche peut tenir sur l'accélérateur. La vitesse d'exécution dépend des unités de calcul et de la performance tensor.

Les deux cartes peuvent exécuter le même modèle, mais le L40S traite les requêtes plus rapidement, supporte un plus grand nombre d'utilisateurs simultanés et nécessite moins de temps pour l'entraînement ou le réentraînement. Une bande passante mémoire identique ne compense pas la différence de capacité GPU.

Intelligence artificielle

Le L40S est conçu pour des charges serveurs mixtes : inférence, entraînement de réseaux de neurones, IA générative, traitement vidéo et visualisation professionnelle. Il prend en charge les cœurs Tensor de quatrième génération, FP8 et le Transformer Engine.

Le L20 est plus judicieux à utiliser dans des scénarios plus modérés :

  • inférence avec un nombre réduit de requêtes simultanées ;
  • exécution de modèles nécessitant jusqu'à 48 Go de mémoire ;
  • réentraînement occasionnel ;
  • serveurs avec une consommation d'énergie limitée.

Dans un service constamment chargé, l'avantage du L40S devient particulièrement notable : un seul accélérateur peut traiter plus de requêtes sans augmenter le nombre de cartes.

Rendu et stations de travail virtuelles

Le L40S est équipé de 142 cœurs RT contre 92 pour le L20. Cela le rend préférentiel pour le ray tracing, le rendu photoréaliste, les jumeaux numériques et les scènes complexes dans NVIDIA Omniverse.

Des cœurs CUDA supplémentaires accélèrent la simulation, le traitement de la géométrie et les étapes de calcul du rendu. Les deux modèles conviennent également pour des stations de travail d'ingénierie, de design et de production média à distance.

Le L40S et le L20 utilisent un refroidissement passif, il leur faut donc un châssis serveur avec un flux d'air dirigé. Ces cartes ne sont pas conçues pour un ordinateur de bureau standard sans un refroidissement spécialement organisé.

Consommation d'énergie et mise à l'échelle

La puissance maximale du L40S atteint 350 W, alors que le L20 consomme environ 300 W. Dans un serveur multi-cartes, la différence influence les blocs d'alimentation, le refroidissement et la densité du matériel.

Cela dit, le L40S consomme plus, mais offre des performances nettement plus élevées par accélérateur installé.

Les deux modèles fonctionnent via PCIe et ne prennent pas en charge l'agrégation de mémoire via NVLink. Dans les systèmes avec plusieurs GPU, le résultat dépend donc de la topologie PCIe, de la plateforme processeur et de l'optimisation logicielle.

Que choisir

Il faut choisir le NVIDIA L40S si l'accélérateur sera constamment utilisé pour l'IA générative, l'inférence fortement chargée, l'entraînement de modèles, le rendu ou plusieurs postes de travail virtuels. Il est nettement plus rapide et fournit plus de performances par slot serveur.

Le NVIDIA L20 vaut la peine d'être considéré lorsque les 48 Go de mémoire sont importants, mais que la vitesse maximale n'est pas nécessaire. Il convient pour une inférence modérée, la virtualisation graphique, le traitement vidéo et la visualisation professionnelle.

Le L20 ne peut pas être considéré comme un équivalent direct du L40S. Il conserve le même volume de mémoire et la même bande passante, mais il appartient à une classe de performance de calcul inférieure. Pour des charges modérées, cela suffit, tandis que pour des systèmes constamment chargés, le L40S est nettement préférable.

Avantages

  • Plus Unités d'Ombrage: 18176 (18176 vs 11776)
  • Plus récent Date de lancement: November 2023 (October 2022 vs November 2023)

Basique

NVIDIA
Nom de l'étiquette
NVIDIA
October 2022
Date de lancement
November 2023
Desktop
Plate-forme
Desktop
L40S
Nom du modèle
L20
Tesla Ada
Génération
Tesla Ada
1110MHz
Horloge de base
1440MHz
2520MHz
Horloge Boost
2520MHz
PCIe 4.0 x16
Interface de bus
PCIe 4.0 x16
76,300 million
Transistors
76,300 million
142
Cœurs RT
92
568
Cœurs de Tensor
?
Les Tensor Cores sont des unités de traitement spécialisées conçues spécifiquement pour l'apprentissage en profondeur, offrant des performances supérieures en matière d'entraînement et d'inférence par rapport à l'entraînement FP32. Ils permettent des calculs rapides dans des domaines tels que la vision par ordinateur, le traitement du langage naturel, la reconnaissance vocale, la conversion texte-parole et les recommandations personnalisées. Les deux applications les plus remarquables des Tensor Cores sont DLSS (Deep Learning Super Sampling) et AI Denoiser pour la réduction du bruit.
368
568
TMUs
?
Les unités de mappage de texture (TMUs) sont des composants du GPU qui sont capables de faire pivoter, mettre à l'échelle et déformer des images binaires, puis de les placer en tant que textures sur n'importe quel plan d'un modèle 3D donné. Ce processus est appelé mappage de texture.
368
TSMC
Fonderie
TSMC
5 nm
Taille de processus
5 nm
Ada Lovelace
Architecture
Ada Lovelace

Spécifications de la mémoire

48GB
Taille de Mémoire
48GB
GDDR6
Type de Mémoire
GDDR6
384bit
Bus de Mémoire
?
La largeur du bus mémoire fait référence au nombre de bits de données que la mémoire vidéo peut transférer lors d'un seul cycle d'horloge. Plus la largeur du bus est grande, plus la quantité de données qui peut être transmise instantanément est importante, ce qui en fait l'un des paramètres cruciaux de la mémoire vidéo. La bande passante mémoire est calculée comme suit : Bande passante mémoire = Fréquence mémoire x Largeur du bus mémoire / 8. Par conséquent, lorsque les fréquences mémoire sont similaires, la largeur du bus mémoire déterminera la taille de la bande passante mémoire.
384bit
2250MHz
Horloge Mémoire
2250MHz
864.0 GB/s
Bande Passante
?
La bande passante mémoire fait référence au débit de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde, et la formule pour la calculer est : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits. En français: La bande passante mémoire désigne le taux de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde et la formule pour la calculer est la suivante : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits.
864.0 GB/s

Affichage et multimédia

1x HDMI 2.1
3x DisplayPort 1.4a
Sorties
4x DisplayPort 1.4a

Performance théorique

483.8 GPixel/s
Taux de Pixel
?
Le taux de remplissage des pixels désigne le nombre de pixels qu'une unité de traitement graphique (GPU) peut rendre par seconde, mesuré en MPixels/s (million de pixels par seconde) ou en GPixels/s (milliard de pixels par seconde). C'est la mesure la plus couramment utilisée pour évaluer les performances de traitement des pixels d'une carte graphique.
322.6 GPixel/s
1431 GTexel/s
Taux de Texture
?
Le taux de remplissage de texture fait référence au nombre d'éléments de texture (texels) qu'un GPU peut mapper sur des pixels en une seule seconde.
927.4 GTexel/s
91.61 TFLOPS
FP16 (demi)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
59.35 TFLOPS
1431 GFLOPS
FP64 (double précision)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
927.4 GFLOPS
89.778 TFLOPS
FP32 (flottant)
?
Une mesure importante pour mesurer les performances du GPU est la capacité de calcul en virgule flottante. Les nombres à virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de traitement multimédia et graphique, tandis que les nombres à virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui exige une large plage numérique et une grande précision. Les nombres à virgule flottante demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable.
59.35 TFLOPS

Divers

142
Nombre de SM
?
Plusieurs processeurs de flux (SPs), ainsi que d'autres ressources, forment un multiprocesseur de flux (SM), également appelé cœur principal du GPU. Ces ressources supplémentaires comprennent des composants tels que des ordonnanceurs de warp, des registres et de la mémoire partagée. Le SM peut être considéré comme le cœur du GPU, similaire à un cœur de CPU, les registres et la mémoire partagée étant des ressources limitées au sein du SM.
92
18176
Unités d'Ombrage
?
L'unité de traitement la plus fondamentale est le processeur en continu (SP), où des instructions et des tâches spécifiques sont exécutées. Les GPU effectuent des calculs parallèles, ce qui signifie que plusieurs SP fonctionnent simultanément pour traiter les tâches.
11776
128 KB (per SM)
Cache L1
128 KB (per SM)
48MB
Cache L2
96MB
300W
TDP
275W
1.3
Version Vulkan
?
Vulkan est une API graphique et de calcul multiplateforme du groupe Khronos, offrant des performances élevées et une faible surcharge du processeur. Il permet aux développeurs de contrôler directement le GPU, réduit les frais de rendu et prend en charge les processeurs multithread et multicœurs.
1.3
3.0
Version OpenCL
3.0
4.6
OpenGL
4.6
8.9
CUDA
8.9
12 Ultimate (12_2)
DirectX
12 Ultimate (12_2)
1x 16-pin
Connecteurs d'alimentation
1x 16-pin
192
ROPs
?
Le pipeline des opérations de rasterisation (ROPs) est principalement responsable de la gestion des calculs d'éclairage et de réflexion dans les jeux, ainsi que de la gestion d'effets tels que l'anti-aliasing (AA), la haute résolution, la fumée et le feu. Plus les effets d'anti-aliasing et d'éclairage sont exigeants dans un jeu, plus les exigences de performances pour les ROPs sont élevées ; sinon, cela peut entraîner une chute importante du taux de rafraîchissement.
128
6.7
Modèle de shader
6.7
700W
Alimentation suggérée
600W

Benchmarks

FP32 (flottant) / TFLOPS
L40S
89.778 +51%
L20
59.35
OpenCL
L40S
362331 +38%
L20
262467