NVIDIA Tesla P40
vs
NVIDIA Tesla P100 PCIe 16 GB

vs
Comparaison de cartes graphiques NVIDIA Tesla P40 vs NVIDIA Tesla P100 PCIe 16 GB

Résultat de la comparaison des GPU

NVIDIA Tesla P40 vs Tesla P100 PCIe 16 Go : lequel est le meilleur pour l'IA, le rendu et les calculs

Les NVIDIA Tesla P40 et Tesla P100 appartiennent à la génération Pascal, mais elles ont été conçues pour des tâches différentes. La P40 est orientée vers l'inférence, la virtualisation et les calculs en simple précision. La P100 est un accéléérateur HPC spécialisé avec une mémoire HBM2 rapide, une haute performance FP64 et des calculs accélérés en FP16.

Ainsi, un plus grand nombre de cœurs CUDA dans la P40 ne fait pas d'elle une carte plus puissante dans tous les scénarios.

Principales différences

Caractéristique Tesla P40 Tesla P100 PCIe 16 Go
Cœurs CUDA 3840 3584
Mémoire vidéo 24 Go GDDR5 16 Go HBM2
Bande passante 346 Go/s 732 Go/s
FP32 environ 12 TFLOPS environ 9,3 TFLOPS
FP64 fortement limitée environ 4,7 TFLOPS
FP16 sans accélération notable environ 18,7 TFLOPS
INT8 jusqu'à 47 TOPS pas le mode principal
TDP 250 W 250 W

Où la Tesla P40 excelle

La Tesla P40 offre 3840 cœurs CUDA, 24 Go de mémoire et une performance de pointe FP32 plus élevée.

Le principal avantage pratique réside dans la quantité de mémoire vidéo. Les 8 Go supplémentaires permettent de charger des modèles, des scènes et des ensembles de données plus volumineux. Cela est utile lors du rendu, du traitement d'images et lors de l'exécution de réseaux neuronaux qui ne tiennent pas dans 16 Go.

La P40 prend également en charge l'accélération INT8 jusqu'à 47 TOPS. Elle est donc mieux adaptée aux tâches d'inférence, où un modèle déjà entraîné traite un grand nombre de requêtes.

Les points forts de la P40 :

  • 24 Go de mémoire vidéo ;
  • haute vitesse FP32 ;
  • accélération INT8 ;
  • rendu de grandes scènes ;
  • inférence sans Tensor Cores.

Pourquoi la P100 est plus rapide en HPC

La Tesla P100 utilise une mémoire HBM2 avec une bande passante de 732 Go/s, plus de deux fois supérieure à celle de la P40. Cela est particulièrement important dans les tâches où le GPU transfère constamment de grandes quantités de données entre la mémoire et les unités de calcul.

Une haute bande passante est utile en algèbre linéaire, en modélisation, en calculs d'ingénierie et dans des applications scientifiques. Dans des algorithmes limités par la vitesse de la mémoire, la P100 peut se révéler plus rapide, malgré une performance de pointe FP32 inférieure.

Le principal avantage de la P100 est sa vitesse en double précision à part entière. Elle délivre environ 4,7 TFLOPS en FP64, tandis que ce mode est fortement limité dans la P40. Dans des programmes scientifiques et d'ingénierie, la différence peut être mesurée non pas en pourcentages, mais en plusieurs fois.

La P100 est clairement préférable pour :

  • les simulations physiques et climatiques ;
  • la chimie computationnelle ;
  • l'analyse technique ;
  • la modélisation financière ;
  • les calculs scientifiques en FP64 ;
  • les algorithmes sensibles à la vitesse de la mémoire.

Que choisir pour les réseaux neuronaux

Les deux cartes ont été lancées avant les Tensor Cores et sont donc nettement inférieures aux accélérateurs modernes dans des charges de travail IA actuelles.

La P100 est mieux adaptée à l'entraînement de modèles grâce à sa HBM2 rapide et à sa haute vitesse FP16. La P40 est plus logique à utiliser pour l'inférence, surtout lorsque 24 Go de mémoire ou INT8 sont importants.

Cependant, le résultat dépend fortement du logiciel. Les frameworks modernes sont de plus en plus souvent optimisés pour les Tensor Cores, BF16 et des architectures plus récentes, donc le potentiel de Pascal ne se révèle pas dans toutes les tâches.

Rendu et CUDA

Dans le rendu et les calculs CUDA standard, la P40 apparaît souvent plus attrayante. Elle est plus performante là où la performance est déterminée par le nombre d'opérations FP32 et l'espace mémoire disponible.

La P100 peut prendre l'avantage si l'application est limitée par la vitesse d'échange de données. Ainsi, le résultat dépend de la charge spécifique : la P40 est plus forte dans les tâches computationnellement intensives en FP32, la P100 l'est dans les algorithmes nécessitant une gestion intensive de la mémoire.

Les deux cartes utilisent un refroidissement passif et nécessitent un flux d'air dirigé puissant. Dans un boîtier standard sans ventilation séparée, elles surchauffent rapidement. Il n'y a pas non plus de sorties vidéo, ce qui rend ces accélérateurs peu pratiques pour un PC de jeu.

Cela vaut-il la peine de les acheter aujourd'hui ?

Les deux modèles sont obsolètes et ne prennent pas en charge les Tensor Cores. Ils doivent être considérés principalement sur le marché de l'occasion et uniquement pour des tâches spécifiques.

La Tesla P40 est intéressante pour ses 24 Go de mémoire vidéo, son inférence économique et son rendu. La Tesla P100 conserve de la valeur là où les FP64, FP16 et la haute bande passante HBM2 sont nécessaires.

Lors de l'achat, il est également important de prendre en compte l'état de la carte, la compatibilité avec les pilotes, les exigences en matière d'alimentation et la nécessité d'un refroidissement séparé.

Conclusion

La Tesla P40 est mieux adaptée pour l'inférence, le rendu et les tâches nécessitant 24 Go de mémoire vidéo. Ses avantages sont la haute vitesse FP32, le support INT8 et un plus grand volume de mémoire.

La Tesla P100 PCIe 16 Go est nettement plus forte en HPC, FP64, FP16 et charges dépendantes de la bande passante mémoire. La HBM2 et des blocs de double précision complets en font un accélérateur spécialisé pour les calculs scientifiques et d'ingénierie.

La P40 est un choix en faveur du volume de mémoire et des performances FP32/INT8. La P100 est un outil pour les tâches où la précision des calculs et la vitesse d'échange de données sont plus importantes.

Avantages

  • Plus haut Horloge Boost: 1531MHz (1531MHz vs 1329MHz)
  • Plus grand Taille de Mémoire: 24GB (24GB vs 16GB)
  • Plus Unités d'Ombrage: 3840 (3840 vs 3584)
  • Plus récent Date de lancement: September 2016 (September 2016 vs June 2016)
  • Plus haut Bande Passante: 732.2 GB/s (694.3 GB/s vs 732.2 GB/s)

Basique

NVIDIA
Nom de l'étiquette
NVIDIA
September 2016
Date de lancement
June 2016
Professional
Plate-forme
Professional
Tesla P40
Nom du modèle
Tesla P100 PCIe 16 GB
Tesla Pascal
Génération
Tesla
1303MHz
Horloge de base
1190MHz
1531MHz
Horloge Boost
1329MHz
PCIe 3.0 x16
Interface de bus
PCIe 3.0 x16
11,800 million
Transistors
15,300 million
240
TMUs
?
Les unités de mappage de texture (TMUs) sont des composants du GPU qui sont capables de faire pivoter, mettre à l'échelle et déformer des images binaires, puis de les placer en tant que textures sur n'importe quel plan d'un modèle 3D donné. Ce processus est appelé mappage de texture.
224
TSMC
Fonderie
TSMC
16 nm
Taille de processus
16 nm
Pascal
Architecture
Pascal

Spécifications de la mémoire

24GB
Taille de Mémoire
16GB
GDDR5X
Type de Mémoire
HBM2
384bit
Bus de Mémoire
?
La largeur du bus mémoire fait référence au nombre de bits de données que la mémoire vidéo peut transférer lors d'un seul cycle d'horloge. Plus la largeur du bus est grande, plus la quantité de données qui peut être transmise instantanément est importante, ce qui en fait l'un des paramètres cruciaux de la mémoire vidéo. La bande passante mémoire est calculée comme suit : Bande passante mémoire = Fréquence mémoire x Largeur du bus mémoire / 8. Par conséquent, lorsque les fréquences mémoire sont similaires, la largeur du bus mémoire déterminera la taille de la bande passante mémoire.
4096bit
1808MHz
Horloge Mémoire
715MHz
694.3 GB/s
Bande Passante
?
La bande passante mémoire fait référence au débit de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde, et la formule pour la calculer est : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits. En français: La bande passante mémoire désigne le taux de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde et la formule pour la calculer est la suivante : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits.
732.2 GB/s

Affichage et multimédia

No outputs
Sorties
No outputs

Performance théorique

147.0 GPixel/s
Taux de Pixel
?
Le taux de remplissage des pixels désigne le nombre de pixels qu'une unité de traitement graphique (GPU) peut rendre par seconde, mesuré en MPixels/s (million de pixels par seconde) ou en GPixels/s (milliard de pixels par seconde). C'est la mesure la plus couramment utilisée pour évaluer les performances de traitement des pixels d'une carte graphique.
127.6 GPixel/s
367.4 GTexel/s
Taux de Texture
?
Le taux de remplissage de texture fait référence au nombre d'éléments de texture (texels) qu'un GPU peut mapper sur des pixels en une seule seconde.
297.7 GTexel/s
183.7 GFLOPS
FP16 (demi)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
19.05 TFLOPS
367.4 GFLOPS
FP64 (double précision)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
4.763 TFLOPS
11.995 TFLOPS
FP32 (flottant)
?
Une mesure importante pour mesurer les performances du GPU est la capacité de calcul en virgule flottante. Les nombres à virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de traitement multimédia et graphique, tandis que les nombres à virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui exige une large plage numérique et une grande précision. Les nombres à virgule flottante demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable.
9.335 TFLOPS

Divers

30
Nombre de SM
?
Plusieurs processeurs de flux (SPs), ainsi que d'autres ressources, forment un multiprocesseur de flux (SM), également appelé cœur principal du GPU. Ces ressources supplémentaires comprennent des composants tels que des ordonnanceurs de warp, des registres et de la mémoire partagée. Le SM peut être considéré comme le cœur du GPU, similaire à un cœur de CPU, les registres et la mémoire partagée étant des ressources limitées au sein du SM.
56
3840
Unités d'Ombrage
?
L'unité de traitement la plus fondamentale est le processeur en continu (SP), où des instructions et des tâches spécifiques sont exécutées. Les GPU effectuent des calculs parallèles, ce qui signifie que plusieurs SP fonctionnent simultanément pour traiter les tâches.
3584
48 KB (per SM)
Cache L1
24 KB (per SM)
3MB
Cache L2
4MB
250W
TDP
250W
1.3
Version Vulkan
?
Vulkan est une API graphique et de calcul multiplateforme du groupe Khronos, offrant des performances élevées et une faible surcharge du processeur. Il permet aux développeurs de contrôler directement le GPU, réduit les frais de rendu et prend en charge les processeurs multithread et multicœurs.
1.3
3.0
Version OpenCL
3.0
4.6
OpenGL
4.6
6.1
CUDA
6.0
12 (12_1)
DirectX
12 (12_1)
8-pin EPS
Connecteurs d'alimentation
1x 8-pin
96
ROPs
?
Le pipeline des opérations de rasterisation (ROPs) est principalement responsable de la gestion des calculs d'éclairage et de réflexion dans les jeux, ainsi que de la gestion d'effets tels que l'anti-aliasing (AA), la haute résolution, la fumée et le feu. Plus les effets d'anti-aliasing et d'éclairage sont exigeants dans un jeu, plus les exigences de performances pour les ROPs sont élevées ; sinon, cela peut entraîner une chute importante du taux de rafraîchissement.
96
6.7
Modèle de shader
6.4
600W
Alimentation suggérée
600W

Benchmarks

FP32 (flottant) / TFLOPS
Tesla P40
11.995 +28%
Tesla P100 PCIe 16 GB
9.335
Blender
Tesla P40
802
Tesla P100 PCIe 16 GB
1200 +50%
OctaneBench
Tesla P40
163
Tesla P100 PCIe 16 GB
217 +33%