NVIDIA Tesla K80
vs
NVIDIA Tesla P40

vs
Comparaison de cartes graphiques NVIDIA Tesla K80 vs NVIDIA Tesla P40

Résultat de la comparaison des GPU

NVIDIA Tesla K80 vs Tesla P40 : 24 Go identiques, mais des capacités différentes

NVIDIA Tesla K80 et Tesla P40 peuvent facilement être confondues pour des accélérateurs proches : les deux cartes sont équipées de 24 Go de mémoire GDDR5, utilisent un système de refroidissement passif et sont conçues pour une installation en serveur. Mais le K80 est un modèle à double processeur de l'époque Kepler, principalement conçu pour des calculs scientifiques, tandis que le P40, plus récent, est orienté vers le FP32 et l'inférence des réseaux neuronaux. Dans la plupart des tâches modernes, le P40 est plus rapide et plus pratique, mais le K80 conserve un avantage important : la performance FP64.

La principale différence réside dans la mémoire

Le Tesla K80 combine deux processeurs graphiques GK210. Chaque GPU possède ses propres 12 Go de mémoire et fonctionne comme un dispositif CUDA distinct. Les 24 Go mentionnés dans les caractéristiques ne peuvent pas être utilisés comme un seul tampon vidéo : une tâche est généralement limitée à 12 Go, à moins que le programme ne sache répartir les données entre plusieurs GPU.

Même avec le support de deux accélérateurs, une partie des données peut être dupliquée en mémoire sur les deux puces. Par conséquent, la configuration K80 ne convient pas à toutes les charges de travail.

Le Tesla P40 est plus simple : un processeur GP102 a accès à l'ensemble des 24 Go. C'est plus important que la différence formelle dans le nombre de cœurs CUDA. Un grand modèle ou un ensemble de données peut tenir entièrement dans la mémoire d'un seul GPU sans nécessiter de division manuelle de la tâche.

Différence clé Tesla K80 Tesla P40
Architecture Kepler Pascal
Configuration 2 × GK210 1 × GP102
Mémoire 2 × 12 Go GDDR5 24 Go GDDR5
Cœurs CUDA 4992 au total 3840
FP32 jusqu'à 8,73 Tflops jusqu'à 12 Tflops
FP64 jusqu'à 2,91 Tflops environ 0,37 Tflops
INT8 Sans mode spécialisé jusqu'à 47 TOPS
Bande passante mémoire 480 Go/s au total 346 Go/s
Consommation électrique 300 W 250 W

Les chiffres globaux du K80 doivent également être interprétés avec prudence. Ses 4992 cœurs CUDA, 480 Go/s de bande passante et ses pics de téraflops sont partagés entre deux GPU. Si l'application n'utilise qu'un seul GK210, les ressources effectives sont réduites d'environ moitié.

FP32 et réseaux neuronaux : victoire assurée du P40

Dans les calculs à virgule flottante simple, le Tesla P40 atteint 12 Tflops, tandis que les 8,73 Tflops max du K80 sont la somme de deux processeurs et dépendent du mode GPU Boost.

En pratique, l'avantage du P40 est souvent encore plus marqué. Le programme n'a pas besoin de synchroniser deux GPU, d'échanger des données entre eux et de gérer des tableaux de mémoire séparés. Si l'application ne s'adapte pas bien à plusieurs accélérateurs, une partie des ressources du K80 restera inutilisée.

Pour l'inférence, le P40 a un autre sérieux argument : le mode INT8 avec une performance allant jusqu'à 47 TOPS. NVIDIA a positionné cette carte comme un accélérateur d'inférence pour serveurs, conçu pour fonctionner avec TensorRT. Le K80 est arrivé avant la transition massive des réseaux neuronaux vers des calculs à précision réduite et ne propose pas de mode INT8 comparable.

Le P40 n'a pas de cœurs tensoriels, donc en termes de rapidité avec des modèles modernes, il est nettement dépassé par les accélérateurs des générations Volta, Turing et plus récentes. Cependant, parmi cette paire, le P40 est mieux adapté pour l'inférence locale et d'autres tâches d'apprentissage automatique.

FP64 : principal avantage du K80

Le Tesla K80 a été conçu pour des calculs scientifiques hautes performances, donc l'architecture GK210 a des blocs développés pour la double précision. Lorsqu'il charge les deux processeurs, la carte fournit jusqu'à 2,91 Tflops FP64 - presque autant que les systèmes serveur modernes s'attendaient à obtenir d'un accélérateur HPC spécialisé.

Le GP102 de la P40 a été conçu avec d'autres priorités. Sa force réside dans le FP32 et les opérations entières, tandis que la performance FP64 ne représente qu'environ un trentième de celle du FP32, soit environ 0,37 Tflops. Architectoniquement, le GP102 est plus proche du GP104 que du GP100 orienté calcul avec des blocs de double précision renforcés.

Par conséquent, le K80 peut encore être plus intéressant pour des tâches où le FP64 est vraiment nécessaire :

  • modélisation numérique ;
  • dynamique moléculaire ;
  • dynamique des fluides computationnelle ;
  • applications CUDA d'ingénierie et scientifiques ;
  • anciens projets optimisés pour plusieurs GPU Kepler.

Mais cet avantage ne fonctionne que dans les programmes capables de charger les deux processeurs. Un seul GK210 ne dispose que de 12 Go de mémoire et d'environ la moitié de la puissance de calcul totale du K80.

Pilotes et compatibilité logicielle

La pile logicielle est devenue l'une des principales limitations du K80. NVIDIA a verrouillé la branche R470 comme la dernière à supporter les accélérateurs de serveurs Kepler. Les nouvelles versions de pilotes et de CUDA ne sont plus adaptées à cette architecture, donc le K80 doit souvent utiliser des systèmes d'exploitation, bibliothèques ou conteneurs obsolètes.

La situation pour le P40 est meilleure. En 2026, il est encore présent dans la liste des GPU supportés par les pilotes NVIDIA Data Center modernes, incluant les branches R580 et R582. Cela ne rend pas Pascal une nouvelle architecture, mais cela simplifie considérablement l'installation d'un pilote à jour et le lancement d'un environnement CUDA relativement récent.

En ce qui concerne la virtualisation, la situation est plus stricte : le support du Tesla P40 dans NVIDIA vGPU est arrivé à sa phase finale, et la fin du support de maintenance est prévue pour juillet 2026. Par conséquent, acheter un P40 spécifiquement pour un nouveau serveur commercial vGPU n'est plus rationnel, même si les pilotes de calcul standard continuent de le supporter.

Installation dans une station de travail

Les deux cartes sont équipées de radiateurs passifs et nécessitent un puissant flux d'air dirigé à l'intérieur du serveur. Dans un boîtier classique, un ventilateur ou un conduit d'air séparé sera nécessaire : la ventilation naturelle est insuffisante pour des accélérateurs avec une consommation électrique de 250-300 W.

Les K80 et P40 n'ont pas de sorties vidéo, il faudra donc connecter l'écran à la carte graphique intégrée ou à une carte graphique distincte. Il est également nécessaire de vérifier le type de connecteur et le câblage de l'alimentation : les Tesla serveur ne peuvent pas être connectées sans vérification avec un câble standard d'une carte graphique de jeu.

Le P40 est ici plus pratique non seulement en raison de la performance, mais aussi grâce à une consommation électrique inférieure - 250 W contre 300 W pour le K80.

Conclusion : Tesla K80 ou Tesla P40

La Tesla P40 est le choix préféré pour la plupart des tâches. Elle propose un seul ensemble de 24 Go de mémoire, une vitesse FP32 plus élevée, un support INT8, une consommation d'énergie réduite et une compatibilité logicielle beaucoup plus moderne. Le P40 est mieux adapté pour l'inférence, le rendu CUDA et les applications nécessitant plus de 12 Go de mémoire sur un seul GPU.

La Tesla K80 n’a de sens que dans une niche étroite du FP64. Elle peut surpasser le P40 dans des calculs scientifiques à double précision, mais nécessite un logiciel prenant en charge deux GPU, une ancienne branche de pilotes et un refroidissement plus complexe.

Acheter un K80 pour ses formels 24 Go ou son grand nombre de cœurs CUDA n'en vaut pas la peine. Si la tâche n'est pas basée sur le FP64 et n'est pas optimisée pour deux processeurs Kepler, le Tesla P40 sera plus rapide, plus simple et plus pratique.

Avantages

  • Plus haut Horloge Boost: 1531MHz (824MHz vs 1531MHz)
  • Plus grand Taille de Mémoire: 24GB (12GB vs 24GB)
  • Plus haut Bande Passante: 694.3 GB/s (240.6 GB/s vs 694.3 GB/s)
  • Plus Unités d'Ombrage: 3840 (2496 vs 3840)
  • Plus récent Date de lancement: September 2016 (November 2014 vs September 2016)

Basique

NVIDIA
Nom de l'étiquette
NVIDIA
November 2014
Date de lancement
September 2016
Professional
Plate-forme
Professional
Tesla K80
Nom du modèle
Tesla P40
Tesla
Génération
Tesla Pascal
562MHz
Horloge de base
1303MHz
824MHz
Horloge Boost
1531MHz
PCIe 3.0 x16
Interface de bus
PCIe 3.0 x16
7,100 million
Transistors
11,800 million
208
TMUs
?
Les unités de mappage de texture (TMUs) sont des composants du GPU qui sont capables de faire pivoter, mettre à l'échelle et déformer des images binaires, puis de les placer en tant que textures sur n'importe quel plan d'un modèle 3D donné. Ce processus est appelé mappage de texture.
240
TSMC
Fonderie
TSMC
28 nm
Taille de processus
16 nm
Kepler 2.0
Architecture
Pascal

Spécifications de la mémoire

12GB
Taille de Mémoire
24GB
GDDR5
Type de Mémoire
GDDR5X
384bit
Bus de Mémoire
?
La largeur du bus mémoire fait référence au nombre de bits de données que la mémoire vidéo peut transférer lors d'un seul cycle d'horloge. Plus la largeur du bus est grande, plus la quantité de données qui peut être transmise instantanément est importante, ce qui en fait l'un des paramètres cruciaux de la mémoire vidéo. La bande passante mémoire est calculée comme suit : Bande passante mémoire = Fréquence mémoire x Largeur du bus mémoire / 8. Par conséquent, lorsque les fréquences mémoire sont similaires, la largeur du bus mémoire déterminera la taille de la bande passante mémoire.
384bit
1253MHz
Horloge Mémoire
1808MHz
240.6 GB/s
Bande Passante
?
La bande passante mémoire fait référence au débit de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde, et la formule pour la calculer est : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits. En français: La bande passante mémoire désigne le taux de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde et la formule pour la calculer est la suivante : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits.
694.3 GB/s

Affichage et multimédia

No outputs
Sorties
No outputs

Performance théorique

42.85 GPixel/s
Taux de Pixel
?
Le taux de remplissage des pixels désigne le nombre de pixels qu'une unité de traitement graphique (GPU) peut rendre par seconde, mesuré en MPixels/s (million de pixels par seconde) ou en GPixels/s (milliard de pixels par seconde). C'est la mesure la plus couramment utilisée pour évaluer les performances de traitement des pixels d'une carte graphique.
147.0 GPixel/s
171.4 GTexel/s
Taux de Texture
?
Le taux de remplissage de texture fait référence au nombre d'éléments de texture (texels) qu'un GPU peut mapper sur des pixels en une seule seconde.
367.4 GTexel/s
-
FP16 (demi)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
183.7 GFLOPS
1371 GFLOPS
FP64 (double précision)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
367.4 GFLOPS
4.195 TFLOPS
FP32 (flottant)
?
Une mesure importante pour mesurer les performances du GPU est la capacité de calcul en virgule flottante. Les nombres à virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de traitement multimédia et graphique, tandis que les nombres à virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui exige une large plage numérique et une grande précision. Les nombres à virgule flottante demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable.
11.995 TFLOPS

Divers

-
Nombre de SM
?
Plusieurs processeurs de flux (SPs), ainsi que d'autres ressources, forment un multiprocesseur de flux (SM), également appelé cœur principal du GPU. Ces ressources supplémentaires comprennent des composants tels que des ordonnanceurs de warp, des registres et de la mémoire partagée. Le SM peut être considéré comme le cœur du GPU, similaire à un cœur de CPU, les registres et la mémoire partagée étant des ressources limitées au sein du SM.
30
2496
Unités d'Ombrage
?
L'unité de traitement la plus fondamentale est le processeur en continu (SP), où des instructions et des tâches spécifiques sont exécutées. Les GPU effectuent des calculs parallèles, ce qui signifie que plusieurs SP fonctionnent simultanément pour traiter les tâches.
3840
16 KB (per SMX)
Cache L1
48 KB (per SM)
1536KB
Cache L2
3MB
300W
TDP
250W
1.1
Version Vulkan
?
Vulkan est une API graphique et de calcul multiplateforme du groupe Khronos, offrant des performances élevées et une faible surcharge du processeur. Il permet aux développeurs de contrôler directement le GPU, réduit les frais de rendu et prend en charge les processeurs multithread et multicœurs.
1.3
3.0
Version OpenCL
3.0
4.6
OpenGL
4.6
3.7
CUDA
6.1
12 (11_1)
DirectX
12 (12_1)
1x 8-pin
Connecteurs d'alimentation
8-pin EPS
48
ROPs
?
Le pipeline des opérations de rasterisation (ROPs) est principalement responsable de la gestion des calculs d'éclairage et de réflexion dans les jeux, ainsi que de la gestion d'effets tels que l'anti-aliasing (AA), la haute résolution, la fumée et le feu. Plus les effets d'anti-aliasing et d'éclairage sont exigeants dans un jeu, plus les exigences de performances pour les ROPs sont élevées ; sinon, cela peut entraîner une chute importante du taux de rafraîchissement.
96
5.1
Modèle de shader
6.7
700W
Alimentation suggérée
600W

Benchmarks

FP32 (flottant) / TFLOPS
Tesla K80
4.195
Tesla P40
11.995 +186%
Blender
Tesla K80
258
Tesla P40
802 +211%
OctaneBench
Tesla K80
61
Tesla P40
163 +167%