NVIDIA Tesla P40
vs
NVIDIA Tesla V100 PCIe 16 GB

vs
Confronto tra schede video NVIDIA Tesla P40 vs NVIDIA Tesla V100 PCIe 16 GB

Risultato del confronto GPU

NVIDIA Tesla P40 contro Tesla V100 PCIe 16 GB: 24 GB di memoria o architettura più potente

NVIDIA Tesla P40 e Tesla V100 PCIe 16 GB consumano entrambe 250 W, ma sono progettate per carichi di lavoro differenti. La P40 punta su 24 GB di memoria, inferenza, virtualizzazione e elaborazione video. La V100 offre un'architettura Volta più avanzata, Core Tensor, veloce HBM2 e prestazioni complete nel calcolo scientifico.

Pertanto, è privo di senso confrontare questi accelerator con i soli nuclei CUDA o FP32. Si sceglie la P40 quando il carico di lavoro non rientra nei 16 GB, mentre la V100 è preferita quando la velocità di apprendimento, la larghezza di banda della memoria e i calcoli FP64 sono fondamentali.

Differenze chiave

Caratteristica Tesla P40 Tesla V100 PCIe 16 GB
Architettura Pascal Volta
CUDA core 3840 5120
Tensor core No 640
Memoria video 24 GB GDDR5 16 GB HBM2
Larghezza di banda 346 GB/s fino a 900 GB/s
FP32 fino a 12 TFLOPS fino a 14 TFLOPS
Principali compiti Inferenza, vGPU, video Apprendimento AI, HPC, CUDA

La differenza in FP32 è ridotta, ma non riflette bene il reale rapporto di potenza. La V100 ha non solo più CUDA core, ma anche i Tensor core, una memoria significativamente più veloce e miglioramenti architettonici Volta.

Pascal contro Volta

La Tesla P40 è costruita sull'architettura Pascal e dotata di 3840 CUDA core. È stata progettata come acceleratore server per inferenza, capace di gestire più modelli o utenti contemporaneamente. Il supporto per INT8 e 24 GB di memoria l'hanno resa apprezzata in sistemi di machine learning, workstation virtuali e media server.

La Tesla V100 utilizza l'architettura Volta, 5120 CUDA core e 640 Tensor core. Questi ultimi accelerano i calcoli matriciali su cui si basa l'apprendimento delle reti neurali. Nei carichi di lavoro a precisione mista, la V100 ottiene un vantaggio che non si può vedere solo guardando la prestazione FP32.

I 47 TOPS dichiarati per la P40 e le prestazioni tensor della V100 non sono direttamente comparabili: appartengono a formati di dati diversi. La P40 lavora bene con l'inferenza ottimizzata in INT8, mentre la V100 è significativamente più versatile e meglio attrezzata per l'addestramento dei modelli.

Memoria: volume contro velocità

Il principale vantaggio della P40 è rappresentato dai 24 GB di GDDR5. Gli 8 GB aggiuntivi possono rivelarsi più importanti di una GPU più potente, se il modello, la scena o il set di dati non rientrano nella memoria della V100.

Questo è particolarmente evidente durante l'esecuzione locale di modelli linguistici. Anche un acceleratore più veloce perde vantaggio se parte dei pesi deve essere caricata in memoria o distribuita tra più dispositivi.

La V100 è limitata a 16 GB, ma la sua HBM2 offre una larghezza di banda fino a 900 GB/s - circa 2,6 volte di più rispetto alla P40. Per l'addestramento delle reti neurali, l'elaborazione di grandi matrici e i calcoli scientifici, la velocità della memoria è spesso più importante del suo volume.

La scelta qui è estremamente semplice:

  • La P40 gestisce carichi più grandi;
  • La V100 elabora i dati più velocemente entro i 16 GB;
  • In caso di insufficienza di memoria, il vantaggio della V100 si riduce rapidamente.

Addestramento e inferenza delle reti neurali

Per l'addestramento dei modelli, la V100 è preferibile quasi sempre, fintanto che ci sono sufficienti 16 GB. I Tensor core, l'HBM2 e il supporto per la precisione mista accelerano notevolmente i carichi di lavoro computazionali moderni.

La P40 è più logica da utilizzare per il deployment di modelli già addestrati. È adatta per l'inferenza INT8, l'elaborazione in batch delle richieste e scenari in cui il costo di un gigabyte di memoria è importante.

Nei sistemi IA locali, la scelta dipende dalle dimensioni del modello. Un modello compatto di solito funziona più velocemente sulla V100. Tuttavia, se non rientra nei 16 GB, la P40 da 24 GB può rivelarsi più pratica, nonostante l'architettura obsoleta e l'assenza di Tensor core.

Calcoli scientifici e CUDA

Nei calcoli in doppia precisione, la P40 non compete con la V100. L'acceleratore Pascal è stato progettato per l'inferenza e la virtualizzazione grafica, non per compiti intensivi in FP64.

La V100, al contrario, è stata creata per l'HPC. È adatta per la modellazione ingegneristica, la chimica computazionale, la fisica, l'analisi dei dati e altri carichi in cui è richiesta un'elevata prestazione in doppia precisione.

Nei normali applicativi CUDA, la V100 risulta spesso più veloce grazie alla GPU più potente e all'alta larghezza di banda della memoria. L'eccezione si verifica quando il set di lavoro richiede più di 16 GB.

Rendering

Nel rendering CUDA, la V100 è in genere più veloce della P40, se la scena rientra nella memoria. Tuttavia, entrambe le schede sono prive di RT core, quindi sono inferiori agli acceleratori RTX più recenti nei motori con tracciamento dei raggi hardware.

La P40 può avere la meglio in scene grandi che non rientrano nei 16 GB. Qui, la memoria aggiuntiva è più importante della velocità: la scena deve essere completamente caricata nella GPU, o il renderer è costretto a usare una modalità bypass più lenta.

Prima di acquistare, è consigliabile controllare il supporto per il motore specifico. Le vecchie Tesla non funzionano con tutte le versioni attuali di software e driver.

Video e virtualizzazione

La P40 è stata progettata non solo per calcoli. È adatta per workstation virtuali, luoghi di lavoro remoti, transcodifica e elaborazione server video.

Per la V100, queste attività sono secondarie. Acquistarla per la codifica video o vGPU è generalmente irrazionale: la maggior parte del costo è legata all'architettura computazionale, ai Tensor core e alle capacità HPC.

Installazione in un computer normale

Entrambe le schede utilizzano un raffreddamento passivo e sono progettate per il flusso d'aria server. In un normale case senza flusso d'aria diretto, si surriscaldano rapidamente e riducono le frequenze.

Prima di acquistare, è necessario considerare:

  • assenza di ventole integrate;
  • assenza di uscite video;
  • caratteristiche della connessione di alimentazione;
  • lunghezza e case a doppio slot;
  • compatibilità di driver e software;
  • consumo energetico fino a 250 W.

Un prezzo basso nel mercato secondario non implica una semplice installazione. Per un funzionamento stabile, sarà necessario un alimentatore potente, un condotto d'aria o ventilatori separati e un case ben ventilato.

Cosa controllare prima dell'acquisto

Tesla P40 e V100 sono già in gran parte vendute nel mercato secondario. Le loro condizioni dipendono dalle condizioni operative, dalla temperatura e dalla durata di funzionamento nel server.

Prima dell'acquisto, è consigliabile controllare:

  • riconoscimento della scheda nel sistema;
  • volume e errori di memoria;
  • stabilità sotto carico prolungato;
  • temperature di funzionamento;
  • assenza di throttling;
  • compatibilità della scheda con la versione CUDA necessaria;
  • supporto della scheda da parte del framework o del renderer scelto.

La V100 di solito ha un prezzo considerevolmente più alto rispetto alla P40. Il sovrapprezzo è giustificato per l'addestramento delle reti neurali, FP64 e calcoli intensivi, ma non sempre ha senso per un'inferenza semplice.

Cosa scegliere

Tesla P40 dovrebbe essere considerata se:

  • è necessaria più di 16 GB di memoria video;
  • il compito principale è l'inferenza;
  • si avviano modelli locali grandi;
  • si utilizza la virtualizzazione;
  • sono importanti l'elaborazione e la transcodifica video;
  • è fondamentale il costo per gigabyte di memoria.

Tesla V100 PCIe 16 GB è migliore se:

  • si prevede di addestrare reti neurali;
  • sono necessari i Tensor core;
  • si utilizza la precisione mista;
  • si eseguono calcoli scientifici;
  • è fondamentale la prestazione FP64;
  • il carico di lavoro rientra in 16 GB.

Conclusione

Tesla V100 PCIe 16 GB è un acceleratore computazionale più veloce e versatile. Si adatta notevolmente meglio all'addestramento delle reti neurali, ai calcoli scientifici e ai compiti intensivi in CUDA.

La Tesla P40 ha senso sceglierla per i 24 GB di memoria, per un'inferenza economica, virtualizzazione o elaborazione video. Se il carico è sufficiente per 16 GB, la V100 è quasi sempre preferibile. Tuttavia, se il modello o la scena supera questo volume, i 8 GB aggiuntivi della P40 possono risultare più importanti di tutta la potenza computazionale della Volta.

Vantaggi

  • Più alto Boost Clock: 1531MHz (1531MHz vs 1380MHz)
  • Più grandi Dimensione memoria: 24GB (24GB vs 16GB)
  • Più alto Larghezza di banda: 897.0 GB/s (694.3 GB/s vs 897.0 GB/s)
  • Più Unità di ombreggiatura: 5120 (3840 vs 5120)
  • Più nuovo Data di rilascio: June 2017 (September 2016 vs June 2017)

Di base

NVIDIA
Nome dell'etichetta
NVIDIA
September 2016
Data di rilascio
June 2017
Professional
Piattaforma
Professional
Tesla P40
Nome del modello
Tesla V100 PCIe 16 GB
Tesla Pascal
Generazione
Tesla
1303MHz
Clock base
1245MHz
1531MHz
Boost Clock
1380MHz
PCIe 3.0 x16
Interfaccia bus
PCIe 3.0 x16
11,800 million
Transistor
21,100 million
-
Core Tensor
?
I Tensor Cores sono unità di elaborazione specializzate progettate specificamente per l'apprendimento profondo. Consentono calcoli rapidi in aree come la visione artificiale, l'elaborazione del linguaggio naturale, il riconoscimento vocale, la conversione da testo a voce e le raccomandazioni personalizzate.
640
240
TMUs
?
Le unità di mappatura texture (TMUs) servono come componenti della GPU, in grado di ruotare, scalare, distorcere immagini binarie e poi posizionarle come texture su qualsiasi piano di un dato modello 3D. Questo processo è chiamato mappatura texture.
320
TSMC
Fonderia
TSMC
16 nm
Dimensione del processo
12 nm
Pascal
Architettura
Volta

Specifiche della memoria

24GB
Dimensione memoria
16GB
GDDR5X
Tipo di memoria
HBM2
384bit
Bus memoria
?
La larghezza del bus di memoria si riferisce al numero di bit di dati che la memoria video può trasferire in un singolo ciclo di clock. Maggiore è la larghezza del bus, maggiore è la quantità di dati che può essere trasmessa istantaneamente. La larghezza del bus di memoria è un parametro cruciale della memoria video. La larghezza di banda della memoria si calcola così: Larghezza di banda della memoria = Frequenza della memoria x Larghezza del bus di memoria / 8.
4096bit
1808MHz
Clock memoria
876MHz
694.3 GB/s
Larghezza di banda
?
La larghezza di banda della memoria si riferisce alla velocità di trasferimento dati tra il chip grafico e la memoria video. Si misura in byte al secondo e la formula per calcolarla è: larghezza di banda della memoria = frequenza di lavoro × larghezza del bus di memoria / 8 bit.
897.0 GB/s

Display e multimedia

No outputs
Uscite
No outputs

Prestazioni teoriche

147.0 GPixel/s
Tasso di pixel
?
Il tasso di riempimento dei pixel si riferisce al numero di pixel che una unità di elaborazione grafica (GPU) può renderizzare al secondo, misurato in MPixel/s o GPixel/s. È la metrica più comunemente usata per valutare le prestazioni di elaborazione dei pixel di una scheda grafica.
176.6 GPixel/s
367.4 GTexel/s
Tasso di texture
?
Il tasso di riempimento della texture si riferisce al numero di elementi di mappa texture (texel) che una GPU può mappare su pixel in un secondo.
441.6 GTexel/s
183.7 GFLOPS
FP16 (metà)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri in virgola mobile a metà precisione (16 bit) vengono utilizzati per applicazioni come l'apprendimento automatico, dove è accettabile una precisione inferiore.
28.26 TFLOPS
367.4 GFLOPS
FP64 (doppio)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri in virgola mobile a doppia precisione (64 bit) sono richiesti per il calcolo scientifico che richiede un'ampia gamma numerica e un'alta precisione.
7.066 TFLOPS
11.995 TFLOPS
FP32 (virgola mobile)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri a virgola mobile a precisione singola (32 bit) vengono utilizzati per attività comuni di elaborazione grafica e multimediale, mentre i numeri a virgola mobile a precisione doppia (64 bit) sono necessari per il calcolo scientifico che richiede un'ampia gamma numerica e un'elevata precisione. I numeri a virgola mobile a mezza precisione (16 bit) vengono utilizzati per applicazioni come l'apprendimento automatico, dove è accettabile una precisione inferiore.
14.413 TFLOPS

Varie

30
Conteggio SM
?
Più processori di streaming (SP), insieme ad altre risorse, formano un multiprocessore di streaming (SM), che è anche considerato come il nucleo principale di una GPU. Queste risorse aggiuntive includono componenti come i programmi di schedulazione warp, i registri e la memoria condivisa.
80
3840
Unità di ombreggiatura
?
L'unità di elaborazione più fondamentale è il processore di streaming (SP), dove vengono eseguite istruzioni e compiti specifici. Le GPU eseguono il calcolo parallelo, il che significa che più SP lavorano contemporaneamente per elaborare i compiti.
5120
48 KB (per SM)
Cache L1
128 KB (per SM)
3MB
Cache L2
6MB
250W
TDP
300W
1.3
Versione Vulkan
?
Vulkan è un'API di grafica e calcolo multipiattaforma di Khronos Group, che offre prestazioni elevate e un basso sovraccarico della CPU. Consente agli sviluppatori di controllare direttamente la GPU, riduce il sovraccarico del rendering e supporta processori multi-threading e multi-core.
1.3
3.0
Versione OpenCL
3.0
4.6
OpenGL
4.6
6.1
CUDA
7.0
12 (12_1)
DirectX
12 (12_1)
8-pin EPS
Connettori di alimentazione
2x 8-pin
96
ROPs
?
Il raster operations pipeline (ROPs) si occupa principalmente di gestire i calcoli di illuminazione e riflessione nei giochi, così come gestire effetti come l'anti-aliasing (AA), l'alta risoluzione, il fumo e il fuoco. Più esigenti sono gli effetti di anti-aliasing e illuminazione in un gioco, più alte sono le prestazioni richieste per i ROPs.
128
6.7
Modello Shader
6.6
600W
PSU suggerito
700W

Classifiche

FP32 (virgola mobile) / TFLOPS
Tesla P40
11.995
Tesla V100 PCIe 16 GB
14.413 +20%
OctaneBench
Tesla P40
163
Tesla V100 PCIe 16 GB
345 +112%