NVIDIA L40S
vs
NVIDIA L20

vs
Confronto tra schede video NVIDIA L40S vs NVIDIA L20

Risultato del confronto GPU

NVIDIA L40S vs NVIDIA L20: memoria identica, prestazioni diverse

NVIDIA L40S e L20 sono basate sull'architettura Ada Lovelace e dotate di 48 GB di memoria GDDR6 con ECC. Hanno lo stesso bus a 384 bit, una larghezza di banda di 864 GB/s e un'interfaccia PCIe 4.0 x16. Sulla base di queste caratteristiche, i modelli sembrano simili, ma L40S appartiene a una classe nettamente superiore.

Ha un numero maggiore di core CUDA, Tensor e RT, quindi è più adatta per l'IA generativa, il carico di lavoro di inferenza, il rendering e le workstation virtuali. L20 conserva un grande volume di memoria, ma è sostanzialmente inferiore in termini di velocità di calcolo.

Differenze principali

Caratteristica NVIDIA L40S NVIDIA L20
Architettura Ada Lovelace Ada Lovelace
Core CUDA 18 176 11 776
Core Tensor 568 368
Core RT 142 92
Prestazioni FP32 91,6 TFLOPS circa 59,3 TFLOPS
Memoria 48 GB GDDR6 ECC 48 GB GDDR6 ECC
Larghezza di banda della memoria 864 GB/s 864 GB/s
Interfaccia PCIe 4.0 x16 PCIe 4.0 x16
Potenza massima 350 W circa 300 W
Raffreddamento passivo passivo

L40S contiene circa il 54% in più di core CUDA. Un vantaggio comparabile si osserva nei calcoli FP32, mentre nelle operazioni tensoriali il divario può essere ancora maggiore.

Cosa offre la memoria di 48 GB

Il principale vantaggio di L20 è lo stesso volume di memoria video di L40S. Questo consente il caricamento di grandi modelli linguistici, scene complesse, set di dati voluminosi e più desktop virtuali.

Tuttavia, il volume di memoria determina principalmente se un'attività possa essere eseguita sull'acceleratore. La velocità con cui viene completata dipende dai blocchi di calcolo e dalle prestazioni tensoriali.

Entrambe le schede possono eseguire lo stesso modello, ma L40S elabora le richieste più rapidamente, supporta un numero maggiore di utenti simultanei e richiede meno tempo per l'addestramento o il riaddestramento. La larghezza di banda di memoria identica non compensa la differenza nella potenza della GPU.

Intelligenza artificiale

L40S è progettata per carichi di lavoro server misti: inferenza, addestramento di reti neurali, IA generativa, elaborazione video e visualizzazione professionale. Supporta i core Tensor di quarta generazione, FP8 e Transformer Engine.

L20 è più adeguata per scenari più moderati:

  • inferenza con un numero limitato di richieste simultanee;
  • esecuzione di modelli che richiedono fino a 48 GB di memoria;
  • periodico riaddestramento;
  • server con consumo energetico limitato.

In un servizio costantemente carico, il vantaggio di L40S diventa particolarmente evidente: un acceleratore può gestire più richieste senza aumentare il numero di schede.

Rendering e workstation virtuali

L40S è dotata di 142 core RT contro 92 di L20. Questo la rende preferibile per il ray tracing, il rendering fotorealistico, i gemelli digitali e scene complesse in NVIDIA Omniverse.

Core CUDA aggiuntivi accelerano la simulazione, l'elaborazione della geometria e le fasi di calcolo del rendering. Entrambi i modelli sono adatti anche per workstation ingegneristiche, di design e di produzione multimediale remote.

L40S e L20 utilizzano un raffreddamento passivo, quindi richiedono un chassis server con flusso d'aria diretto. Per un normale computer desktop senza raffreddamento appositamente organizzato, queste schede non sono progettate.

Consumo energetico e scalabilità

La potenza massima di L40S raggiunge i 350 W, mentre L20 consuma circa 300 W. In un server multi-scheda, la differenza influisce sulle alimentazioni, sul raffreddamento e sulla densità di posizionamento dell'hardware.

Tuttavia, L40S consuma di più, ma offre prestazioni significativamente più alte per ogni acceleratore installato.

Entrambi i modelli operano tramite PCIe e non supportano unione di memoria tramite NVLink. Nei sistemi con più GPU, pertanto, il risultato dipende dalla topologia PCIe, dalla piattaforma del processore e dall'ottimizzazione software.

Cosa scegliere

NVIDIA L40S è da preferire se l'acceleratore verrà utilizzato costantemente per IA generativa, inferenza ad alta intensità, addestramento di modelli, rendering o più workstation virtuali. È notevolmente più veloce e fornisce maggiori prestazioni per ogni slot server.

NVIDIA L20 è da considerare quando sono importanti i 48 GB di memoria, ma non è richiesta la massima velocità. È adatta per inferenze moderate, virtualizzazione grafica, elaborazione video e visualizzazione professionale.

L20 non può essere considerata un diretto equivalente di L40S. Mantiene lo stesso volume di memoria e larghezza di banda, ma appartiene a una classe inferiore di prestazioni di calcolo. Per carichi moderati, questo è sufficiente, mentre per sistemi costantemente carichi L40S è nettamente preferibile.

Vantaggi

  • Più Unità di ombreggiatura: 18176 (18176 vs 11776)
  • Più nuovo Data di rilascio: November 2023 (October 2022 vs November 2023)

Di base

NVIDIA
Nome dell'etichetta
NVIDIA
October 2022
Data di rilascio
November 2023
Desktop
Piattaforma
Desktop
L40S
Nome del modello
L20
Tesla Ada
Generazione
Tesla Ada
1110MHz
Clock base
1440MHz
2520MHz
Boost Clock
2520MHz
PCIe 4.0 x16
Interfaccia bus
PCIe 4.0 x16
76,300 million
Transistor
76,300 million
142
Core RT
92
568
Core Tensor
?
I Tensor Cores sono unità di elaborazione specializzate progettate specificamente per l'apprendimento profondo. Consentono calcoli rapidi in aree come la visione artificiale, l'elaborazione del linguaggio naturale, il riconoscimento vocale, la conversione da testo a voce e le raccomandazioni personalizzate.
368
568
TMUs
?
Le unità di mappatura texture (TMUs) servono come componenti della GPU, in grado di ruotare, scalare, distorcere immagini binarie e poi posizionarle come texture su qualsiasi piano di un dato modello 3D. Questo processo è chiamato mappatura texture.
368
TSMC
Fonderia
TSMC
5 nm
Dimensione del processo
5 nm
Ada Lovelace
Architettura
Ada Lovelace

Specifiche della memoria

48GB
Dimensione memoria
48GB
GDDR6
Tipo di memoria
GDDR6
384bit
Bus memoria
?
La larghezza del bus di memoria si riferisce al numero di bit di dati che la memoria video può trasferire in un singolo ciclo di clock. Maggiore è la larghezza del bus, maggiore è la quantità di dati che può essere trasmessa istantaneamente. La larghezza del bus di memoria è un parametro cruciale della memoria video. La larghezza di banda della memoria si calcola così: Larghezza di banda della memoria = Frequenza della memoria x Larghezza del bus di memoria / 8.
384bit
2250MHz
Clock memoria
2250MHz
864.0 GB/s
Larghezza di banda
?
La larghezza di banda della memoria si riferisce alla velocità di trasferimento dati tra il chip grafico e la memoria video. Si misura in byte al secondo e la formula per calcolarla è: larghezza di banda della memoria = frequenza di lavoro × larghezza del bus di memoria / 8 bit.
864.0 GB/s

Display e multimedia

1x HDMI 2.1
3x DisplayPort 1.4a
Uscite
4x DisplayPort 1.4a

Prestazioni teoriche

483.8 GPixel/s
Tasso di pixel
?
Il tasso di riempimento dei pixel si riferisce al numero di pixel che una unità di elaborazione grafica (GPU) può renderizzare al secondo, misurato in MPixel/s o GPixel/s. È la metrica più comunemente usata per valutare le prestazioni di elaborazione dei pixel di una scheda grafica.
322.6 GPixel/s
1431 GTexel/s
Tasso di texture
?
Il tasso di riempimento della texture si riferisce al numero di elementi di mappa texture (texel) che una GPU può mappare su pixel in un secondo.
927.4 GTexel/s
91.61 TFLOPS
FP16 (metà)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri in virgola mobile a metà precisione (16 bit) vengono utilizzati per applicazioni come l'apprendimento automatico, dove è accettabile una precisione inferiore.
59.35 TFLOPS
1431 GFLOPS
FP64 (doppio)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri in virgola mobile a doppia precisione (64 bit) sono richiesti per il calcolo scientifico che richiede un'ampia gamma numerica e un'alta precisione.
927.4 GFLOPS
89.778 TFLOPS
FP32 (virgola mobile)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri a virgola mobile a precisione singola (32 bit) vengono utilizzati per attività comuni di elaborazione grafica e multimediale, mentre i numeri a virgola mobile a precisione doppia (64 bit) sono necessari per il calcolo scientifico che richiede un'ampia gamma numerica e un'elevata precisione. I numeri a virgola mobile a mezza precisione (16 bit) vengono utilizzati per applicazioni come l'apprendimento automatico, dove è accettabile una precisione inferiore.
59.35 TFLOPS

Varie

142
Conteggio SM
?
Più processori di streaming (SP), insieme ad altre risorse, formano un multiprocessore di streaming (SM), che è anche considerato come il nucleo principale di una GPU. Queste risorse aggiuntive includono componenti come i programmi di schedulazione warp, i registri e la memoria condivisa.
92
18176
Unità di ombreggiatura
?
L'unità di elaborazione più fondamentale è il processore di streaming (SP), dove vengono eseguite istruzioni e compiti specifici. Le GPU eseguono il calcolo parallelo, il che significa che più SP lavorano contemporaneamente per elaborare i compiti.
11776
128 KB (per SM)
Cache L1
128 KB (per SM)
48MB
Cache L2
96MB
300W
TDP
275W
1.3
Versione Vulkan
?
Vulkan è un'API di grafica e calcolo multipiattaforma di Khronos Group, che offre prestazioni elevate e un basso sovraccarico della CPU. Consente agli sviluppatori di controllare direttamente la GPU, riduce il sovraccarico del rendering e supporta processori multi-threading e multi-core.
1.3
3.0
Versione OpenCL
3.0
4.6
OpenGL
4.6
8.9
CUDA
8.9
12 Ultimate (12_2)
DirectX
12 Ultimate (12_2)
1x 16-pin
Connettori di alimentazione
1x 16-pin
192
ROPs
?
Il raster operations pipeline (ROPs) si occupa principalmente di gestire i calcoli di illuminazione e riflessione nei giochi, così come gestire effetti come l'anti-aliasing (AA), l'alta risoluzione, il fumo e il fuoco. Più esigenti sono gli effetti di anti-aliasing e illuminazione in un gioco, più alte sono le prestazioni richieste per i ROPs.
128
6.7
Modello Shader
6.7
700W
PSU suggerito
600W

Classifiche

FP32 (virgola mobile) / TFLOPS
L40S
89.778 +51%
L20
59.35
OpenCL
L40S
362331 +38%
L20
262467