NVIDIA L40S
vs
NVIDIA L20

vs
NVIDIA L40S vs NVIDIA L20 グラフィックカード比較

GPU比較結果

NVIDIA L40S vs NVIDIA L20: 同じメモリ、異なるパフォーマンス

NVIDIA L40S と L20 は Ada Lovelace アーキテクチャに基づいており、ECC を搭載した 48 GB の GDDR6 メモリを備えています。どちらも 384 ビットのバス、864 GB/s の帯域幅、および PCIe 4.0 x16 インターフェースを持っています。これらの仕様において、両モデルは似たように見えますが、L40S は明らかに高いクラスに属しています。

L40S はより多くの CUDA、Tensor、RT コアを持っているため、生成的 AI、負荷の高い推論、レンダリング、および仮想ワークステーションにより適しています。L20 は大容量のメモリを維持していますが、計算速度は大きく劣ります。

主な違い

特徴 NVIDIA L40S NVIDIA L20
アーキテクチャ Ada Lovelace Ada Lovelace
CUDA コア 18,176 11,776
Tensor コア 568 368
RT コア 142 92
FP32 パフォーマンス 91.6 TFLOPS 約 59.3 TFLOPS
メモリ 48 GB GDDR6 ECC 48 GB GDDR6 ECC
メモリ帯域幅 864 GB/s 864 GB/s
インターフェース PCIe 4.0 x16 PCIe 4.0 x16
最大消費電力 350 W 約 300 W
冷却方式 パッシブ パッシブ

L40S は CUDA コアが約 54% 多いです。同様の傾向が FP32 計算にも見られ、テンソル演算ではその差はさらに大きくなる可能性があります。

48 GB メモリの利点

L20 の主な利点は L40S と同じ量のビデオメモリを持っていることです。これにより、大規模な言語モデル、複雑なシーン、大容量のデータセット、および複数の仮想デスクトップを読み込むことができます。

しかし、メモリの量は主にタスクが加速器に収まるかどうかを決定します。その実行速度は計算ブロックとテンソルパフォーマンスによって決まります。

両方のカードは同じモデルを起動できますが、L40S はリクエストをより迅速に処理し、より多くのユーザーをサポートし、トレーニングやファインチューニングにかかる時間も少なくて済みます。同じメモリ帯域幅は GPU の性能差を補うことはありません。

人工知能

L40S は混合サーバー負荷向けに設計されています:推論、ニューラルネットワークのトレーニング、生成的 AI、ビデオ処理、およびプロフェッショナルなビジュアライゼーションをサポートしています。第4世代の Tensor コア、FP8、およびトランスフォーマーエンジンをサポートします。

L20 はより穏健なシナリオでの使用が理にかなっています:

  • 同時リクエストが少ない推論;
  • 最大 48 GB のメモリを必要とするモデルの実行;
  • 定期的なファインチューニング;
  • 限られた電力消費のサーバー。

常に負荷がかかっているサービスでは、L40S の利点が特に顕著になります:1 つの加速器で、カードの数を増やさずにより多くのリクエストを処理できます。

レンダリングと仮想ワークステーション

L40S は 142 の RT コアを搭載しており、L20 の 92 を上回ります。これにより、レイトレーシング、フォトリアリスティックレンダリング、デジタルツインおよび複雑なシーンに対してより適しています。

追加の CUDA コアはシミュレーション、ジオメトリ処理、およびレンダリングの計算段階を加速します。両モデルはリモートのエンジニアリング、デザイン、およびメディア制作のワークステーションにも適しています。

L40S と L20 はパッシブ冷却を使用しているため、空気の流れが制御されるサーバーケースが必要です。特別な冷却設備がない通常のデスクトップコンピュータには適していません。

電力消費とスケーラビリティ

L40S の最大消費電力は 350 W であり、L20 は約 300 W を消費します。マルチカードサーバーでは、この差が電源、冷却、および機器の配置密度に影響を与えます。

これに対して L40S はより多くの電力を消費しますが、1 台の加速器ごとにより高いパフォーマンスを提供します。

両モデルは PCIe 経由で動作し、NVLink を介してのメモリ結合をサポートしません。複数の GPU を搭載したシステムでは、結果は PCIe のトポロジー、プロセッサプラットフォーム、およびソフトウェア最適化によって異なります。

どちらを選ぶべきか

NVIDIA L40S を選ぶべきです。加速器が生成的 AI、高負荷の推論、モデルのトレーニング、レンダリング、または複数の仮想ワークステーションに常に使用される場合は、非常に高速で、サーバースロットあたりの性能が高まります。

NVIDIA L20 は検討する価値があります。48 GB のメモリが重要ですが、最大速度が必要ない場合です。穏健な推論、グラフィック仮想化、ビデオ処理、およびプロフェッショナルなビジュアライゼーションに適しています。

L20 は L40S の直接のアナロジーとは見なせません。同じメモリ量と帯域幅を維持していますが、計算性能は低いクラスに属しています。穏健な負荷には十分ですが、常に負荷がかかっているシステムでは L40S の方が明らかに好ましいです。

利点

  • もっと シェーディングユニット: 18176 (18176 vs 11776)
  • もっと新しい 発売日: November 2023 (October 2022 vs November 2023)

基本

NVIDIA
レーベル名
NVIDIA
October 2022
発売日
November 2023
Desktop
プラットホーム
Desktop
L40S
モデル名
L20
Tesla Ada
世代
Tesla Ada
1110MHz
ベースクロック
1440MHz
2520MHz
ブーストクロック
2520MHz
PCIe 4.0 x16
バスインターフェース
PCIe 4.0 x16
76,300 million
トランジスタ
76,300 million
142
RTコア
92
568
テンソルコア
?
テンソルコアは深層学習専用に設計された特化型プロセッサで、FP32トレーニングと比較して高いトレーニングと推論性能を提供します。コンピュータビジョン、自然言語処理、音声認識、テキストから音声への変換、個別の推奨などの領域で迅速な計算を可能にします。テンソルコアの最も注目すべき応用は、DLSS(Deep Learning Super Sampling)とAI Denoiserのノイズリダクションです。
368
568
TMU
?
テクスチャマッピングユニット(TMUs)は、二進画像を回転、スケーリング、歪曲して、それを3Dモデルの任意の平面にテクスチャとして配置することができるGPUのコンポーネントです。このプロセスはテクスチャマッピングと呼ばれます。
368
TSMC
ファウンドリ
TSMC
5 nm
プロセスサイズ
5 nm
Ada Lovelace
アーキテクチャ
Ada Lovelace

メモリ仕様

48GB
メモリサイズ
48GB
GDDR6
メモリタイプ
GDDR6
384bit
メモリバス
?
メモリバス幅とは、1クロックサイクル内にビデオメモリが転送できるデータのビット数を指します。バス幅が大きいほど、一度に転送できるデータ量が多くなります。メモリバンド幅の計算式は次の通りです:メモリバンド幅 = メモリ周波数 x メモリバス幅 / 8。
384bit
2250MHz
メモリクロック
2250MHz
864.0 GB/s
帯域幅
?
メモリバンド幅は、グラフィックチップとビデオメモリ間のデータ転送速度を指します。単位はバイト/秒で、計算式は次の通りです:メモリバンド幅 = 動作周波数 × メモリバス幅 / 8ビット。
864.0 GB/s

ディスプレイとメディア

1x HDMI 2.1
3x DisplayPort 1.4a
出力
4x DisplayPort 1.4a

理論上の性能

483.8 GPixel/s
ピクセルレート
?
ピクセル塗りつぶし率は、グラフィックスプロセッシングユニット(GPU)が1秒あたりにレンダリングできるピクセル数を指します。これは、MPixels/s(百万ピクセル/秒)またはGPixels/s(十億ピクセル/秒)で測定されます。これはグラフィックスカードのピクセル処理性能を評価するために最も一般的に使用される指標です。
322.6 GPixel/s
1431 GTexel/s
テクスチャレート
?
テクスチャ塗りつぶし率は、GPUが1秒間にピクセルにマッピングできるテクスチャマップ要素(テクセル)の数を指します。
927.4 GTexel/s
91.61 TFLOPS
FP16 (半精度)
?
GPUパフォーマンスを測定する重要な指標は浮動小数点計算能力です。半精度浮動小数点数(16ビット)は、精度が低くても許容可能な機械学習のようなアプリケーションで使用されます。単精度浮動小数点数(32ビット)は、一般的なマルチメディアやグラフィックス処理のタスクで使用され、倍精度浮動小数点数(64ビット)は、広範で高精度が求められる科学計算に必要です。
59.35 TFLOPS
1431 GFLOPS
FP64 (倍精度)
?
GPUパフォーマンスを測定する重要な指標は浮動小数点計算能力です。倍精度浮動小数点数(64ビット)は、広範で高精度が求められる科学計算に必要です。単精度浮動小数点数(32ビット)は、一般的なマルチメディアやグラフィックス処理のタスクで使用されます。半精度浮動小数点数(16ビット)は、精度が低くても許容可能な機械学習のようなアプリケーションで使用されます。
927.4 GFLOPS
89.778 TFLOPS
FP32 (浮動小数点)
?
GPU のパフォーマンスを測定するための重要な指標は、浮動小数点コンピューティング能力です。 単精度浮動小数点数 (32 ビット) は一般的なマルチメディアおよびグラフィックス処理タスクに使用されますが、倍精度浮動小数点数 (64 ビット) は広い数値範囲と高精度が要求される科学計算に必要です。 半精度浮動小数点数 (16 ビット) は、精度が低くても許容される機械学習などのアプリケーションに使用されます。
59.35 TFLOPS

その他

142
SM数
?
ストリーミングプロセッサ(SP)は他のリソースとともに、ストリーミングマルチプロセッサ(SM)を形成し、これはGPUの主要コアとも呼ばれます。これらの追加リソースには、ワープスケジューラ、レジスタ、共有メモリなどのコンポーネントが含まれます。SMは、レジスタや共有メモリが希少なリソースであるGPUの中心部と考えることができます。
92
18176
シェーディングユニット
?
最も基本的な処理単位はストリーミングプロセッサ(SP)で、特定の指示とタスクが実行されます。GPUは並行計算を行い、複数のSPが同時にタスクを処理します。
11776
128 KB (per SM)
L1キャッシュ
128 KB (per SM)
48MB
L2キャッシュ
96MB
300W
TDP
275W
1.3
Vulkanのバージョン
?
Vulkanは、Khronos Groupによるクロスプラットフォームのグラフィックスおよび計算APIで、高性能と低CPU負荷を提供します。開発者がGPUを直接制御し、レンダリングのオーバーヘッドを減らし、マルチスレッドとマルチコアプロセッサをサポートします。
1.3
3.0
OpenCLのバージョン
3.0
4.6
OpenGL
4.6
8.9
CUDA
8.9
12 Ultimate (12_2)
DirectX
12 Ultimate (12_2)
1x 16-pin
電源コネクタ
1x 16-pin
192
ROP
?
ラスタオペレーションパイプライン(ROPs)は、ゲーム内の照明や反射計算を主に取り扱い、アンチエイリアシング(AA)、高解像度、煙、火などの効果を管理します。ゲームのAAと照明効果が高いほど、ROPsの性能要求が高くなります。
128
6.7
シェーダモデル
6.7
700W
推奨PSU
600W

ベンチマーク

FP32 (浮動小数点) / TFLOPS
L40S
89.778 +51%
L20
59.35
OpenCL
L40S
362331 +38%
L20
262467