NVIDIA Tesla P40
vs
NVIDIA Tesla V100 PCIe 16 GB

vs
NVIDIA Tesla P40 vs NVIDIA Tesla V100 PCIe 16 GB 그래픽 카드 비교

GPU 비교 결과

NVIDIA Tesla P40와 Tesla V100 PCIe 16 GB: 24 GB의 메모리 또는 더 강력한 아키텍처

NVIDIA Tesla P40과 Tesla V100 PCIe 16 GB는 동일하게 250W의 전력을 소비하지만, 서로 다른 작업 부하를 위해 설계되었습니다. P40은 24GB의 메모리, 추론, 가상화 및 비디오 처리에 중점을 두고 있습니다. V100은 더욱 진보된 Volta 아키텍처, Tensor 코어, 빠른 HBM2 및 과학 계산에서의 완전한 성능을 제공합니다.

따라서 이 가속기를 CUDA 코어 수나 FP32만으로 비교하는 것은 의미가 없습니다. P40은 작업 부하가 16GB에 맞지 않을 때 선택되고, V100은 학습 속도, 메모리 대역폭 및 FP64 계산이 중요한 경우 선택됩니다.

주요 차이점

특징 Tesla P40 Tesla V100 PCIe 16 GB
아키텍처 Pascal Volta
CUDA 코어 3840 5120
Tensor 코어 없음 640
비디오 메모리 24GB GDDR5 16GB HBM2
대역폭 346 GB/s 최대 900 GB/s
FP32 최대 12 TFLOPS 최대 14 TFLOPS
주요 작업 추론, vGPU, 비디오 AI 학습, HPC, CUDA

FP32의 차이는 크지 않지만, 실제 성능 비율을 잘 반영하지 않습니다. V100은 더 많은 CUDA 코어 뿐만 아니라 Tensor 코어, 훨씬 빠른 메모리 및 Volta 아키텍처 개선을 포함하고 있습니다.

Pascal 대 Volta

Tesla P40은 Pascal 아키텍처에 기반하여 3840 CUDA 코어를 장착하고 있습니다. 여러 모델이나 사용자를 동시에 지원할 수 있는 서버용 추론 가속기로 설계되었습니다. INT8 지원과 24GB 메모리는 머신 러닝 시스템, 가상 작업 스테이션 및 미디어 서버에서 요구되는 특성이었습니다.

Tesla V100은 Volta 아키텍처, 5120 CUDA 코어 및 640 Tensor 코어를 사용합니다. Tensor 코어는 신경망 학습 기반의 행렬 계산을 가속화합니다. 혼합 정밀도의 작업에서 V100은 FP32 성능만으로는 볼 수 없는 이점을 얻습니다.

P40의 선언된 47 TOPS와 V100의 텐서 수치는 직접 비교할 수 없습니다. 이는 서로 다른 데이터 형식에 해당합니다. P40은 최적화된 INT8 추론에서 잘 작동하는 반면, V100은 훨씬 더 유니버설하며 모델 학습에 더 적합합니다.

메모리: 용량 대 속도

P40의 주요 장점은 24GB GDDR5입니다. 더 강력한 GPU보다 8GB가 더 중요할 수 있는 상황에서 V100 메모리에 모델, 장면 또는 데이터 배열이 들어가지 않을 수 있습니다.

언어 모델을 로컬에서 실행할 때 특히 눈에 띕니다. 더 빠른 가속기도 일부 가중치를 RAM에 로드하거나 여러 장치에 분산해야 할 경우, 우위를 잃습니다.

V100은 16GB로 제한되어 있지만, HBM2는 최대 900 GB/s의 대역폭을 제공하여 P40보다 약 2.6배 더 빠릅니다. 신경망 학습, 대형 행렬 처리 및 과학 계산에 있어 메모리의 높은 속도는 용량보다 더 중요할 때가 많습니다.

여기서 선택은 간단합니다:

  • P40은 더 큰 작업 부하를 수용할 수 있습니다;
  • V100은 16GB 내에서 데이터를 더 빠르게 처리합니다;
  • 메모리가 부족할 경우 V100의 이점은 빠르게 줄어듭니다.

신경망 학습 및 추론

모델 학습을 위해서는 V100이 거의 항상 더 바람직합니다, 16GB가 충분한 경우에 한해서입니다. Tensor 코어, HBM2 및 혼합 정밀도 지원은 현대의 계산 작업을 상당히 가속화합니다.

P40은 이미 학습된 모델을 배포할 때 더 논리적입니다. INT8 추론, 배치 처리 요청 및 하나의 비디오 메모리 기가바이트의 비용이 중요한 시나리오에 적합합니다.

로컬 AI 시스템에서는 모델 크기에 따라 선택이 달라집니다. 컴팩트 모델은 일반적으로 V100에서 더 빠르게 작동합니다. 그러나 16GB에 맞지 않는 경우 24GB의 P40이 더 실용적일 수 있습니다, 비록 더 오래된 아키텍처와 Tensor 코어가 없더라도.

과학 계산 및 CUDA

배정밀도 계산에서는 P40이 V100과 경쟁하지 않습니다. Pascal 가속기는 추론과 그래픽 가상화를 위해 설계되었으며, 무거운 FP64 작업에는 적합하지 않습니다.

반면 V100은 HPC를 위해 개발되었습니다. 그것은 공학 모델링, 계산 화학, 물리학, 데이터 분석 및 높은 배정밀도 성능이 필요한 다른 부하에 적합합니다.

일반적인 CUDA 응용 프로그램에서도 V100은 더 강력한 GPU와 높은 메모리 대역폭 덕분에 더 빠르게 나타나는 경우가 많습니다. 예외는 작업 세트가 16GB를 초과할 때 발생합니다.

렌더링

CUDA 렌더링에서는 V100이 일반적으로 P40보다 빠릅니다, 장면이 메모리에 맞춰질 수 있는 경우에 한정해서입니다. 그러나 두 카드 모두 RT 코어가 없기 때문에 하드웨어 레이 트레이싱이 지원되는 엔진에서는 더 최신 RTX 가속기에게 밀립니다.

P40은 16GB가 부족할 때 큰 장면에서 이길 수 있습니다. 이 경우 추가 메모리가 속도보다 더 중요합니다: 장면이 GPU에 전체적으로 로드되거나, 렌더러가 더 느린 우회 모드를 사용해야 할 것입니다.

구매 전에 특정 엔진의 지원 여부를 확인하는 것이 좋습니다. 구형 Tesla는 모든 최신 소프트웨어 및 드라이버 버전과 호환되지 않습니다.

비디오 및 가상화

P40은 단순히 계산을 위해서 만들어지지 않았습니다. 가상 작업 스테이션, 원격 작업, 트랜스코딩 및 서버 측 비디오 처리에 적합합니다.

V100은 이러한 작업에 있어 부차적입니다. 비디오 인코딩이나 vGPU를 위해 구매하는 것은 대개 비합리적입니다: 비용의 대부분은 계산 아키텍처, Tensor 코어 및 HPC 기능에 해당합니다.

일반 컴퓨터에 설치하기

두 카드 모두 수동 냉각을 사용하고 서버 공기 흐름에 맞춰 설계되었습니다. 공기 흐름이 없는 일반 케이스에서는 빠르게 과열되고, 주파수가 저하됩니다.

구매 시 고려해야 할 사항:

  • 내장 팬이 없음;
  • 비디오 출력 없음;
  • 전원 커넥터의 특성;
  • 길이와 두 슬롯 케이스;
  • 드라이버 및 소프트웨어의 호환성;
  • 최대 250W의 전력 소비.

중고 시장의 저렴한 가격이 설치를 간단하게 만들지는 않습니다. 안정적인 작동을 위해서는 강력한 전원 공급 장치, 공기 흐름 또는 개별 팬 및 좋은 환기 시스템이 필요합니다.

구매 시 확인할 사항

Tesla P40과 V100은 오래전부터 주로 중고 시장에서 판매되고 있습니다. 그 상태는 사용 조건, 온도 및 서버에서의 사용 기간에 따라 다릅니다.

구매 전에 확인하는 것이 바람직합니다:

  • 시스템에서의 카드 인식;
  • 메모리 용량 및 오류;
  • 장기 부하 안정성;
  • 작동 온도;
  • 스로틀링 없음;
  • 필요한 CUDA 버전과의 호환성;
  • 선택한 프레임워크 또는 렌더러와의 카드 지원.

V100은 일반적으로 P40보다 가격이 상당히 비쌉니다. 신경망 학습, FP64 및 어려운 계산을 위한 추가 비용은 정당화되지만, 단순 추론을 위한 경우 반드시 의미가 있는 것은 아닙니다.

무엇을 선택해야 할까요?

Tesla P40은 다음의 경우 고려해야 합니다:

  • 16GB 비디오 메모리가 더 필요합니다;
  • 주요 작업이 추론입니다;
  • 대형 로컬 모델을 실행합니다;
  • 가상화가 사용됩니다;
  • 비디오 처리 및 트랜스코딩이 중요합니다;
  • 메모리 한 기가바이트의 비용이 중요합니다.

Tesla V100 PCIe 16 GB는 다음의 경우 더 좋습니다:

  • 신경망 학습을 계획하고 있습니다;
  • Tensor 코어가 필요합니다;
  • 혼합 정밀도를 사용합니다;
  • 과학 계산을 수행합니다;
  • FP64 성능이 중요합니다;
  • 작업 부하가 16GB에 맞춰집니다.

결론

Tesla V100 PCIe 16 GB는 더 빠르고 다재다능한 계산 가속기입니다. 신경망 학습, 과학 계산 및 복잡한 CUDA 작업에 훨씬 더 적합합니다.

Tesla P40은 24GB 메모리, 저렴한 추론, 가상화 또는 비디오 처리를 위해 선택할 가치가 있습니다. 만약 작업에 16GB가 충분하다면 V100이 거의 항상 더 바람직합니다. 그러나 모델이나 장면의 크기가 이 용량을 초과할 경우, 추가적인 8GB P40이 Volta의 전체 계산 성능보다 더 중요할 수 있습니다.

장점

  • 더 높은 부스트 클럭: 1531MHz (1531MHz vs 1380MHz)
  • 더 큰 메모리 크기: 24GB (24GB vs 16GB)
  • 더 높은 대역폭: 897.0 GB/s (694.3 GB/s vs 897.0 GB/s)
  • 더 새딩 유닛: 5120 (3840 vs 5120)
  • 최신 출시일: June 2017 (September 2016 vs June 2017)

기초적인

NVIDIA
라벨 이름
NVIDIA
September 2016
출시일
June 2017
Professional
플랫폼
Professional
Tesla P40
모델명
Tesla V100 PCIe 16 GB
Tesla Pascal
세대
Tesla
1303MHz
기본 클럭
1245MHz
1531MHz
부스트 클럭
1380MHz
PCIe 3.0 x16
버스 인터페이스
PCIe 3.0 x16
11,800 million
트랜지스터
21,100 million
-
텐서 코어
?
Tensor Cores는 딥러닝을 위해 특별히 설계된 특수 처리 유닛으로, FP32 훈련과 비교하여 더 높은 훈련 및 추론 성능을 제공합니다. 이들은 컴퓨터 비전, 자연어 처리, 음성 인식, 텍스트 음성 변환 및 맞춤형 추천과 같은 영역에서 빠른 계산을 가능하게 합니다. Tensor Cores의 가장 주목할 만한 응용 분야는 DLSS (Deep Learning Super Sampling)와 잡음 감소를 위한 AI Denoiser입니다.
640
240
텍스처 매핑 유닛
?
텍스처 매핑 유닛(TMU)은 GPU의 구성 요소로서, 이진 이미지를 회전, 스케일링 및 왜곡하여 주어진 3D 모델의 임의의 평면에 텍스처로 배치할 수 있는 기능을 제공합니다. 이 과정을 텍스처 매핑이라고 합니다.
320
TSMC
파운드리
TSMC
16 nm
제조 공정 크기
12 nm
Pascal
아키텍처
Volta

메모리 사양

24GB
메모리 크기
16GB
GDDR5X
메모리 타입
HBM2
384bit
메모리 버스
?
메모리 버스 너비는 비디오 메모리가 한 클럭 주기 내에 전송할 수 있는 데이터의 비트 수를 의미합니다. 버스 너비가 크면 한 번에 전송되는 데이터 양이 많아지므로, 비디오 메모리의 중요한 매개 변수 중 하나입니다. 메모리 대역폭은 다음과 같이 계산됩니다: 메모리 대역폭 = 메모리 주파수 x 메모리 버스 너비 / 8. 따라서 메모리 주파수가 비슷한 경우, 메모리 버스 너비가 메모리 대역폭의 크기를 결정합니다.
4096bit
1808MHz
메모리 클럭
876MHz
694.3 GB/s
대역폭
?
메모리 대역폭은 그래픽 칩과 비디오 메모리 간의 데이터 전송 속도를 의미합니다. 이는 초당 바이트로 측정되며, 계산하는 공식은 다음과 같습니다: 메모리 대역폭 = 작동 주파수 × 메모리 버스 너비 / 8 비트입니다.
897.0 GB/s

디스플레이 및 미디어

No outputs
출력 포트
No outputs

이론적 성능

147.0 GPixel/s
픽셀 속도
?
픽셀 필률은 그래픽 처리 장치(GPU)가 초당 렌더링할 수 있는 픽셀 수를 나타내는 지표로, MPixels/s(백만 픽셀/초) 또는 GPixels/s(십억 픽셀/초) 단위로 측정됩니다. 그래픽 카드의 픽셀 처리 성능을 평가하는 가장 일반적으로 사용되는 측정 항목입니다.
176.6 GPixel/s
367.4 GTexel/s
텍스처 속도
?
"Texture fill rate"은 GPU가 1초에 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 나타냅니다. "텍스처 채움 속도"는 GPU가 1초에 단일 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 의미합니다.
441.6 GTexel/s
183.7 GFLOPS
FP16 (반 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
28.26 TFLOPS
367.4 GFLOPS
FP64 (배 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
7.066 TFLOPS
11.995 TFLOPS
FP32 (float)
?
GPU 성능을 측정하는 중요한 지표는 부동 소수점 컴퓨팅 기능입니다. 단정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되는 반면, 배정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학 컴퓨팅에 필요합니다. 반정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다.
14.413 TFLOPS

여러 가지 잡다한

30
스트림 프로세서 개수
?
다중 스트리밍 프로세서(SP)는 다른 자원과 함께 스트리밍 다중프로세서(SM)를 형성하며, 이는 GPU의 주요 코어로도 알려져 있습니다. 이러한 추가 자원에는 워프 스케줄러, 레지스터 및 공유 메모리와 같은 구성 요소가 포함됩니다. SM은 GPU의 핵심이라고 할 수 있으며, CPU 코어와 유사하게 레지스터와 공유 메모리는 SM 내에서는 희소한 자원으로 간주됩니다.
80
3840
새딩 유닛
?
가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 즉 여러 개의 SP가 동시에 작업을 처리하는 것을 의미합니다. "가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 다수의 SP가 동시에 작업을 처리합니다."
5120
48 KB (per SM)
L1 캐시
128 KB (per SM)
3MB
L2 캐시
6MB
250W
TDP
300W
1.3
Vulkan 버전
?
Vulkan은 Khronos Group의 크로스 플랫폼 그래픽 및 컴퓨팅 API로, 높은 성능과 낮은 CPU 오버헤드를 제공합니다. 이를 통해 개발자는 GPU를 직접 제어하고, 렌더링 오버헤드를 줄이고, 멀티스레딩 및 멀티코어 프로세서를 지원할 수 있습니다.
1.3
3.0
OpenCL 버전
3.0
4.6
OpenGL
4.6
6.1
CUDA
7.0
12 (12_1)
DirectX
12 (12_1)
8-pin EPS
전원 연결자
2x 8-pin
96
렌더 출력 파이프라인
?
래스터 작업 파이프라인(ROPs)은 게임에서 조명 및 반사 계산을 처리하고 안티 앨리어싱(AA), 고해상도, 연기, 불 등과 같은 효과를 관리하는 것이 주된 역할입니다. 게임에서 안티 앨리어싱과 조명 효과가 더욱 요구되는 경우 ROPs의 성능 요구 사항이 더 높아질 수 있으며, 그렇지 않은 경우 프레임 속도가 급격히 감소할 수 있습니다.
128
6.7
쉐이더 모델
6.6
600W
권장 전원 공급 장치
700W

벤치마크

FP32 (float) / TFLOPS
Tesla P40
11.995
Tesla V100 PCIe 16 GB
14.413 +20%
OctaneBench
Tesla P40
163
Tesla V100 PCIe 16 GB
345 +112%