NVIDIA Tesla K80
vs
NVIDIA Tesla P40

vs
NVIDIA Tesla K80 vs NVIDIA Tesla P40 그래픽 카드 비교

GPU 비교 결과

NVIDIA Tesla K80 vs Tesla P40: 동일한 24GB, 그러나 다른 가능성

NVIDIA Tesla K80과 Tesla P40은 쉽게 유사한 가속기로 오해할 수 있습니다: 두 카드 모두 24GB의 GDDR5 메모리를 장착하고 있으며 수동 냉각을 사용하고 서버 설치를 염두에 두고 설계되었습니다. 하지만 K80은 주로 과학적 계산을 위해 설계된 Kepler 시대의 듀얼 프로세서 모델인 반면, 더 최신 P40은 FP32 및 신경망 추론에 중점을 두고 있습니다. 현대의 대부분의 작업에서 P40이 더 빠르고 편리하지만, K80은 FP64 성능이라는 중요한 강점을 가지고 있습니다.

주요 차이는 메모리에 있다

Tesla K80은 두 개의 GK210 그래픽 프로세서를 통합하고 있습니다. 각 GPU는 자신만의 12GB 메모리를 가지고 있으며 별도의 CUDA 장치로 작동합니다. 명시된 24GB는 단일 비디오 버퍼로 사용할 수 없으며, 프로그램이 여러 GPU 간에 데이터를 분산하지 않는 한 일반적으로 하나의 작업은 12GB로 제한됩니다.

두 개의 가속기를 지원하더라도 일부 정보는 두 칩의 메모리에 중복될 수 있습니다. 따라서 K80 구성은 모든 계산 작업에 적합하지 않습니다.

Tesla P40은 더 간단하게 구성되어 있습니다: 하나의 GP102 프로세서가 모든 24GB에 접근합니다. 이는 CUDA 코어 수의 공식적 차이보다 더 중요합니다. 더 큰 모델이나 데이터 세트는 수동으로 작업을 분할하지 않고도 하나의 GPU 메모리에 완전히 적재될 수 있습니다.

주요 차이점 Tesla K80 Tesla P40
아키텍처 Kepler Pascal
구성 2 × GK210 1 × GP102
메모리 2 × 12GB GDDR5 24GB GDDR5
CUDA 코어 4992 총합 3840
FP32 최대 8.73 테라플롭스 최대 12 테라플롭스
FP64 최대 2.91 테라플롭스 약 0.37 테라플롭스
INT8 전용 모드 없음 최대 47 TOPS
메모리 대역폭 480GB/s 총합 346GB/s
전력 소모 300W 250W

K80의 총 파라미터도 신중하게 해석할 필요가 있습니다. 4992 CUDA 코어, 480GB/s 대역폭 및 피크 테라플롭스는 두 개의 GPU에 분산되어 있습니다. 애플리케이션이 단일 GK210만 사용하는 경우 실제 자원은 약 절반으로 줄어듭니다.

FP32와 신경망: P40의 확실한 승리

단정도 연산에서 Tesla P40은 12 테라플롭스를 달성하는 반면, K80의 최대 8.73 테라플롭스는 두 프로세서의 합인 반면 GPU Boost 모드에 따라 달라집니다.

실제로 P40의 이점은 더욱 두드러집니다. 프로그램은 두 개의 GPU를 동기화하거나 데이터 교환 및 개별 메모리 배열을 고려할 필요가 없습니다. 애플리케이션이 여러 가속기로 잘 확장되지 않는 경우 K80의 일부 자원은 유휴 상태로 남게 됩니다.

추론을 위해 P40에는 또 다른 큰 장점이 있습니다 - INT8 모드로 최대 47 TOPS의 성능을 제공합니다. NVIDIA는 이 카드를 TensorRT와 함께 작업하기 위해 설계된 서버 추론 가속기로 포지셔닝했습니다. K80은 신경망이 저정밀 계산으로 대규모 전환되기 전에 출시되었으며, 유사한 INT8 모드를 제공하지 않습니다.

P40에는 텐서 코어가 없기 때문에 최신 모델 속도에서 Volta, Turing 및 이후 세대의 가속기들에 비해 상당히 열세입니다. 그럼에도 불구하고 이 쌍의 내부에서는 P40이 로컬 추론 및 기타 머신러닝 작업에 더 적합합니다.

FP64: K80의 주요 장점

Tesla K80은 고성능 과학 계산을 위해 설계되었기 때문에 GK210 아키텍처는 고급 이중 정밀도 블록을 갖추고 있습니다. 두 프로세서를 모두 로드하면 이 카드는 최대 2.91 테라플롭스의 FP64 성능을 제공합니다 - 이는 현대의 HPC 가속기로부터 기대하던 기대값에 가깝습니다.

P40에 포함된 GP102는 다른 우선 순위로 설계되었습니다. 그 강점은 FP32 및 정수 작업이며, FP64 성능은 FP32의 약 1/32에 불과해 대략 0.37 테라플롭스에 해당합니다. 아키텍처적으로 GP102는 고성능 FP64 블록이 강화된 GP100이 아니라 GP104에 가깝습니다.

따라서 K80은 FP64가 실제로 필요한 작업에서는 여전히 더 매력적일 수 있습니다:

  • 수치 모델링
  • 분자 역학
  • 계산 유체 역학
  • 엔지니어링 및 과학적 CUDA 애플리케이션
  • 여러 Kepler GPU에 최적화된 오래된 프로젝트

하지만 이 장점은 두 프로세서를 모두 로드할 수 있는 프로그램에서만 작동합니다. 단일 GK210은 12GB 메모리와 K80의 총 계산 능력의 약 절반만 제공합니다.

드라이버 및 소프트웨어 호환성

소프트웨어 스택은 K80의 주요 제한 사항 중 하나가 되었습니다. NVIDIA는 Kepler 서버 가속기를 지원하는 마지막 버전으로 R470 분기를 설정했습니다. 최신 드라이버 및 CUDA 버전은 더 이상 이 아키텍처를 지원하지 않으므로 K80은 종종 구식 운영 체제, 라이브러리 또는 컨테이너를 사용해야 합니다.

P40의 상황은 더 좋습니다. 2026년까지도 최신 NVIDIA 데이터 센터 드라이버의 지원 GPU 목록에 여전히 존재하여 R580 및 R582 분기를 포함하고 있습니다. 이는 Pascal이 새로운 아키텍처라는 것을 의미하지는 않지만, 최신 드라이버 설치 및 비교적 최신 CUDA 환경 실행을 상당히 간소화합니다.

가상화의 경우 상황은 더욱 엄격합니다: NVIDIA vGPU의 일환으로 Tesla P40의 유지 관리가 마무리 단계에 접어들었고, 유지 관리 지원 종료가 2026년 7월로 예정되어 있습니다. 따라서 P40을 새 상업적 vGPU 서버를 위해 구매하는 것은 비효율적이며, 일반 계산 드라이버가 여전히 지원하더라도 마찬가지입니다.

워크스테이션 설치

두 카드 모두 수동 방열판을 장착하고 있으며 서버 내부에서 강력한 공기 흐름을 필요로 합니다. 일반적인 케이스에서는 별도의 팬이나 공기 덕트가 필요합니다: 250-300W의 전력 소모를 가진 가속기를 위한 자연 환기는 부족합니다.

K80과 P40 모두 비디오 출력이 없으므로 모니터는 통합 그래픽 또는 별도의 그래픽 카드에 연결해야 합니다. 또한 커넥터 유형과 전원 핀 배치를 확인해야 합니다: 서버용 Tesla는 일반적인 게임 그래픽 카드의 케이블 없이 연결할 수 없습니다.

P40은 성능뿐만 아니라 전력 소모가 적어 250W에 비해 K80의 300W로 더 실용적입니다.

결론: Tesla K80 또는 Tesla P40

Tesla P40은 대부분의 작업에 더 바람직한 선택입니다. 단일 24GB의 메모리, 더 높은 FP32 속도, INT8 지원, 낮은 전력 소모 및 훨씬 더 현대적인 소프트웨어 호환성을 제공합니다. P40은 추론, CUDA 렌더링 및 하나의 GPU에서 12GB 이상의 메모리를 요구하는 애플리케이션에 더 적합합니다.

Tesla K80은 FP64의 매우 좁은 틈새에서만 의미가 있습니다. 이 카드는 고정밀 과학적 계산에서 P40보다 크게 앞설 수 있지만, 두 개의 GPU를 지원하는 소프트웨어, 구형 드라이버 분기 및 더 복잡한 냉각이 필요합니다.

형식적인 24GB 또는 많은 CUDA 코어를 위해 K80을 구매해서는 안 됩니다. 해당 작업이 FP64에 기반하고 두 개의 Kepler 프로세서에 최적화되어 있지 않다면, Tesla P40이 더 빠르고 간단하며 실용적일 것입니다.

장점

  • 더 높은 부스트 클럭: 1531MHz (824MHz vs 1531MHz)
  • 더 큰 메모리 크기: 24GB (12GB vs 24GB)
  • 더 높은 대역폭: 694.3 GB/s (240.6 GB/s vs 694.3 GB/s)
  • 더 새딩 유닛: 3840 (2496 vs 3840)
  • 최신 출시일: September 2016 (November 2014 vs September 2016)

기초적인

NVIDIA
라벨 이름
NVIDIA
November 2014
출시일
September 2016
Professional
플랫폼
Professional
Tesla K80
모델명
Tesla P40
Tesla
세대
Tesla Pascal
562MHz
기본 클럭
1303MHz
824MHz
부스트 클럭
1531MHz
PCIe 3.0 x16
버스 인터페이스
PCIe 3.0 x16
7,100 million
트랜지스터
11,800 million
208
텍스처 매핑 유닛
?
텍스처 매핑 유닛(TMU)은 GPU의 구성 요소로서, 이진 이미지를 회전, 스케일링 및 왜곡하여 주어진 3D 모델의 임의의 평면에 텍스처로 배치할 수 있는 기능을 제공합니다. 이 과정을 텍스처 매핑이라고 합니다.
240
TSMC
파운드리
TSMC
28 nm
제조 공정 크기
16 nm
Kepler 2.0
아키텍처
Pascal

메모리 사양

12GB
메모리 크기
24GB
GDDR5
메모리 타입
GDDR5X
384bit
메모리 버스
?
메모리 버스 너비는 비디오 메모리가 한 클럭 주기 내에 전송할 수 있는 데이터의 비트 수를 의미합니다. 버스 너비가 크면 한 번에 전송되는 데이터 양이 많아지므로, 비디오 메모리의 중요한 매개 변수 중 하나입니다. 메모리 대역폭은 다음과 같이 계산됩니다: 메모리 대역폭 = 메모리 주파수 x 메모리 버스 너비 / 8. 따라서 메모리 주파수가 비슷한 경우, 메모리 버스 너비가 메모리 대역폭의 크기를 결정합니다.
384bit
1253MHz
메모리 클럭
1808MHz
240.6 GB/s
대역폭
?
메모리 대역폭은 그래픽 칩과 비디오 메모리 간의 데이터 전송 속도를 의미합니다. 이는 초당 바이트로 측정되며, 계산하는 공식은 다음과 같습니다: 메모리 대역폭 = 작동 주파수 × 메모리 버스 너비 / 8 비트입니다.
694.3 GB/s

디스플레이 및 미디어

No outputs
출력 포트
No outputs

이론적 성능

42.85 GPixel/s
픽셀 속도
?
픽셀 필률은 그래픽 처리 장치(GPU)가 초당 렌더링할 수 있는 픽셀 수를 나타내는 지표로, MPixels/s(백만 픽셀/초) 또는 GPixels/s(십억 픽셀/초) 단위로 측정됩니다. 그래픽 카드의 픽셀 처리 성능을 평가하는 가장 일반적으로 사용되는 측정 항목입니다.
147.0 GPixel/s
171.4 GTexel/s
텍스처 속도
?
"Texture fill rate"은 GPU가 1초에 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 나타냅니다. "텍스처 채움 속도"는 GPU가 1초에 단일 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 의미합니다.
367.4 GTexel/s
-
FP16 (반 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
183.7 GFLOPS
1371 GFLOPS
FP64 (배 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
367.4 GFLOPS
4.195 TFLOPS
FP32 (float)
?
GPU 성능을 측정하는 중요한 지표는 부동 소수점 컴퓨팅 기능입니다. 단정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되는 반면, 배정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학 컴퓨팅에 필요합니다. 반정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다.
11.995 TFLOPS

여러 가지 잡다한

-
스트림 프로세서 개수
?
다중 스트리밍 프로세서(SP)는 다른 자원과 함께 스트리밍 다중프로세서(SM)를 형성하며, 이는 GPU의 주요 코어로도 알려져 있습니다. 이러한 추가 자원에는 워프 스케줄러, 레지스터 및 공유 메모리와 같은 구성 요소가 포함됩니다. SM은 GPU의 핵심이라고 할 수 있으며, CPU 코어와 유사하게 레지스터와 공유 메모리는 SM 내에서는 희소한 자원으로 간주됩니다.
30
2496
새딩 유닛
?
가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 즉 여러 개의 SP가 동시에 작업을 처리하는 것을 의미합니다. "가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 다수의 SP가 동시에 작업을 처리합니다."
3840
16 KB (per SMX)
L1 캐시
48 KB (per SM)
1536KB
L2 캐시
3MB
300W
TDP
250W
1.1
Vulkan 버전
?
Vulkan은 Khronos Group의 크로스 플랫폼 그래픽 및 컴퓨팅 API로, 높은 성능과 낮은 CPU 오버헤드를 제공합니다. 이를 통해 개발자는 GPU를 직접 제어하고, 렌더링 오버헤드를 줄이고, 멀티스레딩 및 멀티코어 프로세서를 지원할 수 있습니다.
1.3
3.0
OpenCL 버전
3.0
4.6
OpenGL
4.6
3.7
CUDA
6.1
12 (11_1)
DirectX
12 (12_1)
1x 8-pin
전원 연결자
8-pin EPS
48
렌더 출력 파이프라인
?
래스터 작업 파이프라인(ROPs)은 게임에서 조명 및 반사 계산을 처리하고 안티 앨리어싱(AA), 고해상도, 연기, 불 등과 같은 효과를 관리하는 것이 주된 역할입니다. 게임에서 안티 앨리어싱과 조명 효과가 더욱 요구되는 경우 ROPs의 성능 요구 사항이 더 높아질 수 있으며, 그렇지 않은 경우 프레임 속도가 급격히 감소할 수 있습니다.
96
5.1
쉐이더 모델
6.7
700W
권장 전원 공급 장치
600W

벤치마크

FP32 (float) / TFLOPS
Tesla K80
4.195
Tesla P40
11.995 +186%
Blender
Tesla K80
258
Tesla P40
802 +211%
OctaneBench
Tesla K80
61
Tesla P40
163 +167%