NVIDIA GeForce RTX 5090 D V2

NVIDIA GeForce RTX 5090 D V2
NVIDIA GeForce RTX 5090 D V2 그래픽 카드 리뷰

NVIDIA GeForce RTX 5090 D V2: 32GB 대신 24GB, 그러나 게임 성능은 거의 영향받지 않음

GeForce RTX 5090 D V2는 미국의 수출 제한 강화 이후 등장하였으며, 중국 시장에서 원래의 RTX 5090 D를 대체합니다. NVIDIA는 메모리 용량을 32GB에서 24GB로 줄였고, 버스를 512비트에서 384비트로, 대역폭은 1792GB/s에서 1344GB/s로 감소시켰습니다. 그러나 GPU 자체는 거의 손실이 없었기 때문에 대부분의 게임 테스트에서는 그 차이가 크지 않았습니다.

V2에서 변경된 사항

RTX 5090 D V2는 21,760 CUDA 코어, 680 텐서 코어, 170 RT 코어, 약 2.41GHz의 부스트 클럭, 575와트의 전력 제한을 유지합니다. 공언된 AI 성능도 이전과 동일하게 2375 AI TOPS입니다.

주요 변경 사항은 메모리에 집중되었습니다. 32GB 및 512비트 버스 대신 V2는 24GB GDDR7 및 384비트 인터페이스를 탑재하였습니다. 메모리 속도는 28Gbps로 대역폭은 1344GB/s로 줄어들었으며, 이는 정확히 4분의 1 감소한 수치입니다.

대부분의 현대 게임에서 24GB는 여전히 충분합니다. 그러나 V2는 32GB 버전을 대체하며 거의 동일한 GPU와 전력 소비를 유지하고 있습니다.

V2가 게임에서 잃은 것

Time Spy에서 버스 감소는 결과에 거의 영향을 미치지 않았습니다.

GALAX GeForce RTX 5090 D V2 HOF의 3DMark Time Spy Extreme 결과는 25,479점이었고, 원래 RTX 5090 D는 25,690점을 기록했습니다. 보통 Time Spy에서 새 카드의 점수는 49,285점으로 원래 버전의 48,922점과 비슷했습니다.

그래픽 카드 3DMark Time Spy Time Spy Extreme
GALAX RTX 5090 D V2 HOF 49,285 25,479
RTX 5090 D 48,922 25,690

차이는 약 1%입니다. 게임 테스트에서도 유사한 결과가 나왔습니다: Black Myth: Wukong과 Monster Hunter: Wilds에서 두 버전의 성능은 거의 일치했고, Cyberpunk 2077과 Red Dead Redemption 2에서는 차이가 크지 않았습니다.

대역폭은 1344GB/s로 매우 높게 유지되고 있습니다. 4K에서는 더 좁은 버스가 그래픽 카드의 주요 제한 요소로 작용하는 경우는 드뭅니다.

구체적인 RTX 5090 D V2 모델

NVIDIA의 파트너들이 다양한 쿨링 시스템, 클럭 속도, 전력 제한을 가진 V2 모델을 선보였습니다.

모델 특징
INNO3D GeForce RTX 5090 D V2 X3 4K에서의 게임 테스트가 공개된 3팬 모델
Colorful iGame RTX 5090 D V2 Vulcan OC 증발판과 향상된 전력 제한
ASUS ROG Astral RTX 5090 D V2 향상된 공장 부스트 클럭 및 더 높은 전원 요구사항

INNO3D GeForce RTX 5090 D V2 X3는 Cyberpunk 2077에서 4K, RT 오버드라이브, DLSS 품질 및 다중 프레임 생성 4x 설정으로 약 210 FPS를 보여주었습니다. Black Myth: Wukong에서는 4K, 최고 품질, 완전 RT 및 동일한 DLSS 설정으로 약 184 FPS를 기록했습니다.

이 수치들은 프레임 생성을 사용하지 않은 테스트와 직접 비교할 수는 없습니다. 오히려 특정 모델의 DLSS 4 성능을 보여줍니다.

Colorful iGame RTX 5090 D V2 Vulcan OC는 증발판과 다관절 냉각 시스템을 갖추고 있습니다. 전력 제한이 증가하면서 부하 시 소비 전력이 기본 575W를 초과할 수 있습니다.

오버클럭된 모델은 클럭과 전력 요구 사항이 더 높습니다. 일부 ASUS ROG Astral RTX 5090 D V2 모델은 기준 2407MHz보다 상당히 높은 성능을 발휘하며 최대 1200W 전원 공급 장치를 요구합니다.

8GB 손실이 AI에 더 큰 영향을 미침

실제 작업에서는 V2가 원래 RTX 5090 D에 비해 눈에 띄게 열세입니다.

대부분의 현대 게임에서 24GB는 여전히 무거운 설정에서도 충분하지만, 로컬 언어 모델, 이미지 생성, 복잡한 3D 장면에 대해서는 VRAM 용량이 결정적일 수 있습니다.

작업 부하가 24GB에 맞지 않으면 8GB 손실은 몇 퍼센트로 나타나지 않습니다: 모델을 축소하거나 정확도를 낮추거나 일부 데이터를 시스템 메모리로 이전해야 합니다.

따라서 게임 성능에서는 RTX 5090 D와 D V2의 차이가 크지 않지만, 로컬 AI에서는 32GB 버전이 뚜렷한 이점을 가집니다.

왜 전력 소비는 동일하게 유지되었는가

메모리가 줄어들었음에도 불구하고 기본 TBP는 여전히 575W입니다. GPU의 클럭과 연산 블록 수는 변하지 않았습니다.

따라서 시스템 요구사항은 거의 변하지 않았습니다: 강력한 전원 공급 장치, 잘 환기되는 케이스, 큰 그래픽 카드에 충분한 공간이 필요합니다. 대부분의 상용 모델에 대해 제조업체는 1000W 전원 공급 장치를 권장합니다.

오버클럭된 모델은 제한이 더 높아서 선택 시 BIOS, 쿨링 및 실제 전력 소비를 확인해야 하며, 부스트 클럭만 고려해서는 안 됩니다.

RTX 5090 D 대 RTX 5090 D V2

특성 RTX 5090 D RTX 5090 D V2
비디오 메모리 32GB GDDR7 24GB GDDR7
메모리 버스 512 비트 384 비트
대역폭 1792GB/s 1344GB/s
CUDA 코어 21,760 21,760
부스트 클럭 2407MHz 2407MHz
TBP 575W 575W
AI 성능 2375 AI TOPS 2375 AI TOPS

AI와 전문적인 작업을 위해 추가적인 8GB를 가진 원래의 RTX 5090 D는 몇 퍼센트 성능보다 훨씬 더 중요할 수 있습니다.

결론

RTX 5090 D V2는 메모리와 대역폭이 4분의 1 줄어들었지만, GPU의 계산 부분은 거의 변경되지 않았습니다. 따라서 게임 성능에서는 큰 손실이 없지만, 메모리 축소는 AI와 전문적인 작업에 더 큰 영향을 미칩니다.

두 버전의 가격이 동일하다면, 32GB RTX 5090 D가 더 바람직합니다. 만약 V2가 현저히 저렴하고 카드가 주로 4K 게임을 위해 필요하다면, 8GB 손실은 그 자체로 나쁜 선택이 되지 않습니다.

GPU 비교

GeForce RTX 5090 D V2을 다른 GPUs와 비교

드롭다운 목록에서 GPU을 선택해 주세요.

기초적인

라벨 이름
NVIDIA
플랫폼
Desktop
출시일
August 2025
모델명
GeForce RTX 5090 D V2
세대
GeForce 50
기본 클럭
2017 MHz
부스트 클럭
2407 MHz
버스 인터페이스
PCIe 5.0 x16
트랜지스터
92.2 billion
레이 트레이싱 코어
170
텐서 코어
?
Tensor Cores는 딥러닝을 위해 특별히 설계된 특수 처리 유닛으로, FP32 훈련과 비교하여 더 높은 훈련 및 추론 성능을 제공합니다. 이들은 컴퓨터 비전, 자연어 처리, 음성 인식, 텍스트 음성 변환 및 맞춤형 추천과 같은 영역에서 빠른 계산을 가능하게 합니다. Tensor Cores의 가장 주목할 만한 응용 분야는 DLSS (Deep Learning Super Sampling)와 잡음 감소를 위한 AI Denoiser입니다.
680
텍스처 매핑 유닛
?
텍스처 매핑 유닛(TMU)은 GPU의 구성 요소로서, 이진 이미지를 회전, 스케일링 및 왜곡하여 주어진 3D 모델의 임의의 평면에 텍스처로 배치할 수 있는 기능을 제공합니다. 이 과정을 텍스처 매핑이라고 합니다.
680
파운드리
TSMC
제조 공정 크기
4 nm / TSMC 4N
아키텍처
Blackwell

메모리 사양

메모리 크기
24GB
메모리 타입
GDDR7
메모리 버스
?
메모리 버스 너비는 비디오 메모리가 한 클럭 주기 내에 전송할 수 있는 데이터의 비트 수를 의미합니다. 버스 너비가 크면 한 번에 전송되는 데이터 양이 많아지므로, 비디오 메모리의 중요한 매개 변수 중 하나입니다. 메모리 대역폭은 다음과 같이 계산됩니다: 메모리 대역폭 = 메모리 주파수 x 메모리 버스 너비 / 8. 따라서 메모리 주파수가 비슷한 경우, 메모리 버스 너비가 메모리 대역폭의 크기를 결정합니다.
384bit
메모리 클럭
1750 MHz
대역폭
?
메모리 대역폭은 그래픽 칩과 비디오 메모리 간의 데이터 전송 속도를 의미합니다. 이는 초당 바이트로 측정되며, 계산하는 공식은 다음과 같습니다: 메모리 대역폭 = 작동 주파수 × 메모리 버스 너비 / 8 비트입니다.
1.34TB/s

디스플레이 및 미디어

출력 포트
1x HDMI 2.1b
3x DisplayPort 2.1b

이론적 성능

픽셀 속도
?
픽셀 필률은 그래픽 처리 장치(GPU)가 초당 렌더링할 수 있는 픽셀 수를 나타내는 지표로, MPixels/s(백만 픽셀/초) 또는 GPixels/s(십억 픽셀/초) 단위로 측정됩니다. 그래픽 카드의 픽셀 처리 성능을 평가하는 가장 일반적으로 사용되는 측정 항목입니다.
423.6 GPixel/s
텍스처 속도
?
"Texture fill rate"은 GPU가 1초에 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 나타냅니다. "텍스처 채움 속도"는 GPU가 1초에 단일 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 의미합니다.
1636.8 GTexel/s
FP16 (반 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
104.8 TFLOPS
FP64 (배 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
1.637 TFLOPS
FP32 (float)
?
GPU 성능을 측정하는 중요한 지표는 부동 소수점 컴퓨팅 기능입니다. 단정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되는 반면, 배정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학 컴퓨팅에 필요합니다. 반정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다.
104.8 TFLOPS

여러 가지 잡다한

스트림 프로세서 개수
?
다중 스트리밍 프로세서(SP)는 다른 자원과 함께 스트리밍 다중프로세서(SM)를 형성하며, 이는 GPU의 주요 코어로도 알려져 있습니다. 이러한 추가 자원에는 워프 스케줄러, 레지스터 및 공유 메모리와 같은 구성 요소가 포함됩니다. SM은 GPU의 핵심이라고 할 수 있으며, CPU 코어와 유사하게 레지스터와 공유 메모리는 SM 내에서는 희소한 자원으로 간주됩니다.
170
새딩 유닛
?
가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 즉 여러 개의 SP가 동시에 작업을 처리하는 것을 의미합니다. "가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 다수의 SP가 동시에 작업을 처리합니다."
21760
L1 캐시
128 KB (per SM)
L2 캐시
96 MB
TDP
575W
Vulkan 버전
?
Vulkan은 Khronos Group의 크로스 플랫폼 그래픽 및 컴퓨팅 API로, 높은 성능과 낮은 CPU 오버헤드를 제공합니다. 이를 통해 개발자는 GPU를 직접 제어하고, 렌더링 오버헤드를 줄이고, 멀티스레딩 및 멀티코어 프로세서를 지원할 수 있습니다.
1.4
OpenCL 버전
3.0
OpenGL
4.6
CUDA
12.0
DirectX
12 Ultimate (12_2)
전원 연결자
1× 16-pin (12V-2x6)
렌더 출력 파이프라인
?
래스터 작업 파이프라인(ROPs)은 게임에서 조명 및 반사 계산을 처리하고 안티 앨리어싱(AA), 고해상도, 연기, 불 등과 같은 효과를 관리하는 것이 주된 역할입니다. 게임에서 안티 앨리어싱과 조명 효과가 더욱 요구되는 경우 ROPs의 성능 요구 사항이 더 높아질 수 있으며, 그렇지 않은 경우 프레임 속도가 급격히 감소할 수 있습니다.
176
쉐이더 모델
6.8
권장 전원 공급 장치
1000 W

벤치마크

FP32 (float)
점수
104.8 TFLOPS
Vulkan
점수
369488
OpenCL
점수
386315

다른 GPU와 비교

FP32 (float) / TFLOPS
163.4 +55.9%
104.8 +0%
79.478 -24.2%
65.572 -37.4%
Vulkan
382809 +3.6%
100987 -72.7%
76392 -79.3%
49804 -86.5%
OpenCL
388405 +0.5%
126692 -67.2%
90580 -76.6%
66428 -82.8%