NVIDIA GeForce RTX 5090

NVIDIA GeForce RTX 5090
NVIDIA GeForce RTX 5090 그래픽 카드 리뷰

NVIDIA GeForce RTX 5090: 32GB GDDR7, 575W 가격

GeForce RTX 5090은 합리적인 구매로 보이려는 시도 없이 설계된 그래픽 카드입니다. 이 카드의 목표는 최대 설정에서의 4K 게임 플레이, 고사양 레이 트레이싱, 로컬 AI 및 전문 렌더링입니다. 하지만 대규모 성능 업데이트에 비해 일반적인 게임 FPS의 증가는 비교적 미미했습니다. CUDA 코어 수는 약 1/3 증가했으며, 메모리의 대역폭은 거의 78% 증가했고, TGP는 575W까지 상승했으며, RTX 4090 대비 프레임 생성 없이 평균 약 25-30%의 성능 우위를 보입니다.

따라서 일반 렌더링 및 DLSS 결과는 분리하여 고려할 필요가 있습니다. 멀티 프레임 생성은 블랙웰과 DLSS의 가능성을 보여주지만, GPU 자체 성능의 두 배 증가를 의미하진 않습니다.

GeForce RTX 5090의 사양

RTX 5090은 블랙웰 GB202 아키텍처를 기반으로 하고 있습니다. 이 카드에는 21,760개의 CUDA 코어, 32GB GDDR7 메모리, 512비트 메모리 버스가 장착되어 있습니다. 대역폭은 1792GB/s로, 거의 1.8TB/s에 도달합니다. 또한 5세대 텐서 코어와 4세대 RT 코어가 사용됩니다.

사양 GeForce RTX 5090 GeForce RTX 4090
아키텍처 블랙웰 아다 러브레이스
CUDA 코어 21,760 16,384
비디오 메모리 32GB GDDR7 24GB GDDR6X
메모리 버스 512비트 384비트
대역폭 1792GB/s 약 1008GB/s
부스트 클락 2.41GHz 2.52GHz
PCI Express PCIe 5.0 PCIe 4.0
TGP 575W 450W
시작 가격 $1999 $1599

RTX 4090이 더 높은 부스트 클락을 자랑하기 때문에 기가헤르츠 수치로만 세대를 비교하는 것은 의미가 없습니다. RTX 5090은 약 1/3 더 많은 CUDA 코어, 8GB 더 많은 메모리 및 거의 78% 더 높은 대역폭을 제공합니다.

특정 GeForce RTX 5090 벤치마크

그래픽 카드 3DMark Time Spy Extreme Graphics Founders Edition 대비
NVIDIA GeForce RTX 5090 Founders Edition ~25,431 -
MSI GeForce RTX 5090 SUPRIM SOC ~26,345 +3.6%
ASUS ROG Astral GeForce RTX 5090 OC ~26,504 +4.2%
GIGABYTE AORUS GeForce RTX 5090 MASTER ~26,741 +5.2%

가장 높은 오버클럭된 모델조차 Founders Edition보다 몇 퍼센트 높은 성능을 보일 뿐입니다. 레이 트레이싱 테스트에서도 차이는 여전히 작습니다.

ROG Astral, SUPRIM, AORUS MASTER, Founders Edition 간의 선택은 쿨링 성능, 소음 수준, 사이즈 및 전력 제한에 따라 결정되어야 하며, 더 높은 FPS를 기대해서는 안 됩니다. 거대한 쿨링 시스템은 GB202를 몇십 퍼센트 더 빠르게 만들지는 않습니다.

RTX 5090 대 RTX 4090 게임 성능

4K 해상도에서는 RTX 5090이 일반적으로 RTX 4090보다 약 25-30% 더 뛰어난 성능을 보여줍니다. 특정 고사양 프로젝트에서는 차이가 30%를 넘기도 하며, 1440p 해상도에서는 주로 CPU 성능에 의해 제한됩니다.

Black Myth: Wukong에서 4K 해상도로 약 62 FPS를 기록하며, RTX 4090은 약 47 FPS로 약 +32%의 성능 향상을 보입니다.

일반적인 렌더링에서 RTX 4090의 성능이 두 배로 증가하는 경우는 없습니다.

RTX 5090은 주로 4K에 필요한 카드입니다. 1080p 및 1440p에서는 FPS 증가가 CPU에 의해 제한됩니다. 해상도가 높고 레이 트레이싱이나 패스 트레이싱이 더 무거워질수록 새로운 GPU의 계산 능력이 더 잘 발휘됩니다.

DLSS 및 멀티 프레임 생성

블랙웰은 멀티 프레임 생성 기능을 지원합니다. 완전히 렌더링된 프레임 사이에 여러 개의 추가 프레임을 생성할 수 있습니다. 이 기술을 통해 FPS 카운터는 배로 증가할 수 있습니다.

하지만 이러한 결과를 일반 FPS와 동일선상에 두어서는 안 됩니다.

멀티 프레임 생성은 시각적 부드러움을 높이지만, 기본 60 FPS를 200 FPS로 변화시키면서 조작 응답성을 보장하지는 않습니다. 따라서 MFG 결과는 GPU의 성능 증가 지표로 사용할 수 없습니다.

RTX 5090의 최대 성능 구간은 4K에서 레이 트레이싱, 패스 트레이싱 및 신경망 렌더링이 무거울 때 나타납니다.

32GB는 게임보다는 작업에 필요

게임에서는 추가 8GB가 최종 FPS를 변경하는 경우가 드뭅니다. 로컬 AI와 무거운 3D 씬에서는 24GB와 32GB 간의 차이가 작업이 비디오 메모리에 들어갈 수 있는지를 결정할 수 있습니다.

Blender에서 RTX 5090은 RTX 4090보다 약 35-40% 더 빠르며, 일부 AI 작업에서 성능 향상이 일반 라스터화보다 눈에 띄게 높습니다.

블랙웰 아키텍처는 FP4를 지원하며, RTX 5090의 AI 성능은 3352 TOPS에 달합니다. 32GB VRAM과 결합해 전체 모델과 워크로드를 GPU에서 실행할 수 있는 범위를 확장합니다.

RTX 5090은 또한 9세대 NVENC를 3개, 6세대 NVDEC를 2개 장착했습니다. 3개의 하드웨어 인코더는 편집, 스트리밍 및 여러 비디오 스트림의 병렬 인코딩 시 특히 유용합니다.

575W - 주요 타협점

RTX 4090은 이미 경제적이라고 할 수 없었지만, RTX 5090은 TGP를 450W에서 575W로 증가시켰습니다.

TGP는 약 28% 증가했으며, 이는 4K에서의 평균 게임 성능 증가 비율과 거의 같아 보입니다. 와트당 성능 측면에서 이러한 변화는 CUDA 코어 수 및 메모리 대역폭 증가보다 훨씬 겸손해 보입니다.

RTX 5090을 가진 시스템에는 약 1000W의 전원 공급 장치가 권장되지만, 실제 필요는 CPU와 기타 구성 요소에 따라 달라집니다.

또한 Founders Edition은 재설계된 PCB와 Double Flow Through 쿨링 시스템 덕분에 여전히 약 304mm의 길이를 가진 듀얼 슬롯 카드입니다. 대부분의 파트너사 RTX 5090은 상당히 큰 편입니다.

거대한 3슬롯 및 4슬롯 모델에 비해 Founders Edition은 상당한 장점입니다.

초기 RTX 5090은 ROP 수를 확인해야 함

초기 RTX 5090 중에는 사양에 비해 ROP 수가 적은 경우가 있었습니다.

정상적인 RTX 5090은 176 ROP를 가져야 합니다. NVIDIA에 따르면, 이 문제는 RTX 5090, RTX 5090D 및 RTX 5070 Ti의 0.5% 미만에 영향을 미쳤으며, 그래픽 성능을 약 4% 감소시킬 수 있었습니다.

새로운 배치에서는 이 문제가 수정되었지만, 초기 또는 중고 RTX 5090을 구매할 때는 GPU-Z를 확인하는 것이 여전히 좋습니다: 이 프로그램은 176 ROPs를 보여야 합니다.

결론

RTX 5090은 RTX 4090이 부족한 작업에서 그 가치를 증명합니다: 경량의 4K와 패스 트레이싱, 로컬 AI 및 24GB VRAM을 초과하는 3D 씬 작업입니다.

일반 게임에서는 차이가 훨씬 미미합니다. TGP가 450W에서 575W로 증가하고 시작 가격이 $1599에서 $1999로 상승함에 따라, 프레임 생성 없이 RTX 4090 대비 평균 약 25-30%의 성능 우위를 보입니다.

RTX 5090의 장점은 FPS에만 국한되지 않습니다: 여기에는 32GB GDDR7, 거의 1.8TB/s의 메모리 대역폭, 새로운 RT 및 텐서 블록, FP4, 3개의 NVENC 및 멀티 프레임 생성이 포함됩니다.

RTX 4090의 소유자가 일반 게임 FPS를 위해 카드를 변경하는 것은 힘든 선택입니다. 하지만 무거운 4K, 로컬 AI 또는 24GB VRAM으로 부족한 작업을 위한 새로운 시스템에서는 RTX 5090의 장점이 훨씬 더 분명해집니다.

공식 오버클러킹만을 위해 비싼 RTX 5090 모델에 추가 비용을 지불하는 것은 거의 무의미합니다: Founders Edition과의 차이는 보통 3-5%에 불과합니다. 특정 모델은 쿨링 성능, 소음 수준, 크기 및 가격에 따라 선택해야 합니다.

기초적인

라벨 이름
NVIDIA
플랫폼
Desktop
출시일
January 2025
GPU Lithography
TSMC 4N
모델명
GeForce RTX 5090
세대
GeForce 50
기본 클럭
2010 MHz
부스트 클럭
2407 MHz
버스 인터페이스
PCIe Gen 5
트랜지스터
92.2
레이 트레이싱 코어
170, 4th Gen
텐서 코어
?
Tensor Cores는 딥러닝을 위해 특별히 설계된 특수 처리 유닛으로, FP32 훈련과 비교하여 더 높은 훈련 및 추론 성능을 제공합니다. 이들은 컴퓨터 비전, 자연어 처리, 음성 인식, 텍스트 음성 변환 및 맞춤형 추천과 같은 영역에서 빠른 계산을 가능하게 합니다. Tensor Cores의 가장 주목할 만한 응용 분야는 DLSS (Deep Learning Super Sampling)와 잡음 감소를 위한 AI Denoiser입니다.
680, 5th Gen
텍스처 매핑 유닛
?
텍스처 매핑 유닛(TMU)은 GPU의 구성 요소로서, 이진 이미지를 회전, 스케일링 및 왜곡하여 주어진 3D 모델의 임의의 평면에 텍스처로 배치할 수 있는 기능을 제공합니다. 이 과정을 텍스처 매핑이라고 합니다.
680
파운드리
TSMC
아키텍처
NVIDIA Blackwell / GB202

메모리 사양

메모리 크기
32 GB GDDR7
메모리 타입
GDDR7
메모리 버스
?
메모리 버스 너비는 비디오 메모리가 한 클럭 주기 내에 전송할 수 있는 데이터의 비트 수를 의미합니다. 버스 너비가 크면 한 번에 전송되는 데이터 양이 많아지므로, 비디오 메모리의 중요한 매개 변수 중 하나입니다. 메모리 대역폭은 다음과 같이 계산됩니다: 메모리 대역폭 = 메모리 주파수 x 메모리 버스 너비 / 8. 따라서 메모리 주파수가 비슷한 경우, 메모리 버스 너비가 메모리 대역폭의 크기를 결정합니다.
512-bit
대역폭
?
메모리 대역폭은 그래픽 칩과 비디오 메모리 간의 데이터 전송 속도를 의미합니다. 이는 초당 바이트로 측정되며, 계산하는 공식은 다음과 같습니다: 메모리 대역폭 = 작동 주파수 × 메모리 버스 너비 / 8 비트입니다.
1792 GB/s

디스플레이 및 미디어

출력 포트
1x HDMI 2.1b
3x DisplayPort 2.1b with UHBR20

이론적 성능

픽셀 속도
?
픽셀 필률은 그래픽 처리 장치(GPU)가 초당 렌더링할 수 있는 픽셀 수를 나타내는 지표로, MPixels/s(백만 픽셀/초) 또는 GPixels/s(십억 픽셀/초) 단위로 측정됩니다. 그래픽 카드의 픽셀 처리 성능을 평가하는 가장 일반적으로 사용되는 측정 항목입니다.
423.6 GPixel/s
텍스처 속도
?
"Texture fill rate"은 GPU가 1초에 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 나타냅니다. "텍스처 채움 속도"는 GPU가 1초에 단일 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 의미합니다.
1636.8 GTexel/s
FP16 (반 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
104.8 TFLOPS
FP64 (배 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
1.613 TFLOPS
FP32 (float)
?
GPU 성능을 측정하는 중요한 지표는 부동 소수점 컴퓨팅 기능입니다. 단정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되는 반면, 배정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학 컴퓨팅에 필요합니다. 반정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다.
104.8 TFLOPS

여러 가지 잡다한

스트림 프로세서 개수
?
다중 스트리밍 프로세서(SP)는 다른 자원과 함께 스트리밍 다중프로세서(SM)를 형성하며, 이는 GPU의 주요 코어로도 알려져 있습니다. 이러한 추가 자원에는 워프 스케줄러, 레지스터 및 공유 메모리와 같은 구성 요소가 포함됩니다. SM은 GPU의 핵심이라고 할 수 있으며, CPU 코어와 유사하게 레지스터와 공유 메모리는 SM 내에서는 희소한 자원으로 간주됩니다.
170
새딩 유닛
?
가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 즉 여러 개의 SP가 동시에 작업을 처리하는 것을 의미합니다. "가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 다수의 SP가 동시에 작업을 처리합니다."
21760
L1 캐시
128 KB (per SM)
L2 캐시
96 MB
TDP
575 W TGP
Vulkan 버전
?
Vulkan은 Khronos Group의 크로스 플랫폼 그래픽 및 컴퓨팅 API로, 높은 성능과 낮은 CPU 오버헤드를 제공합니다. 이를 통해 개발자는 GPU를 직접 제어하고, 렌더링 오버헤드를 줄이고, 멀티스레딩 및 멀티코어 프로세서를 지원할 수 있습니다.
1.4
OpenCL 버전
3.0
OpenGL
4.6
CUDA
CUDA Compute Capability 12.0
DirectX
12 Ultimate (12_2)
전원 연결자
1x 16-pin (12V-2x6)
렌더 출력 파이프라인
?
래스터 작업 파이프라인(ROPs)은 게임에서 조명 및 반사 계산을 처리하고 안티 앨리어싱(AA), 고해상도, 연기, 불 등과 같은 효과를 관리하는 것이 주된 역할입니다. 게임에서 안티 앨리어싱과 조명 효과가 더욱 요구되는 경우 ROPs의 성능 요구 사항이 더 높아질 수 있으며, 그렇지 않은 경우 프레임 속도가 급격히 감소할 수 있습니다.
176
쉐이더 모델
6.7
권장 전원 공급 장치
1000 W

벤치마크

FP32 (float)
점수
104.8 TFLOPS
3DMark Steel Nomad
점수
14544
Blender
점수
15026.3
Vulkan
점수
366095
OpenCL
점수
368974

다른 GPU와 비교

FP32 (float) / TFLOPS
163.4 +55.9%
105.525 +0.7%
79.478 -24.2%
65.572 -37.4%
3DMark Steel Nomad
14475 -0.5%
9237 -36.5%
8858 -39.1%
Blender
3548 -76.4%
1265.43 -91.6%
630 -95.8%
Vulkan
382809 +4.6%
100987 -72.4%
76392 -79.1%
49804 -86.4%
OpenCL
388405 +5.3%
126692 -65.7%
90580 -75.5%
66428 -82%