AMD Radeon RX 9070 GRE

AMD Radeon RX 9070 GRE
AMD Radeon RX 9070 GRE 그래픽 카드 리뷰

AMD Radeon RX 9070 GRE: 12GB는 게임과 로컬 AI를 제한합니다

AMD Radeon RX 9070 GRE는 RX 9060 XT와 RX 9070 사이의 중간 지점에 위치하지만 단순히 '중간' 모델로 부르기 어렵습니다. 계산 성능 면에서 RX 9070에 가깝고, 전력 소비는 같지만 주요 축소는 메모리에 집중되었습니다: 12GB GDDR6 및 192비트 버스를 지원하며, 16GB와 256비트 버전에 비해 줄어들었습니다.

게임에서는 이러한 타협이 1440p보다 4K에서 더 두드러지게 나타납니다. 로컬 AI에서는 메모리 용량에 따라 속도뿐만 아니라 모델을 전체적으로 로드할 수 있는 가능성이 좌우되기 때문에 제한이 즉시 눈에 띕니다. 따라서 RX 9070 GRE의 매력은 주로 일반 RX 9070에 대한 가격 차별로 결정됩니다.

축소된 RX 9070, 강화된 RX 9060 XT 아님

Radeon RX 9070 GRE는 48개의 계산 유닛, 3072개의 스트림 프로세서, 48개의 레이 트레이싱 가속기 및 96개의 AI 가속기를 갖추고 있습니다. 게임 주파수는 2220MHz이며, Boost 속도는 2790MHz에 도달합니다. FP32의 피크 성능은 34.3 테라플롭스입니다.

비교를 위해 RX 9070은 56개의 계산 유닛과 3584개의 스트림 프로세서를 갖추고 있습니다. FP32의 피크 성능은 36.1 테라플롭스에 이릅니다. 이론적인 성능의 차이는 작아 보이지만, GRE는 비활성화된 유닛을 더 높은 주파수로 일부 보완합니다.

하지만 높은 Boost 속도가 결여된 실행 유닛을 대체하지는 못합니다. 무거운 게임 장면, 레이 트레이싱 및 장기 계산 부하에서는 일반 RX 9070이 이점을 유지합니다.

RX 9070 GRE의 라인업 내 위치

특성 Radeon RX 9060 XT 16GB Radeon RX 9070 GRE Radeon RX 9070
계산 유닛 32 48 56
스트림 프로세서 2048 3072 3584
비디오 메모리 16GB GDDR6 12GB GDDR6 16GB GDDR6
메모리 버스 128비트 192비트 256비트
대역폭 320GB/s 432GB/s 640GB/s
인피니티 캐시 32MB 48MB 64MB
전형적인 전력 소비 160W 220W 220W
주요 시나리오 1080p 및 1440p 1440p 1440p 및 4K

GPU 크기로 볼 때 RX 9070 GRE는 RX 9070과 훨씬 가까운 편입니다. 하지만 메모리 구성은 이상하게 보입니다: 하위 모델인 RX 9060 XT 16GB가 더 많은 양의 VRAM을 갖추고 있는데, 계산 성능면에서는 훨씬 뒤처집니다.

메모리가 주요 타협이 되다

RX 9070 GRE는 12GB GDDR6 메모리를 18Gbps 속도로 장착하고 있습니다. 메모리는 192비트 버스를 통해 연결되며, 432GB/s의 대역폭을 제공합니다. 인피니티 캐시의 용량은 48MB입니다.

RX 9070은 20Gbps 속도의 16GB GDDR6, 256비트 버스 및 64MB 인피니티 캐시를 장착하고 있습니다. 대역폭은 640GB/s에 달하며, GRE에 비해 거의 50% 더 많습니다.

1440p에서는 12GB가 문제의 여지가 있는 카드로 변모하지는 않습니다. 대부분의 게임은 이 용량에 맞춰져 있으며, 높은 계산 성능 덕분에 최대 또는 최대에 가까운 설정으로 사용할 수 있습니다.

하지만 이 클래스의 비디오 카드에는 여유가 많지 않습니다. 무거운 텍스처, 수정 사항, 레이 트레이싱 및 4K로의 전환은 VRAM 소비를 빠르게 증가시킵니다. 메모리가 부족하면 강력한 GPU의 이점이 시스템 메모리에서의 데이터 로딩 및 특정 설정을 낮춰야 하는 필요성으로 인해 부분적으로 사라집니다.

1440p에 적합한 빠른 비디오 카드

RX 9070 GRE의 기본 해상도는 2560 × 1440입니다. AMD에서 발표한 테스트 세트에서 이 카드는 최신 게임에서 높은 혹은 최대 설정으로 82~144 프레임을 보여줍니다. 이 결과는 AMD가 제공한 것이며, 참고용이지 독립적인 테스트의 대체물은 아닙니다.

120-165Hz의 주사율을 가진 모니터에 비해 많은 프로젝트에서 충분한 성능을 발휘합니다. 가장 무거운 레이 트레이싱 모드는 스케일링이나 개별 파라미터의 하향 조정이 필요하지만, 일반 레스터화에서는 RX 9070 GRE가 자신감 있게 작동합니다.

4K에서도 카드는 수용 가능한 프레임 속도를 제공할 수 있으며, 특히 FSR을 사용할 경우 더욱 그렇습니다. 하지만 이때 12GB와 192비트 버스는 RX 9070과의 차이를 더 크게 만들어줍니다. 4K에서 간헐적으로 게임하는 데는 GRE가 적합하지만, 지속적인 4K 카드로는 상위 모델이 더 설득력이 있습니다.

FSR, 레이 트레이싱 및 미디어 엔진

RX 9070 GRE는 FSR 레드스톤, 프레임 생성, Radeon 안티 레그, Radeon 슈퍼 해상도 및 HYPR-RX를 포함한 RDNA 4 세대 기술을 지원합니다. 이 카드는 또한 AV1, H.264 및 H.265를 하드웨어적으로 인코딩 및 디코딩할 수 있습니다.

RDNA 4의 레이 트레이싱 가속기는 이전 세대 Radeon 블록보다 성능이 뛰어나지만, 가장 무거운 RT 모드는 여전히 상당한 부하로 남아 있습니다. FSR은 여기서 단순한 추가 기능이 아니라 높은 프레임 속도를 유지하기 위한 실용적인 방법으로 작동합니다.

전력 소비는 RX 9070에서 유지됨

RX 9070 GRE의 전형적인 전력 소비는 220W로, RX 9070에서 AMD가 제시한 것과 같습니다. 전원 공급을 위해 두 개의 8핀 커넥터가 필요하며, 권장 전원 공급 장치는 650W입니다.

GRE는 비용을 절감하지만 전기는 절약하지 않습니다. 카드에는 정상적인 환기가 있는 케이스와 완전한 냉각 시스템이 필요합니다. 가장 거대한 파트너 버전에 대해 너무 많은 비용을 지불하는 것은 항상 합리적이지 않습니다: 비싼 RX 9070 GRE는 가격에서 더 강력한 RX 9070에 근접할 수 있습니다.

오버클럭 또한 주요 단점을 없애지는 않습니다. 추가 메가헤르츠는 12GB를 16GB로, 192비트 버스를 256비트로 바꿀 수 없습니다.

RX 9070 GRE의 로컬 AI 및 머신 러닝 지원

RX 9070 GRE는 2세대 96개의 AI 가속기를 갖추고 있으며, 저정밀도의 행렬 연산을 지원합니다. 하지만 TOPS 수치는 실제 성능에 대한 정보가 적기 때문에 실제 결과는 특정 모델, 프레임워크, 사용 데이터 유형 및 소프트웨어 최적화의 질에 따라 달라집니다.

RX 9070 GRE가 ROCm 플랫폼에서 공식적으로 지원되는 것이 훨씬 중요합니다. 리눅스에서는 Radeon에 대한 PyTorch, TensorFlow, JAX 및 ONNX Runtime 및 LLM 및 생성 모델을 실행하기 위한 도구가 제공됩니다. RX 9070 GRE는 현재 호환 가능한 하드웨어 매트릭스에 포함되어 있습니다.

실제로 이 카드는 다음과 같은 작업에 사용할 수 있습니다:

  • Stable Diffusion 및 ComfyUI에서 이미지 생성;
  • 양자화된 로컬 언어 모델 실행;
  • PyTorch 및 ONNX 모델의 추론;
  • 컴퓨터 비전 및 이미지 처리;
  • 소규모 모델 학습 및 LoRA 조정;
  • 자체 HIP 애플리케이션에 대한 실험.

추론과 로컬 AI를 익히는 데 필요한 기능이 충분합니다. 그러나 모델이나 작업 흐름이 증가하면 문제가 시작됩니다. 일부 VRAM은 가중치, 컨텍스트, 중간 텐서 및 애플리케이션 자체가 차지합니다. 이미지 생성기에서는 고해상도, 배치 처리, ControlNet 및 기타 확장 기능이 메모리를 추가로 소모합니다.

따라서 12GB는 그저 미래의 여유가 아니라는 점을 염두에 두어야 합니다. RX 9070의 16GB에 들어가는 일부 작업은 GRE에서 더 공격적인 양자화, 축소된 컨텍스트, 낮은 해상도 또는 데이터를 RAM에 일부 로드하여 실행해야 합니다. 마지막 옵션은 더 큰 모델을 실행할 수 있게 해주지만 일반적으로 속도가 감소합니다.

대형 신경망을 완전하게 학습하기 위해 RX 9070 GRE는 설계되지 않았습니다. 이 카드의 강점은 로컬 추론, 콘텐츠 생성, 학습 프로젝트 및 소규모 실험입니다.

윈도우는 이미 지원되지만 리눅스는 더 넓다

윈도우의 상황은 개선되었습니다. RX 9070 GRE는 공식적으로 ROCm Runtime, HIP SDK 및 ROCm Debugger를 지원하며, 현재 버전的平台은 Windows용 Radeon에 대한 PyTorch를 제공합니다.

그러나 두 시스템의 소프트웨어 지원은 여전히 동일하지 않습니다. 윈도우에서는 PyTorch가 공식적으로 지원되고 있지만, 리눅스는 추가로 TensorFlow, JAX 및 ONNX Runtime을 제공하며, 학습 및 추론을 위한 더 성숙한 도구 세트를 포함합니다. 일부 ROCm 수학 라이브러리는 여전히 리눅스에서만 사용할 수 있습니다.

로컬에서 준비된 모델을 실행하는 데 있어 윈도우는 이미 작업 가능한 옵션으로 간주될 수 있습니다. 다양한 프레임워크에서 개발, 학습 및 실험하는 데는 리눅스가 더 유연한 환경으로 남아 있습니다.

특정 전문 프로그램에 사용할 Radeon을 구입하기 전에 해당 요구 사항을 반드시 확인해야 합니다. ROCm의 지원은 CUDA에 맞춰 작성된 모든 애플리케이션이 구성 없이 작동한다는 보장을 제공하지 않습니다.

왜 RX 9070이 AI에 더 좋을까

게임에서는 추가된 4GB가 즉시 눈에 띄지 않을 수 있습니다. 그러나 머신 러닝에서는 작업을 수행할 수 있는 가능성에 영향을 미칩니다.

RX 9070은 다음을 제공합니다:

  • 로컬 LLM을 위한 가중치 및 컨텍스트 용량의 증가;
  • 레이어를 시스템 메모리로 내보내는 의존성 감소;
  • 고해상도 작업 시 더 큰 자유;
  • ComfyUI에서 복잡한 체인을 사용할 수 있는 가능성;
  • 학습 및 LoRA 조정을 위한 추가 여유;
  • 더 높은 메모리 대역폭.

동일한 전력 소비에서 RX 9070은 더 강력한 GPU뿐만 아니라 메모리 서브 시스템도 크게 개선되었습니다. 따라서 게임과 AI를 동시에 위해 설계된 혼합 PC에서는 상위 카드로의 추가 비용이 순수 게임 시스템보다 정당화됩니다.

RX 9070 GRE를 언제 구매하는 것이 의미가 있나

Radeon RX 9070 GRE는 다음의 경우에 합리적입니다:

  • RX 9070보다 상당히 저렴할 경우;
  • 기본 해상도가 1440p로 남아 있는 경우;
  • 4K는 간헐적으로만 사용할 경우;
  • 로컬 AI가 추론 및 적당한 모델로 제한되는 경우;
  • 필요한 애플리케이션이 공식적으로 ROCm을 통해 작동하는 경우;
  • VRAM의 추가 여유보다 비용 절감이 더 중요한 경우.

가격 차이가 약간밖에 나지 않는 경우 이러한 주장은 힘을 잃게 됩니다. RX 9070은 동일한 220W의 전력 소비로 더 많은 계산 유닛, 16GB 메모리 및 256비트 버스를 제공하고 있습니다.

가격이 모든 것을 결정한다

Radeon RX 9070 GRE의 글로벌 판매는 2026년 6월 2일에 시작되었으며 권장 가격은 549달러입니다. 이는 RX 9070이 출시 당시의 가격과 동일하지만 서로 다른 시기에 설정된 권장가격을 직접 비교하기는 어렵습니다.

그럼에도 불구하고 GRE의 포지셔닝은 논란의 여지가 있습니다. GPU, 메모리 용량 및 대역폭에서 RX 9070에 뒤처지지만 에너지를 절약하지는 않습니다. 따라서 높은 할인율의 경우에만 구매하는 것이 의미가 있습니다.

결론

AMD Radeon RX 9070 GRE는 1440p를 위한 강력한 비디오 카드이며 RX 9060 XT보다 계산 성능에서 상당한 차이를 보이며 현재 ROCm 스택을 지원합니다.

그 약점은 GPU 자체가 아니라 12GB 메모리와 192비트 버스입니다. 게임에서는 주로 4K 및 미래 프로젝트를 위한 여유를 제한합니다. 로컬 AI에서는 현재 더 작은 VRAM 용량이 모델 선택을 축소하고 무거운 작업 흐름을 복잡하게 만드는 영향을 미칩니다.

상당한 할인 시, RX 9070 GRE는 강력한 게임 카드와 로컬 AI 플랫폼으로 적합해 보입니다. RX 9070과의 작은 가격 차이가 있다면 16GB에 추가 비용을 지불하는 것이 더 합리적입니다: 추가 메모리는 장기적인 게임 시스템과 작업에도 유용합니다.

기초적인

라벨 이름
AMD
플랫폼
Desktop
출시일
May 2025
모델명
Radeon RX 9070 GRE
세대
Navi 48
기본 클럭
2220 MHz
부스트 클럭
2790 MHz
버스 인터페이스
PCIe 5.0 x16
트랜지스터
53.9 billion
레이 트레이싱 코어
48
텐서 코어
?
Tensor Cores는 딥러닝을 위해 특별히 설계된 특수 처리 유닛으로, FP32 훈련과 비교하여 더 높은 훈련 및 추론 성능을 제공합니다. 이들은 컴퓨터 비전, 자연어 처리, 음성 인식, 텍스트 음성 변환 및 맞춤형 추천과 같은 영역에서 빠른 계산을 가능하게 합니다. Tensor Cores의 가장 주목할 만한 응용 분야는 DLSS (Deep Learning Super Sampling)와 잡음 감소를 위한 AI Denoiser입니다.
96
텍스처 매핑 유닛
?
텍스처 매핑 유닛(TMU)은 GPU의 구성 요소로서, 이진 이미지를 회전, 스케일링 및 왜곡하여 주어진 3D 모델의 임의의 평면에 텍스처로 배치할 수 있는 기능을 제공합니다. 이 과정을 텍스처 매핑이라고 합니다.
192
파운드리
TSMC
제조 공정 크기
4 nm
아키텍처
RDNA 4

메모리 사양

메모리 크기
12GB
메모리 타입
GDDR6
메모리 버스
?
메모리 버스 너비는 비디오 메모리가 한 클럭 주기 내에 전송할 수 있는 데이터의 비트 수를 의미합니다. 버스 너비가 크면 한 번에 전송되는 데이터 양이 많아지므로, 비디오 메모리의 중요한 매개 변수 중 하나입니다. 메모리 대역폭은 다음과 같이 계산됩니다: 메모리 대역폭 = 메모리 주파수 x 메모리 버스 너비 / 8. 따라서 메모리 주파수가 비슷한 경우, 메모리 버스 너비가 메모리 대역폭의 크기를 결정합니다.
192bit
메모리 클럭
2250 MHz
대역폭
?
메모리 대역폭은 그래픽 칩과 비디오 메모리 간의 데이터 전송 속도를 의미합니다. 이는 초당 바이트로 측정되며, 계산하는 공식은 다음과 같습니다: 메모리 대역폭 = 작동 주파수 × 메모리 버스 너비 / 8 비트입니다.
432.0GB/s

디스플레이 및 미디어

출력 포트
1x HDMI 2.1b3x DisplayPort 2.1a

이론적 성능

픽셀 속도
?
픽셀 필률은 그래픽 처리 장치(GPU)가 초당 렌더링할 수 있는 픽셀 수를 나타내는 지표로, MPixels/s(백만 픽셀/초) 또는 GPixels/s(십억 픽셀/초) 단위로 측정됩니다. 그래픽 카드의 픽셀 처리 성능을 평가하는 가장 일반적으로 사용되는 측정 항목입니다.
267.8 GPixel/s
텍스처 속도
?
"Texture fill rate"은 GPU가 1초에 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 나타냅니다. "텍스처 채움 속도"는 GPU가 1초에 단일 픽셀에 매핑할 수 있는 텍스처 맵 요소 (텍셀)의 수를 의미합니다.
535.7 GTexel/s
FP16 (반 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
34.3 TFLOPS Vector
FP64 (배 정밀도)
?
GPU 성능을 측정하는 중요한 지표 중 하나는 부동 소수점 연산 능력입니다. 반 정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다. 단 정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되며, 이중 정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학적 계산에 필요합니다.
1071 GFLOPS
FP32 (float)
?
GPU 성능을 측정하는 중요한 지표는 부동 소수점 컴퓨팅 기능입니다. 단정밀도 부동 소수점 숫자(32비트)는 일반적인 멀티미디어 및 그래픽 처리 작업에 사용되는 반면, 배정밀도 부동 소수점 숫자(64비트)는 넓은 숫자 범위와 높은 정확도를 요구하는 과학 컴퓨팅에 필요합니다. 반정밀도 부동 소수점 숫자(16비트)는 낮은 정밀도가 허용되는 기계 학습과 같은 응용 프로그램에 사용됩니다.
34.3 TFLOPS

여러 가지 잡다한

새딩 유닛
?
가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 즉 여러 개의 SP가 동시에 작업을 처리하는 것을 의미합니다. "가장 기본적인 처리 단위는 스트리밍 프로세서(SP)이며, 여기서 특정 명령과 작업이 실행됩니다. GPU는 병렬 컴퓨팅을 수행하며, 다수의 SP가 동시에 작업을 처리합니다."
3072
TDP
220W
Vulkan 버전
?
Vulkan은 Khronos Group의 크로스 플랫폼 그래픽 및 컴퓨팅 API로, 높은 성능과 낮은 CPU 오버헤드를 제공합니다. 이를 통해 개발자는 GPU를 직접 제어하고, 렌더링 오버헤드를 줄이고, 멀티스레딩 및 멀티코어 프로세서를 지원할 수 있습니다.
1.3
OpenCL 버전
2.2
OpenGL
4.6
DirectX
12 Ultimate (12_2)
전원 연결자
2x 8-pin
렌더 출력 파이프라인
?
래스터 작업 파이프라인(ROPs)은 게임에서 조명 및 반사 계산을 처리하고 안티 앨리어싱(AA), 고해상도, 연기, 불 등과 같은 효과를 관리하는 것이 주된 역할입니다. 게임에서 안티 앨리어싱과 조명 효과가 더욱 요구되는 경우 ROPs의 성능 요구 사항이 더 높아질 수 있으며, 그렇지 않은 경우 프레임 속도가 급격히 감소할 수 있습니다.
96
쉐이더 모델
6.8
권장 전원 공급 장치
650 W

벤치마크

FP32 (float)
점수
34.3 TFLOPS
3DMark Steel Nomad
점수
5174
OpenCL
점수
134417

다른 GPU와 비교

FP32 (float) / TFLOPS
37.936 +10.6%
29.733 -13.3%
3DMark Steel Nomad
5300 +2.4%
5117 -1.1%
OpenCL
388405 +189%
186397 +38.7%
90580 -32.6%
66428 -50.6%