AMD Instinct MI300X
AMD Instinct MI300X: 192GB HBM3 및 AMD의 대규모 AI 모델에 대한 투기
AMD Instinct MI300X의 주요 특징은 192GB HBM3와 5.3TB/s의 메모리 대역폭입니다. 이는 대규모 AI 모델 및 HPC를 위한 서버 가속기로, 메모리의 용량과 속도, 행렬 연산 및 높은 FP64 성능이 중요합니다.
MI300X는 AMD의 첫 번째 가속기로, 대규모 AI 시스템에서 NVIDIA H100과 본격적으로 경쟁하기 시작했습니다. 하지만 모든 부하에서 그 이점이 동일하게 나타나는 것은 아닙니다.
CDNA 3: AI 및 HPC를 위한 아키텍처
MI300X의 기반은 CDNA 3로, AMD의 데이터 센터용 컴퓨팅 아키텍처입니다. 이는 게임 그래픽을 목표로 하지 않으며, 행렬 연산, FP64, FP8/BF16, HBM 및 여러 가속기의 확장을 위해 최적화되어 있습니다.
MI300X는 304 컴퓨트 유닛, 1216 매트릭스 코어 및 19,456 스트리밍 프로세서를 포함하고 있습니다. 피크 클럭은 2.1GHz에 달합니다. 여덟 개의 XCD가 하나의 모듈에 결합되어 있으며, 총 트랜지스터 수는 1530억 개에 이릅니다.
AMD는 다양한 계산 형식에 대해 다음과 같은 피크 성능을 제시합니다:
| 계산 형식 | 피크 성능 |
|---|---|
| FP8 | 2.61 PFLOPS |
| 구조적 희소성의 FP8 | 5.22 PFLOPS |
| BF16 | 1.30 PFLOPS |
| FP16 | 1.30 PFLOPS |
| TF32 매트릭스 | 653.7 TFLOPS |
| FP32 | 163.4 TFLOPS |
| FP64 매트릭스 | 163.4 TFLOPS |
| FP64 벡터 | 81.7 TFLOPS |
이 성능 지표를 일반 게임 GPU와 직접 비교하는 것은 부정확합니다: MI300X는 AI 및 HPC를 겨냥하고 있으며, 래스터화 및 게임 부하에 대한 것이 아닙니다.
192GB HBM3 - MI300X의 주요 장점
이 가속기는 192GB HBM3를 8192비트 버스를 통해 5.3TB/s의 대역폭으로 제공합니다. 인피니티 캐시 용량은 256MB입니다.
MI300X는 메모리 용량과 대역폭 면에서 H100 및 H200을 능가합니다:
| 가속기 | 메모리 | 대역폭 |
|---|---|---|
| AMD Instinct MI300X | 192GB HBM3 | 5.3TB/s |
| NVIDIA H100 SXM | 80GB HBM3 | 3.35TB/s |
| NVIDIA H200 SXM | 141GB HBM3E | 4.8TB/s |
대규모 언어 모델에 대해 HBM 용량은 모델의 가중치와 중간 데이터를 저장하는 데 필요한 가속기의 수에 영향을 미칩니다. 모델을 저장하는 데 필요한 GPU 수가 적어질수록, 추론 중 가속기 간 전송해야 하는 데이터 양도 줄어듭니다.
MLPerf Inference v4.1에서는 한 개의 MI300X가 Llama 2 70B를 한 대의 가속기 메모리에 완전히 저장할 수 있었습니다. 여덟 개의 GPU로 구성된 환경에서 MI300X는 서버 및 오프라인 모드에서 여덟 개의 H100을 장착한 시스템과 유사한 성능을 기록했습니다.
대규모 LLM에서의 성능
더 작은 모델의 경우 큰 메모리 용량만으로는 성능 우위를 보장하지 않습니다.
AMD의 발표된 테스트에서는 Llama 3.1을 위해 여덟 개의 MI300X 및 여덟 개의 H100 시스템을 사용했습니다:
| 모델, FP8 | 입력 / 출력 | 8× MI300X | 8× H100 |
|---|---|---|---|
| Llama 3.1 70B | 128 / 2048 | 15,105 토큰/초 | 15,810 토큰/초 |
| Llama 3.1 70B | 2048 / 2048 | 8,239 토큰/초 | 8,245 토큰/초 |
| Llama 3.1 405B | 128 / 2048 | 4,065 토큰/초 | 3,265 토큰/초 |
| Llama 3.1 405B | 128 / 4096 | 3,171 토큰/초 | 1,957 토큰/초 |
Llama 3.1 70B 모델에서는 H100이 약간 더 빠르거나 결과가 거의 일치합니다. 반면 Llama 3.1 405B 모델에서는 MI300X가 더 나은 성능을 보여줍니다, 특히 긴 생성 작업 시에 더욱 그렇습니다.
이 결과는 AMD에서 발표한 것이므로, 이는 잘 최적화된 구성을 비교하는 관점에서 보는 것이 더 올바릅니다. 단순히 독립적인 보편적인 랭킹으로는 고려하지 않는 것이 좋습니다.
MI300X의 장점은 부하의 성격에 따라 다릅니다. 메모리 성능의 제약이 클수록 192GB HBM3 및 5.3TB/s의 대역폭의 이점이 더욱 뚜렷하게 나타납니다.
높은 FP64 성능
MI300X는 AI 뿐만 아니라 HPC에서도 설계되었습니다.
FP64의 피크 성능은 벡터 연산의 경우 81.7 TFLOPS, 행렬 연산의 경우 163.4 TFLOPS에 달합니다.
이러한 성능은 계산 유체 역학, 기후 및 물리 모델링, 분자 동역학, 지구 물리학 및 기타 과학적 계산 분야에서 필요합니다.
HPC에서 FP64의 높은 속도는 MI300X의 아키텍처적 우선 사항 중 하나이며, 보조적인 기능이 아닙니다.
여덟 개의 MI300X는 1.5TB HBM3를 제공합니다
여덟 개의 MI300X로 구성된 시스템에는 1,536GB HBM3가 제공되며, 이는 가속기에서 약 1.5TB의 메모리를 의미합니다.
이런 용량은 대규모 모델을 여러 노드에 분산하지 않고도 하나의 서버 내에서 배치할 수 있도록 해 줍니다.
MI300X는 OAM 형식으로 출시되며, 유니버설 베이스 보드 서버 플랫폼에 장착됩니다. 가속기 간에는 인피니티 패브릭이 사용됩니다.
각 MI300X는 최대 128GB/s의 대역폭을 가진 7개의 인피니티 패브릭 채널을 갖추고 있습니다. 시스템은 PCIe 5.0 x16을 통해 프로세서와 연결됩니다.
가속기당 최대 750W 소비 전력
MI300X의 최대 TBP는 750W입니다.
OAM 형식 및 이 수준의 전력 소비는 MI300X를 일반 워크스테이션에서 사용할 수 없게 만듭니다. 이 모듈은 자체 액티브 냉각이 없으며, 필요한 공기 흐름은 서버 플랫폼에 의해 제공됩니다.
여덟 개의 MI300X는 CPU, 메모리, 저장 장치 및 네트워크 장비를 제외하고도 가속기에만 최대 6kW의 전력을 소비합니다.
ROCm - MI300X의 주요 한계
MI300X의 하드웨어는 경쟁력이 있지만, 서버 가속기에서 소프트웨어 생태계 또한 매우 중요합니다.
AMD는 ROCm을 개발하고 있으며, 이 플랫폼은 PyTorch, TensorFlow, JAX, Triton 및 기타 도구를 지원합니다. MI300X 출시와 함께 AMD는 최신 AI 프레임워크 및 대규모 모델에 대한 지원을 확대했습니다.
이와 동시에 CUDA는 여전히 NVIDIA의 강력한 이점 중 하나입니다. 많은 라이브러리 및 기업용 컴퓨팅 스택은 처음부터 CUDA를 위해 만들어졌습니다.
따라서 MI300X와 H100 간의 선택은 단순히 TFLOPS나 메모리 용량으로 제한될 수 없습니다. 부하가 이미 ROCm에서 작동하고 있다면 하드웨어 측의 차이가 더욱 중요해지며, 우선적으로 HBM 용량과 대역폭이 강조됩니다.
제품 라인에 대한 숨겨진 맥락
MI300 세대와 함께 Instinct 라인은 대부분 HPC 부하에서 생성적 AI로 대폭 전환되었습니다.
| 시리즈 | 아키텍처 | 아키텍처 등장 연도 |
|---|---|---|
| Instinct MI100 | CDNA | 2020 |
| Instinct MI200 | CDNA 2 | 2021 |
| Instinct MI300 | CDNA 3 | 2023 |
| Instinct MI350 | CDNA 4 | 2025 |
MI100는 CDNA 아키텍처에서 AMD의 첫 번째 가속기가 되었습니다. MI200은 HPC 방향성을 발전시켰고, 엑사플롭스 시스템에서 사용되었습니다.
MI300 아키텍처인 CDNA 3는 FP8, 더 강력한 매트릭스 코어 및 신경망에 대한 보다 명확한 방향성을 갖추었습니다.
다음 MI325X는 CDNA 3를 유지하면서 더 많은 메모리와 더 높은 대역폭을 보유했습니다. 새로운 아키텍처로의 전환은 이미 MI350 시리즈에서 CDNA 4로 실시되었습니다.
MI300X는 AMD가 AI 가속기 분야에서 NVIDIA와의 직접적인 경쟁을 위해 처음으로 포지셔닝한 Instinct 모델이 되었습니다.
결론
MI300X의 주요 장점은 192GB HBM3와 5.3TB/s의 대역폭입니다. 이와 함께 높은 FP64 성능과 행렬 연산 성능은 이 가속기를 대규모 LLM 및 HPC에 특히 적합하게 만듭니다.
중간 크기의 LLM에서는 H100이 더 빠르거나 유사한 성능을 보일 수 있습니다. 그러나 더 큰 모델에서는 MI300X의 메모리 용량과 대역폭에서의 이점이 더욱 두드러집니다.
주요 한계는 여전히 소프트웨어에 있습니다: CUDA의 생태계 성숙도는 NVIDIA에 여전히 심각한 이점을 제공합니다.
MI300X는 이제 AMD의 가장 최신 가속기는 아니지만, AI 시스템에서 H100과 진정으로 경쟁할 수 있는 첫 번째 모델로 자리잡았습니다.
기초적인
메모리 사양
이론적 성능
여러 가지 잡다한
벤치마크
다른 GPU와 비교
소셜 미디어에서 공유하기
또는 링크로 소개하기
<a href="https://cputronic.com/index.php/ko/gpu/amd-instinct-mi300x" target="_blank">AMD Instinct MI300X</a>