AMD Instinct MI300X

AMD Instinct MI300X
Recensione della scheda video AMD Instinct MI300X

AMD Instinct MI300X: 192 GB HBM3 e la scommessa AMD su grandi modelli AI

Le principali caratteristiche dell’AMD Instinct MI300X sono 192 GB HBM3 e una larghezza di banda della memoria di 5,3 TB/s. Si tratta di un acceleratore server per grandi modelli di IA e HPC, dove il volume e la velocità della memoria, i calcoli matriciali e le elevate prestazioni FP64 sono fondamentali.

MI300X è diventato il primo acceleratore AMD a competere seriamente con NVIDIA H100 in grandi sistemi di IA. Tuttavia, il suo vantaggio non emerge in tutte le carichi di lavoro allo stesso modo.

CDNA 3: architettura per IA e HPC

Alla base del MI300X c'è CDNA 3 - l'architettura di calcolo AMD per i data center. Non è progettata per la grafica da gioco ed è ottimizzata per operazioni matriciali, FP64, FP8/BF16, HBM e scalabilità di più acceleratori.

MI300X contiene 304 Compute Unit, 1216 Matrix Core e 19 456 processori di flusso. La frequenza di picco raggiunge i 2,1 GHz. Otto unità di calcolo XCD sono unite in un singolo modulo, mentre il numero totale di transistor raggiunge i 153 miliardi.

Per diversi formati di calcolo, AMD riporta le seguenti prestazioni di picco:

Formato di calcolo Prestazioni di picco
FP8 2,61 PFLOPS
FP8 con sparsità strutturale 5,22 PFLOPS
BF16 1,30 PFLOPS
FP16 1,30 PFLOPS
TF32 Matrix 653,7 TFLOPS
FP32 163,4 TFLOPS
FP64 Matrix 163,4 TFLOPS
FP64 Vector 81,7 TFLOPS

Confrontare questi valori direttamente con GPU da gioco non è corretto: il MI300X è orientato verso IA e HPC, non verso la rasterizzazione e il carico di lavoro di gioco.

192 GB HBM3 - il principale vantaggio del MI300X

L'acceleratore ha ottenuto 192 GB HBM3 su un bus a 8192 bit con una larghezza di banda di 5,3 TB/s. La dimensione dell’Infinity Cache è di 256 MB.

In termini di volume e larghezza di banda della memoria, il MI300X supera H100 e H200:

Acceleratore Memoria Larghezza di banda
AMD Instinct MI300X 192 GB HBM3 5,3 TB/s
NVIDIA H100 SXM 80 GB HBM3 3,35 TB/s
NVIDIA H200 SXM 141 GB HBM3E 4,8 TB/s

Per grandi modelli linguistici, il volume di HBM influisce sul numero di acceleratori necessari per ospitare i pesi del modello e i dati intermedi. Meno GPU sono necessarie per ospitare il modello, meno dati devono essere trasferiti tra gli acceleratori durante l'inferenza.

Nel MLPerf Inference v4.1, un MI300X è stato in grado di ospitare Llama 2 70B interamente nella memoria di un unico acceleratore. Nella configurazione con otto GPU, i risultati del MI300X nelle modalità Server e Offline erano vicini a quelli di un sistema con otto H100.

Prestazioni su grandi LLM

Con modelli di dimensioni inferiori, un ampio volume di memoria di per sé non garantisce il primato.

Nei test pubblicati AMD, sono stati utilizzati sistemi con otto MI300X e otto H100:

Modello, FP8 Input / Output 8× MI300X 8× H100
Llama 3.1 70B 128 / 2048 15 105 token/s 15 810 token/s
Llama 3.1 70B 2048 / 2048 8 239 token/s 8 245 token/s
Llama 3.1 405B 128 / 2048 4 065 token/s 3 265 token/s
Llama 3.1 405B 128 / 4096 3 171 token/s 1 957 token/s

Su Llama 3.1 70B, l'H100 è leggermente più veloce oppure i risultati sono quasi identici. Su Llama 3.1 405B, il MI300X si distingue, specialmente in generazioni lunghe.

Questi risultati sono stati pubblicati da AMD, quindi è più corretto considerarli come un confronto tra configurazioni ben ottimizzate, piuttosto che come un ranking universale indipendente.

Il vantaggio del MI300X dipende dalla natura del carico di lavoro. Maggiore è il limite delle prestazioni della memoria, più evidente è il vantaggio dei 192 GB HBM3 e della larghezza di banda di 5,3 TB/s.

Alte prestazioni FP64

Il MI300X è progettato non solo per IA, ma anche per HPC.

Le prestazioni FP64 di picco raggiungono 81,7 TFLOPS per le operazioni vettoriali e 163,4 TFLOPS per quelle matriciali.

Tali prestazioni sono richieste nell'idrodinamica computazionale, nella modellazione climatica e fisica, nella dinamica molecolare, nella geofisica e in altri calcoli scientifici.

Per l'HPC, l'elevata velocità FP64 è una delle priorità architettoniche del MI300X, e non una possibilità secondaria.

Otto MI300X equivalgono a 1,5 TB HBM3

In un sistema con otto MI300X sono disponibili 1 536 GB HBM3, ossia circa 1,5 TB di memoria direttamente sugli acceleratori.

Tale volume consente di ospitare modelli di grandi dimensioni all'interno di un singolo server invece di distribuirli tra più nodi.

Il MI300X è disponibile nel formato OAM e si installa su piattaforme server Universal Base Board. Tra gli acceleratori si utilizza Infinity Fabric.

Ogni MI300X è dotato di sette canali Infinity Fabric con una larghezza di banda di fino a 128 GB/s ciascuno. Il sistema è connesso al processore tramite PCIe 5.0 x16.

Fino a 750 W per ogni acceleratore

Il TBP massimo del MI300X è di 750 W.

Il fattore di forma OAM e tale livello di consumo energetico escludono l'uso del MI300X in normali workstation. Il modulo non ha un proprio raffreddamento attivo - il flusso d'aria necessario è garantito dalla piattaforma server.

Otto MI300X possono arrivare a 6 kW di consumo solo per gli acceleratori, escluse CPU, memoria, archiviazione e attrezzature di rete.

ROCm - il principale limite del MI300X

La componente hardware del MI300X è competitiva, ma per un acceleratore server l'ecosistema software è altrettanto importante.

AMD sta sviluppando ROCm, che supporta PyTorch, TensorFlow, JAX, Triton e altri strumenti. Con il lancio del MI300X, l'azienda ha ampliato il supporto per i moderni framework di IA e le ottimizzazioni per grandi modelli.

CUDA rimane uno dei principali vantaggi di NVIDIA. Molte librerie e stack di calcolo aziendale sono state inizialmente create specificamente per essa.

Pertanto, la scelta tra MI300X e H100 non può essere ridotta solo a TFLOPS o capacità di memoria. Se il carico di lavoro è già in esecuzione su ROCm, le differenze nell'hardware diventano più rilevanti - soprattutto il volume di HBM e la sua larghezza di banda.

Il contesto nascosto della linea

Con la generazione MI300, la linea Instinct si è spostata significativamente dai carichi di lavoro HPC alle IA generative.

Serie Architettura Anno di introduzione dell'architettura
Instinct MI100 CDNA 2020
Instinct MI200 CDNA 2 2021
Instinct MI300 CDNA 3 2023
Instinct MI350 CDNA 4 2025

MI100 è stato il primo acceleratore AMD su CDNA. MI200 ha sviluppato l'area HPC ed è stato utilizzato in sistemi exaflop.

Nel MI300, l'architettura CDNA 3 ha introdotto FP8, core matriciali più potenti e una maggiore orientazione verso le reti neurali.

Il successivo MI325X ha mantenuto CDNA 3, ma ha ricevuto più memoria e una larghezza di banda più elevata. Il passaggio a una nuova architettura è avvenuto già nella serie MI350 con CDNA 4.

MI300X è stato il primo Instinct che AMD ha iniziato a posizionare direttamente contro i principali acceleratori di IA di NVIDIA.

Conclusione

Il principale vantaggio del MI300X è 192 GB HBM3 con una larghezza di banda di 5,3 TB/s. Insieme all'elevata prestazione FP64 e delle operazioni matriciali, ciò rende l'acceleratore particolarmente adatto per grandi LLM e HPC.

Con LLM di dimensioni medie, l'H100 può risultare più veloce o mostrare risultati comparabili. Su modelli più grandi, il vantaggio del MI300X in termini di volume e larghezza di banda della memoria diventa più evidente.

Il principale limite rimane software: CUDA, per la maturità dell'ecosistema, continua a dare a NVIDIA un vantaggio considerevole.

Il MI300X non è più l'acceleratore più recente di AMD, ma è stato il primo modello dell'azienda che poteva essere messo seriamente a confronto con l'H100 in grandi sistemi di IA.

Di base

Nome dell'etichetta
AMD
Piattaforma
Professional
Data di rilascio
December 2023
GPU Lithography
TSMC 5 nm / 6 nm FinFET
Nome del modello
Instinct MI300X
Generazione
Instinct MI300 Series
Boost Clock
2100MHz
Interfaccia bus
PCIe 5.0 x16
Transistor
153 billion
Unità di calcolo
304
Architettura
CDNA 3

Specifiche della memoria

Dimensione memoria
192GB
Tipo di memoria
HBM3
Bus memoria
?
La larghezza del bus di memoria si riferisce al numero di bit di dati che la memoria video può trasferire in un singolo ciclo di clock. Maggiore è la larghezza del bus, maggiore è la quantità di dati che può essere trasmessa istantaneamente. La larghezza del bus di memoria è un parametro cruciale della memoria video. La larghezza di banda della memoria si calcola così: Larghezza di banda della memoria = Frequenza della memoria x Larghezza del bus di memoria / 8.
8192bit
Clock memoria
5200MHz
Larghezza di banda
?
La larghezza di banda della memoria si riferisce alla velocità di trasferimento dati tra il chip grafico e la memoria video. Si misura in byte al secondo e la formula per calcolarla è: larghezza di banda della memoria = frequenza di lavoro × larghezza del bus di memoria / 8 bit.
5300 GB/s

Prestazioni teoriche

FP16 (metà)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri in virgola mobile a metà precisione (16 bit) vengono utilizzati per applicazioni come l'apprendimento automatico, dove è accettabile una precisione inferiore.
1300 TFLOPS
FP64 (doppio)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri in virgola mobile a doppia precisione (64 bit) sono richiesti per il calcolo scientifico che richiede un'ampia gamma numerica e un'alta precisione.
81.7 TFLOPS
FP32 (virgola mobile)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri a virgola mobile a precisione singola (32 bit) vengono utilizzati per attività comuni di elaborazione grafica e multimediale, mentre i numeri a virgola mobile a precisione doppia (64 bit) sono necessari per il calcolo scientifico che richiede un'ampia gamma numerica e un'elevata precisione. I numeri a virgola mobile a mezza precisione (16 bit) vengono utilizzati per applicazioni come l'apprendimento automatico, dove è accettabile una precisione inferiore.
163.4 TFLOPS

Varie

Unità di ombreggiatura
?
L'unità di elaborazione più fondamentale è il processore di streaming (SP), dove vengono eseguite istruzioni e compiti specifici. Le GPU eseguono il calcolo parallelo, il che significa che più SP lavorano contemporaneamente per elaborare i compiti.
19456
TDP
750W

Classifiche

FP32 (virgola mobile)
Punto
163.4 TFLOPS

Rispetto ad altre GPU

FP32 (virgola mobile) / TFLOPS
104.8 -35.9%
90.219 -44.8%
79.478 -51.4%
65.572 -59.9%