AMD Instinct MI300X
AMD Instinct MI300X : 192 Go HBM3 et le pari d'AMD sur les grands modèles d'IA
Les principales caractéristiques de l'AMD Instinct MI300X - 192 Go HBM3 et une bande passante mémoire de 5,3 To/s. C'est un accélérateur de serveur destiné aux grands modèles d'IA et au HPC, où le volume et la vitesse de la mémoire, ainsi que les calculs matriciels et la haute performance FP64, sont essentiels.
Le MI300X est le premier accélérateur d'AMD à concurrencer sérieusement le NVIDIA H100 dans les grands systèmes d'IA. Mais son avantage ne se manifeste pas de la même manière pour toutes les charges de travail.
CDNA 3 : une architecture pour l'IA et le HPC
Au cœur du MI300X se trouve CDNA 3 - l'architecture de calcul d'AMD pour les centres de données. Elle n'est pas conçue pour les graphismes de jeu et est optimisée pour les opérations matricielles, FP64, FP8/BF16, HBM et le scalabilité de plusieurs accélérateurs.
Le MI300X contient 304 unités de calcul, 1216 cœurs matriciels et 19 456 processeurs de flux. La fréquence de pointe atteint 2,1 GHz. Huit unités de calcul XCD sont regroupées dans un seul module, et le nombre total de transistors atteint 153 milliards.
Pour différents formats de calcul, AMD indique les performances de pointe suivantes :
| Format de calcul | Performance de pointe |
|---|---|
| FP8 | 2,61 PFLOPS |
| FP8 avec dissipation structurale | 5,22 PFLOPS |
| BF16 | 1,30 PFLOPS |
| FP16 | 1,30 PFLOPS |
| TF32 Matrix | 653,7 TFLOPS |
| FP32 | 163,4 TFLOPS |
| FP64 Matrix | 163,4 TFLOPS |
| FP64 Vector | 81,7 TFLOPS |
Comparer ces chiffres directement avec ceux des GPU de jeu n'est pas correct : le MI300X est axé sur l'IA et le HPC, et non sur la rasterisation et les charges de travail de jeu.
192 Go HBM3 - le principal avantage du MI300X
L'accélérateur dispose de 192 Go HBM3 sur un bus de 8192 bits avec une bande passante de 5,3 To/s. La taille du cache Infinity est de 256 Mo.
En termes de volume et de bande passante de mémoire, le MI300X surpasse le H100 et le H200 :
| Accélérateur | Mémoire | Bande passante |
|---|---|---|
| AMD Instinct MI300X | 192 Go HBM3 | 5,3 To/s |
| NVIDIA H100 SXM | 80 Go HBM3 | 3,35 To/s |
| NVIDIA H200 SXM | 141 Go HBM3E | 4,8 To/s |
Pour les grands modèles de langage, le volume de HBM influence le nombre d'accélérateurs nécessaires pour héberger les poids du modèle et les données intermédiaires. Moins de GPU sont nécessaires pour héberger le modèle, moins de données doivent être transférées entre les accélérateurs pendant l'inférence.
Dans MLPerf Inference v4.1, un MI300X a pu héberger Llama 2 70B dans la mémoire d'un seul accélérateur. Dans une configuration avec huit GPU, les résultats du MI300X dans les modes Server et Offline étaient proches de ceux d'un système composé de huit H100.
Performance sur de grands LLM
Pour les modèles de plus petite taille, un grand volume de mémoire ne garantit pas à lui seul une supériorité.
Dans les tests publiés par AMD, Llama 3.1 utilisait des systèmes avec huit MI300X et huit H100 :
| Modèle, FP8 | Entrée / Sortie | 8× MI300X | 8× H100 |
|---|---|---|---|
| Llama 3.1 70B | 128 / 2048 | 15 105 tok/s | 15 810 tok/s |
| Llama 3.1 70B | 2048 / 2048 | 8 239 tok/s | 8 245 tok/s |
| Llama 3.1 405B | 128 / 2048 | 4 065 tok/s | 3 265 tok/s |
| Llama 3.1 405B | 128 / 4096 | 3 171 tok/s | 1 957 tok/s |
Pour Llama 3.1 70B, le H100 est légèrement plus rapide ou les résultats sont presque équivalents. Pour Llama 3.1 405B, le MI300X prend de l'avance, surtout lors de généralisations plus longues.
Ces résultats publiés par AMD doivent donc être considérés comme une comparaison de configurations bien optimisées, plutôt que comme un classement universel indépendant.
L'avantage du MI300X dépend de la nature de la charge de travail. Plus la performance est limitée par la mémoire, plus l'avantage de 192 Go HBM3 et d'une bande passante de 5,3 To/s est marquant.
Haute performance FP64
Le MI300X est conçu non seulement pour l'IA, mais aussi pour le HPC.
La performance de pointe en FP64 atteint 81,7 TFLOPS pour les opérations vectorielles et 163,4 TFLOPS pour les opérations matricielles.
Une telle performance est essentielle dans la dynamique des fluides computationnelle, la modélisation climatique et physique, la dynamique moléculaire, la géophysique et d'autres calculs scientifiques.
Pour le HPC, une haute vitesse FP64 est l'une des priorités architecturales du MI300X, et non une fonctionnalité secondaire.
Huit MI300X - c'est 1,5 To HBM3
Dans un système composé de huit MI300X, 1 536 Go HBM3 sont disponibles, soit environ 1,5 To de mémoire directement sur les accélérateurs.
Un tel volume permet d'héberger de grands modèles à l'intérieur d'un seul serveur au lieu de les répartir entre plusieurs nœuds.
Le MI300X est disponible au format OAM et s'installe sur des plateformes serveurs Universal Base Board. L'Infinity Fabric est utilisé entre les accélérateurs.
Chaque MI300X est équipé de sept canaux Infinity Fabric avec une bande passante pouvant atteindre 128 Go/s chacun. Le système est connecté au processeur via PCIe 5.0 x16.
Jusqu'à 750 W par accélérateur
La puissance thermique maximale (TBP) du MI300X est de 750 W.
Le facteur de forme OAM et ce niveau de consommation d'énergie excluent l'utilisation du MI300X dans des stations de travail classiques. Le module n'a pas de refroidissement actif - le flux d'air nécessaire est assuré par la plateforme serveur.
Huit MI300X consomment jusqu'à 6 kW uniquement pour les accélérateurs, sans compter le CPU, la mémoire, les disques et le matériel réseau.
ROCm - la principale limitation du MI300X
La partie matérielle du MI300X est compétitive, mais pour un accélérateur de serveur, l'écosystème logiciel est tout aussi important.
AMD développe ROCm, qui prend en charge PyTorch, TensorFlow, JAX, Triton et d'autres outils. Avec la sortie du MI300X, la société a élargi le soutien aux cadres d'IA modernes et aux optimisations pour les grands modèles.
CUDA demeure l'un des principaux avantages de NVIDIA. De nombreuses bibliothèques et piles de calcul d'entreprise ont été initialement créées pour elle.
Par conséquent, le choix entre le MI300X et le H100 ne peut être réduit à TFLOPS ou à la quantité de mémoire. Si la charge de travail fonctionne déjà sur ROCm, les différences matérielles deviennent plus significatives - principalement le volume de HBM et sa bande passante.
Contexte caché de la gamme
Avec la génération MI300, la gamme Instinct a considérablement évolué d'une orientation principalement HPC vers l'IA générative.
| Série | Architecture | Année d'apparition de l'architecture |
|---|---|---|
| Instinct MI100 | CDNA | 2020 |
| Instinct MI200 | CDNA 2 | 2021 |
| Instinct MI300 | CDNA 3 | 2023 |
| Instinct MI350 | CDNA 4 | 2025 |
Le MI100 a été le premier accélérateur d'AMD basé sur CDNA. Le MI200 a développé le domaine du HPC et a été utilisé dans des systèmes exaflopiques.
Dans le MI300, l'architecture CDNA 3 a intégré le FP8, des Matrix Core plus puissants et une orientation plus marquée vers les réseaux neuronaux.
Le prochain MI325X a conservé le CDNA 3, mais a reçu plus de mémoire et une bande passante plus élevée. Le passage à une nouvelle architecture a eu lieu avec la série MI350 dotée de CDNA 4.
Le MI300X est devenu le premier Instinct qu'AMD a commencé à positionner directement contre les principaux accélérateurs d'IA de NVIDIA.
Conclusion
Le principal avantage du MI300X est 192 Go HBM3 avec une bande passante de 5,3 To/s. Couplé à une haute performance FP64 et de calculs matriciels, cela rend cet accélérateur particulièrement adapté aux grands LLM et au HPC.
Pour les LLM de taille intermédiaire, le H100 peut être plus rapide ou afficher des résultats comparables. Sur des modèles plus volumineux, l'avantage du MI300X en terme de volume et de bande passante mémoire devient plus perceptible.
La principale limitation reste logicielle : CUDA, en termes de maturité de l'écosystème, offre encore un sérieux avantage à NVIDIA.
Le MI300X n'est déjà plus le tout dernier accélérateur d'AMD, mais il a été le premier modèle de l'entreprise à pouvoir véritablement rivaliser avec le H100 dans les grands systèmes d'IA.
Basique
Spécifications de la mémoire
Performance théorique
Divers
Benchmarks
Comparé aux autres GPU
Comparaisons de GPU associées
Partager sur les réseaux sociaux
Ou créez un lien vers nous
<a href="https://cputronic.com/index.php/fr/gpu/amd-instinct-mi300x" target="_blank">AMD Instinct MI300X</a>