AMD Instinct MI300X
AMD Instinct MI300X: 192 GB HBM3 y la apuesta de AMD por grandes modelos de IA
Principales características de AMD Instinct MI300X: 192 GB HBM3 y un ancho de banda de memoria de 5,3 TB/s. Este es un acelerador de servidor para grandes modelos de IA y HPC, donde el volumen y la velocidad de la memoria, los cálculos matriciales y el alto rendimiento en FP64 son cruciales.
MI300X se convirtió en el primer acelerador de AMD que realmente comenzó a competir con el NVIDIA H100 en grandes sistemas de IA. Sin embargo, su ventaja no se manifiesta de igual manera en todas las cargas de trabajo.
CDNA 3: arquitectura para IA y HPC
En la base del MI300X se encuentra CDNA 3 - la arquitectura computacional de AMD para centros de datos. No está diseñada para gráficos de juegos y está optimizada para operaciones matriciales, FP64, FP8/BF16, HBM y escalamiento de múltiples aceleradores.
MI300X contiene 304 Unidades de Cómputo, 1216 Núcleos Matriciales y 19,456 Procesadores de Flujo. La frecuencia máxima alcanza los 2,1 GHz. Ocho unidades de cálculo XCD se combinan en un solo módulo, y el número total de transistores alcanza los 153 mil millones.
Para diferentes formatos de cálculo, AMD indica las siguientes cifras máximas:
| Formato de cálculo | Rendimiento máximo |
|---|---|
| FP8 | 2,61 PFLOPS |
| FP8 con esparcimiento estructural | 5,22 PFLOPS |
| BF16 | 1,30 PFLOPS |
| FP16 | 1,30 PFLOPS |
| TF32 Matriz | 653,7 TFLOPS |
| FP32 | 163,4 TFLOPS |
| FP64 Matriz | 163,4 TFLOPS |
| FP64 Vector | 81,7 TFLOPS |
Comparar estas cifras con las de las GPU de juegos directamente no es correcto: MI300X está orientado a IA y HPC, no a rasterización y cargas de trabajo de juegos.
192 GB HBM3 - la principal ventaja de MI300X
El acelerador cuenta con 192 GB HBM3 en un bus de 8192 bits con un ancho de banda de 5,3 TB/s. El volumen de Infinity Cache es de 256 MB.
En términos de volumen y ancho de banda de memoria, MI300X supera al H100 y H200:
| Acelerador | Memoria | Ancho de banda |
|---|---|---|
| AMD Instinct MI300X | 192 GB HBM3 | 5,3 TB/s |
| NVIDIA H100 SXM | 80 GB HBM3 | 3,35 TB/s |
| NVIDIA H200 SXM | 141 GB HBM3E | 4,8 TB/s |
Para grandes modelos de lenguaje, el volumen de HBM influye en la cantidad de aceleradores necesarios para albergar los pesos del modelo y los datos intermedios. Cuanto menos GPU se requiera para alojar el modelo, menos datos tendrán que transferirse entre los aceleradores durante la inferencia.
En MLPerf Inference v4.1, un solo MI300X pudo albergar Llama 2 70B completamente en la memoria de un solo acelerador. En una configuración con ocho GPU, los resultados de MI300X en modos Server y Offline fueron similares a un sistema con ocho H100.
Rendimiento en grandes LLM
En modelos de menor tamaño, un gran volumen de memoria no garantiza por sí solo un desempeño superior.
En pruebas publicadas por AMD, Llama 3.1 utilizó sistemas con ocho MI300X y ocho H100:
| Modelo, FP8 | Entrada / Salida | 8× MI300X | 8× H100 |
|---|---|---|---|
| Llama 3.1 70B | 128 / 2048 | 15 105 tokens/s | 15 810 tokens/s |
| Llama 3.1 70B | 2048 / 2048 | 8 239 tokens/s | 8 245 tokens/s |
| Llama 3.1 405B | 128 / 2048 | 4 065 tokens/s | 3 265 tokens/s |
| Llama 3.1 405B | 128 / 4096 | 3 171 tokens/s | 1 957 tokens/s |
En Llama 3.1 70B, H100 es ligeramente más rápido o los resultados son prácticamente iguales. En Llama 3.1 405B, MI300X toma la delantera, especialmente en generación larga.
Estos resultados son publicados por AMD, por lo que es más correcto considerarlos como una comparación de configuraciones bien optimizadas, no como una clasificación universal independiente.
La ventaja de MI300X depende de la naturaleza de la carga de trabajo. Cuanto más esté limitada la performance por la memoria, más notable será la ventaja de 192 GB HBM3 y un ancho de banda de 5,3 TB/s.
Alto rendimiento en FP64
MI300X está diseñado no solo para IA, sino también para HPC.
El rendimiento máximo en FP64 alcanza 81,7 TFLOPS para operaciones vectoriales y 163,4 TFLOPS para operaciones matriciales.
Tal rendimiento es requerido en hidrodinámica computacional, modelado climático y físico, dinámica molecular, geofísica y otros cálculos científicos.
Para HPC, una alta velocidad en FP64 es una de las prioridades arquitectónicas de MI300X, no una capacidad secundaria.
Ocho MI300X - 1,5 TB HBM3
En un sistema de ocho MI300X, se dispone de 1 536 GB HBM3, es decir, alrededor de 1,5 TB de memoria directamente en los aceleradores.
Este volumen permite albergar grandes modelos dentro de un único servidor en lugar de distribuirlos entre varios nodos.
MI300X se presenta en formato OAM y se instala en plataformas de servidor Universal Base Board. Entre los aceleradores se utiliza Infinity Fabric.
Cada MI300X está equipado con siete canales de Infinity Fabric con un ancho de banda de hasta 128 GB/s cada uno. La conexión con el procesador se realiza a través de PCIe 5.0 x16.
Hasta 750 W por acelerador
El consumo máximo de TBP para MI300X es de 750 W.
El factor de forma OAM y este nivel de consumo energético excluyen el uso de MI300X en estaciones de trabajo convencionales. El módulo no cuenta con refrigeración activa propia; el flujo de aire necesario es proporcionado por la plataforma del servidor.
Ocho MI300X pueden consumir hasta 6 kW solo en aceleradores, sin contar CPU, memoria, almacenamiento y equipos de red.
ROCm - la principal limitación de MI300X
El hardware de MI300X es competitivo, pero para un acelerador de servidor, el ecosistema de software es igualmente importante.
AMD está desarrollando ROCm, que soporta PyTorch, TensorFlow, JAX, Triton y otras herramientas. Con el lanzamiento de MI300X, la empresa amplió el soporte para modernos marcos de IA y optimizaciones para grandes modelos.
CUDA, a su vez, sigue siendo una de las mayores ventajas de NVIDIA. Muchas bibliotecas y pilas computacionales empresariales fueron creadas originalmente para ella.
Por lo tanto, la elección entre MI300X y H100 no puede reducirse únicamente a TFLOPS o a la cantidad de memoria. Si una carga de trabajo ya funciona en ROCm, las diferencias en la parte de hardware se vuelven más importantes, especialmente el volumen de HBM y su ancho de banda.
Contexto oculto de la línea
Con la generación MI300, la línea Instinct se ha desplazado notablemente de las cargas de HPC a la IA generativa.
| Serie | Arquitectura | Año de aparición de la arquitectura |
|---|---|---|
| Instinct MI100 | CDNA | 2020 |
| Instinct MI200 | CDNA 2 | 2021 |
| Instinct MI300 | CDNA 3 | 2023 |
| Instinct MI350 | CDNA 4 | 2025 |
MI100 fue el primer acelerador de AMD en CDNA. MI200 avanzó en la dirección de HPC y se utilizó en sistemas exa-flop.
En MI300, la arquitectura CDNA 3 ha incorporado FP8, núcleos matriciales más potentes y una orientación más marcada hacia redes neuronales.
El próximo MI325X mantuvo CDNA 3, pero obtuvo más memoria y un ancho de banda más alto. La transición a una nueva arquitectura ocurrió ya en la serie MI350 con CDNA 4.
MI300X se convirtió en el primer Instinct que AMD comenzó a posicionar directamente contra los principales aceleradores de IA de NVIDIA.
Conclusión
La principal ventaja de MI300X es 192 GB HBM3 con un ancho de banda de 5,3 TB/s. Junto con su alto rendimiento en FP64 y cálculos matriciales, esto hace que el acelerador sea especialmente adecuado para grandes LLM y HPC.
En LLM de tamaño medio, H100 puede ser más rápido o mostrar resultados comparables. En modelos más grandes, la ventaja de MI300X en términos de volumen y ancho de banda de memoria se vuelve más notable.
La principal limitación sigue siendo del software: CUDA, por la madurez de su ecosistema, aún le otorga a NVIDIA una ventaja significativa.
MI300X ya no es el acelerador más nuevo de AMD, pero se convirtió en el primer modelo de la compañía que puede posicionarse seriamente junto al H100 en grandes sistemas de IA.
Básico
Especificaciones de Memoria
Rendimiento teórico
Misceláneos
Clasificaciones
Comparado con Otras GPU
Comparaciones de GPU relacionadas
Compartir en redes sociales
O Enlázanos
<a href="https://cputronic.com/es/gpu/amd-instinct-mi300x" target="_blank">AMD Instinct MI300X</a>