AMD Instinct MI300X

AMD Instinct MI300X
Análisis de la tarjeta gráfica AMD Instinct MI300X

AMD Instinct MI300X: 192 GB HBM3 y la apuesta de AMD por grandes modelos de IA

Principales características de AMD Instinct MI300X: 192 GB HBM3 y un ancho de banda de memoria de 5,3 TB/s. Este es un acelerador de servidor para grandes modelos de IA y HPC, donde el volumen y la velocidad de la memoria, los cálculos matriciales y el alto rendimiento en FP64 son cruciales.

MI300X se convirtió en el primer acelerador de AMD que realmente comenzó a competir con el NVIDIA H100 en grandes sistemas de IA. Sin embargo, su ventaja no se manifiesta de igual manera en todas las cargas de trabajo.

CDNA 3: arquitectura para IA y HPC

En la base del MI300X se encuentra CDNA 3 - la arquitectura computacional de AMD para centros de datos. No está diseñada para gráficos de juegos y está optimizada para operaciones matriciales, FP64, FP8/BF16, HBM y escalamiento de múltiples aceleradores.

MI300X contiene 304 Unidades de Cómputo, 1216 Núcleos Matriciales y 19,456 Procesadores de Flujo. La frecuencia máxima alcanza los 2,1 GHz. Ocho unidades de cálculo XCD se combinan en un solo módulo, y el número total de transistores alcanza los 153 mil millones.

Para diferentes formatos de cálculo, AMD indica las siguientes cifras máximas:

Formato de cálculo Rendimiento máximo
FP8 2,61 PFLOPS
FP8 con esparcimiento estructural 5,22 PFLOPS
BF16 1,30 PFLOPS
FP16 1,30 PFLOPS
TF32 Matriz 653,7 TFLOPS
FP32 163,4 TFLOPS
FP64 Matriz 163,4 TFLOPS
FP64 Vector 81,7 TFLOPS

Comparar estas cifras con las de las GPU de juegos directamente no es correcto: MI300X está orientado a IA y HPC, no a rasterización y cargas de trabajo de juegos.

192 GB HBM3 - la principal ventaja de MI300X

El acelerador cuenta con 192 GB HBM3 en un bus de 8192 bits con un ancho de banda de 5,3 TB/s. El volumen de Infinity Cache es de 256 MB.

En términos de volumen y ancho de banda de memoria, MI300X supera al H100 y H200:

Acelerador Memoria Ancho de banda
AMD Instinct MI300X 192 GB HBM3 5,3 TB/s
NVIDIA H100 SXM 80 GB HBM3 3,35 TB/s
NVIDIA H200 SXM 141 GB HBM3E 4,8 TB/s

Para grandes modelos de lenguaje, el volumen de HBM influye en la cantidad de aceleradores necesarios para albergar los pesos del modelo y los datos intermedios. Cuanto menos GPU se requiera para alojar el modelo, menos datos tendrán que transferirse entre los aceleradores durante la inferencia.

En MLPerf Inference v4.1, un solo MI300X pudo albergar Llama 2 70B completamente en la memoria de un solo acelerador. En una configuración con ocho GPU, los resultados de MI300X en modos Server y Offline fueron similares a un sistema con ocho H100.

Rendimiento en grandes LLM

En modelos de menor tamaño, un gran volumen de memoria no garantiza por sí solo un desempeño superior.

En pruebas publicadas por AMD, Llama 3.1 utilizó sistemas con ocho MI300X y ocho H100:

Modelo, FP8 Entrada / Salida 8× MI300X 8× H100
Llama 3.1 70B 128 / 2048 15 105 tokens/s 15 810 tokens/s
Llama 3.1 70B 2048 / 2048 8 239 tokens/s 8 245 tokens/s
Llama 3.1 405B 128 / 2048 4 065 tokens/s 3 265 tokens/s
Llama 3.1 405B 128 / 4096 3 171 tokens/s 1 957 tokens/s

En Llama 3.1 70B, H100 es ligeramente más rápido o los resultados son prácticamente iguales. En Llama 3.1 405B, MI300X toma la delantera, especialmente en generación larga.

Estos resultados son publicados por AMD, por lo que es más correcto considerarlos como una comparación de configuraciones bien optimizadas, no como una clasificación universal independiente.

La ventaja de MI300X depende de la naturaleza de la carga de trabajo. Cuanto más esté limitada la performance por la memoria, más notable será la ventaja de 192 GB HBM3 y un ancho de banda de 5,3 TB/s.

Alto rendimiento en FP64

MI300X está diseñado no solo para IA, sino también para HPC.

El rendimiento máximo en FP64 alcanza 81,7 TFLOPS para operaciones vectoriales y 163,4 TFLOPS para operaciones matriciales.

Tal rendimiento es requerido en hidrodinámica computacional, modelado climático y físico, dinámica molecular, geofísica y otros cálculos científicos.

Para HPC, una alta velocidad en FP64 es una de las prioridades arquitectónicas de MI300X, no una capacidad secundaria.

Ocho MI300X - 1,5 TB HBM3

En un sistema de ocho MI300X, se dispone de 1 536 GB HBM3, es decir, alrededor de 1,5 TB de memoria directamente en los aceleradores.

Este volumen permite albergar grandes modelos dentro de un único servidor en lugar de distribuirlos entre varios nodos.

MI300X se presenta en formato OAM y se instala en plataformas de servidor Universal Base Board. Entre los aceleradores se utiliza Infinity Fabric.

Cada MI300X está equipado con siete canales de Infinity Fabric con un ancho de banda de hasta 128 GB/s cada uno. La conexión con el procesador se realiza a través de PCIe 5.0 x16.

Hasta 750 W por acelerador

El consumo máximo de TBP para MI300X es de 750 W.

El factor de forma OAM y este nivel de consumo energético excluyen el uso de MI300X en estaciones de trabajo convencionales. El módulo no cuenta con refrigeración activa propia; el flujo de aire necesario es proporcionado por la plataforma del servidor.

Ocho MI300X pueden consumir hasta 6 kW solo en aceleradores, sin contar CPU, memoria, almacenamiento y equipos de red.

ROCm - la principal limitación de MI300X

El hardware de MI300X es competitivo, pero para un acelerador de servidor, el ecosistema de software es igualmente importante.

AMD está desarrollando ROCm, que soporta PyTorch, TensorFlow, JAX, Triton y otras herramientas. Con el lanzamiento de MI300X, la empresa amplió el soporte para modernos marcos de IA y optimizaciones para grandes modelos.

CUDA, a su vez, sigue siendo una de las mayores ventajas de NVIDIA. Muchas bibliotecas y pilas computacionales empresariales fueron creadas originalmente para ella.

Por lo tanto, la elección entre MI300X y H100 no puede reducirse únicamente a TFLOPS o a la cantidad de memoria. Si una carga de trabajo ya funciona en ROCm, las diferencias en la parte de hardware se vuelven más importantes, especialmente el volumen de HBM y su ancho de banda.

Contexto oculto de la línea

Con la generación MI300, la línea Instinct se ha desplazado notablemente de las cargas de HPC a la IA generativa.

Serie Arquitectura Año de aparición de la arquitectura
Instinct MI100 CDNA 2020
Instinct MI200 CDNA 2 2021
Instinct MI300 CDNA 3 2023
Instinct MI350 CDNA 4 2025

MI100 fue el primer acelerador de AMD en CDNA. MI200 avanzó en la dirección de HPC y se utilizó en sistemas exa-flop.

En MI300, la arquitectura CDNA 3 ha incorporado FP8, núcleos matriciales más potentes y una orientación más marcada hacia redes neuronales.

El próximo MI325X mantuvo CDNA 3, pero obtuvo más memoria y un ancho de banda más alto. La transición a una nueva arquitectura ocurrió ya en la serie MI350 con CDNA 4.

MI300X se convirtió en el primer Instinct que AMD comenzó a posicionar directamente contra los principales aceleradores de IA de NVIDIA.

Conclusión

La principal ventaja de MI300X es 192 GB HBM3 con un ancho de banda de 5,3 TB/s. Junto con su alto rendimiento en FP64 y cálculos matriciales, esto hace que el acelerador sea especialmente adecuado para grandes LLM y HPC.

En LLM de tamaño medio, H100 puede ser más rápido o mostrar resultados comparables. En modelos más grandes, la ventaja de MI300X en términos de volumen y ancho de banda de memoria se vuelve más notable.

La principal limitación sigue siendo del software: CUDA, por la madurez de su ecosistema, aún le otorga a NVIDIA una ventaja significativa.

MI300X ya no es el acelerador más nuevo de AMD, pero se convirtió en el primer modelo de la compañía que puede posicionarse seriamente junto al H100 en grandes sistemas de IA.

Básico

Nombre de Etiqueta
AMD
Plataforma
Professional
Fecha de Lanzamiento
December 2023
GPU Lithography
TSMC 5 nm / 6 nm FinFET
Nombre del modelo
Instinct MI300X
Generación
Instinct MI300 Series
Reloj de impulso
2100MHz
Interfaz de bus
PCIe 5.0 x16
Transistores
153 billion
Unidades de cálculo
304
Arquitectura
CDNA 3

Especificaciones de Memoria

Tamaño de memoria
192GB
Tipo de memoria
HBM3
Bus de memoria
?
La anchura del bus de memoria se refiere al número de bits de datos que la memoria de video puede transferir en un solo ciclo de reloj. Cuanto mayor sea la anchura del bus, mayor será la cantidad de datos que se pueden transmitir instantáneamente, lo que lo convierte en uno de los parámetros cruciales de la memoria de video. El ancho de banda de memoria se calcula como: Ancho de banda de memoria = Frecuencia de memoria x Anchura de bus de memoria / 8. Por lo tanto, cuando las frecuencias de memoria son similares, la anchura del bus de memoria determinará el tamaño del ancho de banda de memoria.
8192bit
Reloj de memoria
5200MHz
Ancho de banda
?
La "ancho de banda de memoria" se refiere a la tasa de transferencia de datos entre el chip gráfico y la memoria de video. Se mide en bytes por segundo, y la fórmula para calcularlo es: ancho de banda de memoria = frecuencia de trabajo × ancho de bus de memoria / 8 bits.
5300 GB/s

Rendimiento teórico

FP16 (mitad)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
1300 TFLOPS
FP64 (doble)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
81.7 TFLOPS
FP32 (flotante)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
163.4 TFLOPS

Misceláneos

Unidades de sombreado
?
La unidad de procesamiento más fundamental es el Procesador de Secuencias (SP), donde se ejecutan instrucciones y tareas específicas. Las GPU realizan cómputo paralelo, lo que significa que varios SP trabajan simultáneamente para procesar tareas.
19456
TDP
750W

Clasificaciones

FP32 (flotante)
Puntaje
163.4 TFLOPS

Comparado con Otras GPU

FP32 (flotante) / TFLOPS
104.8 -35.9%
90.219 -44.8%
79.478 -51.4%
65.572 -59.9%