AMD Instinct MI300X

AMD Instinct MI300X
Análise da placa de vídeo AMD Instinct MI300X

AMD Instinct MI300X: 192 GB HBM3 e a aposta da AMD em grandes modelos de IA

Principais características do AMD Instinct MI300X: 192 GB HBM3 e largura de banda de memória de 5,3 TB/s. Este é um acelerador de servidor projetado para grandes modelos de IA e HPC, onde o volume e a velocidade da memória, os cálculos matriciais e o alto desempenho FP64 são essenciais.

O MI300X se tornou o primeiro acelerador da AMD a competir seriamente com o NVIDIA H100 em grandes sistemas de IA. No entanto, sua vantagem se manifesta de maneira diferente em várias cargas de trabalho.

CDNA 3: arquitetura para IA e HPC

Na base do MI300X está a CDNA 3 - arquitetura de computação da AMD para data centers. Ela não é destinada a gráficos de jogos e é otimizada para operações matriciais, FP64, FP8/BF16, HBM e escalabilidade de múltiplos aceleradores.

O MI300X contém 304 Unidades de Cálculo, 1216 Núcleos Matriciais e 19.456 processadores de fluxo. A frequência de pico alcança 2,1 GHz. Oito XCDs de computação estão combinados em um único módulo, e o número total de transistores atinge 153 bilhões.

Para diferentes formatos de cálculos, a AMD menciona os seguintes desempenhos máximos:

Formato de Cálculo Desempenho Máximo
FP8 2,61 PFLOPS
FP8 com esparsidade estrutural 5,22 PFLOPS
BF16 1,30 PFLOPS
FP16 1,30 PFLOPS
TF32 Matriz 653,7 TFLOPS
FP32 163,4 TFLOPS
FP64 Matriz 163,4 TFLOPS
FP64 Vetor 81,7 TFLOPS

Comparar esses números com GPUs para jogos diretamente não é apropriado: o MI300X é voltado para IA e HPC, não para rasterização e cargas de trabalho de jogos.

192 GB HBM3 - a principal vantagem do MI300X

O acelerador possui 192 GB HBM3 em um barramento de 8192 bits com largura de banda de 5,3 TB/s. O volume da Infinity Cache é de 256 MB.

Em termos de volume e largura de banda de memória, o MI300X supera o H100 e o H200:

Acelerador Memória Largura de Banda
AMD Instinct MI300X 192 GB HBM3 5,3 TB/s
NVIDIA H100 SXM 80 GB HBM3 3,35 TB/s
NVIDIA H200 SXM 141 GB HBM3E 4,8 TB/s

Para grandes modelos de linguagem, o volume de HBM impacta a quantidade de aceleradores necessária para armazenar os pesos do modelo e os dados intermediários. Quanto menos GPUs forem necessárias para alocar o modelo, menos dados precisam ser transferidos entre os aceleradores durante a inferência.

No MLPerf Inference v4.1, um MI300X conseguiu alocar Llama 2 70B completamente na memória de um único acelerador. Na configuração com oito GPUs, os resultados do MI300X nos modos Server e Offline foram próximos aos de um sistema com oito H100.

Desempenho em grandes LLM

Em modelos menores, grande volume de memória por si só não garante liderança.

Nos testes publicados pela AMD, o Llama 3.1 foi executado em sistemas com oito MI300X e oito H100:

Modelo, FP8 Input / Output 8× MI300X 8× H100
Llama 3.1 70B 128 / 2048 15 105 tokens/s 15 810 tokens/s
Llama 3.1 70B 2048 / 2048 8 239 tokens/s 8 245 tokens/s
Llama 3.1 405B 128 / 2048 4 065 tokens/s 3 265 tokens/s
Llama 3.1 405B 128 / 4096 3 171 tokens/s 1 957 tokens/s

No Llama 3.1 70B, o H100 é ligeiramente mais rápido ou os resultados são praticamente iguais. No Llama 3.1 405B, o MI300X assume a liderança, especialmente durante a geração longa.

Esses resultados foram publicados pela AMD, portanto, é mais apropriado considerá-los como comparações de configurações bem otimizadas, e não como um ranking universal independente.

A vantagem do MI300X depende da natureza da carga de trabalho. Quanto mais a performance estiver limitada pela memória, mais evidente será a vantagem de 192 GB HBM3 e largura de banda de 5,3 TB/s.

Alto desempenho FP64

O MI300X é projetado não apenas para IA, mas também para HPC.

O desempenho pico em FP64 é de 81,7 TFLOPS para operações vetoriais e 163,4 TFLOPS para operações matriciais.

Esse tipo de desempenho é demandado em hidrodinâmica computacional, modelagem climática e física, dinâmica molecular, geofísica e outros cálculos científicos.

Para HPC, a alta velocidade em FP64 é uma das prioridades arquitetônicas do MI300X, em vez de uma capacidade secundária.

Oito MI300X equivalem a 1,5 TB HBM3

Em um sistema com oito MI300X, está disponível 1 536 GB HBM3, ou seja, cerca de 1,5 TB de memória diretamente nos aceleradores.

Esse volume permite alocar modelos grandes dentro de um único servidor em vez de distribuí-los entre vários nós.

O MI300X é fabricado no formato OAM e instalado em plataformas de servidor Universal Base Board. Entre os aceleradores, utiliza-se o Infinity Fabric.

Cada MI300X é equipado com sete canais de Infinity Fabric com largura de banda de até 128 GB/s cada. A conexão com o processador é feita por meio de PCIe 5.0 x16.

Até 750 W por acelerador

O TBP máximo do MI300X é de 750 W.

O formato OAM e esse nível de consumo de energia excluem o uso do MI300X em estações de trabalho convencionais. O módulo não possui refrigeração ativa própria - o fluxo de ar necessário é garantido pela plataforma do servidor.

Oito MI300X consomem até 6 kW apenas para os aceleradores, sem contar CPU, memória, armazenamento e equipamentos de rede.

ROCm - a principal limitação do MI300X

O hardware do MI300X é competitivo, mas para um acelerador de servidor, o ecossistema de software é igualmente importante.

A AMD desenvolve o ROCm, que suporta PyTorch, TensorFlow, JAX, Triton e outras ferramentas. Com o lançamento do MI300X, a empresa expandiu o suporte a frameworks de IA modernos e otimizações para grandes modelos.

O CUDA, por sua vez, continua a ser uma das maiores vantagens da NVIDIA. Muitas bibliotecas e pilhas de computação corporativa foram inicialmente criadas para ela.

Portanto, a escolha entre o MI300X e o H100 não pode ser reduzia apenas a TFLOPS ou volume de memória. Se a carga de trabalho já opera no ROCm, as diferenças de hardware se tornam mais importantes - principalmente o volume de HBM e sua largura de banda.

Contexto oculto da linha

Com a geração MI300, a linha Instinct mudou significativamente de cargas predominantemente de HPC para IA generativa.

Série Arquitetura Ano de Introdução da Arquitetura
Instinct MI100 CDNA 2020
Instinct MI200 CDNA 2 2021
Instinct MI300 CDNA 3 2023
Instinct MI350 CDNA 4 2025

O MI100 foi o primeiro acelerador da AMD na arquitetura CDNA. O MI200 desenvolveu a direção de HPC e foi utilizado em sistemas exaFLOPS.

Na arquitetura MI300, a CDNA 3 obteve FP8, Núcleos Matriciais mais robustos e uma ênfase mais notável em redes neurais.

O próximo MI325X manteve a CDNA 3, mas obteve mais memória e uma largura de banda mais alta. A transição para uma nova arquitetura ocorreu já na série MI350 com a CDNA 4.

O MI300X foi o primeiro Instinct que a AMD começou a posicionar diretamente contra os principais aceleradores de IA da NVIDIA.

Conclusão

A principal vantagem do MI300X é 192 GB HBM3 com largura de banda de 5,3 TB/s. Juntamente com um alto desempenho em FP64 e cálculos matriciais, isso torna o acelerador especialmente adequado para grandes LLM e HPC.

Em LLMs de tamanho médio, o H100 pode ser mais rápido ou apresentar resultados comparáveis. Em modelos maiores, a vantagem do MI300X em volume e largura de banda de memória se torna mais evidente.

A principal limitação continua sendo de software: o CUDA, pela maturidade do ecossistema, ainda proporciona à NVIDIA uma vantagem considerável.

O MI300X já não é o acelerador mais novo da AMD, mas foi o primeiro modelo da empresa que poderia ser realmente comparado com o H100 em grandes sistemas de IA.

Básico

Nome do rótulo
AMD
Plataforma
Professional
Data de lançamento
December 2023
GPU Lithography
TSMC 5 nm / 6 nm FinFET
Nome do modelo
Instinct MI300X
Geração
Instinct MI300 Series
Relógio Boost
2100MHz
Interface de ônibus
PCIe 5.0 x16
Transistores
153 billion
Unidades de Cálculo
304
Arquitetura
CDNA 3

Especificações de memória

Tamanho da Memória
192GB
Tipo de Memória
HBM3
Barramento de Memória
?
A largura do barramento de memória se refere ao número de bits de dados que a memória de vídeo pode transferir em um ciclo de clock. Quanto maior a largura do barramento, maior a quantidade de dados que pode ser transmitida instantaneamente.
8192bit
Relógio de Memória
5200MHz
Largura de Banda
?
A largura de banda da memória se refere à taxa de transferência de dados entre o chip gráfico e a memória de vídeo. É medida em bytes por segundo.
5300 GB/s

Desempenho Teórico

FP16 (metade)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de meia precisão (16 bits) são usados em aplicações como aprendizado de máquina.
1300 TFLOPS
FP64 (duplo)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de precisão dupla (64 bits) são necessários para computação científica.
81.7 TFLOPS
FP32 (flutuante)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de precisão simples (32 bits) são usados para tarefas comuns de processamento multimídia e gráfico, enquanto números de ponto flutuante de precisão dupla (64 bits) são necessários para computação científica que exige uma ampla faixa numérica e alta precisão. Números de ponto flutuante de meia precisão (16 bits) são usados para aplicações como aprendizado de máquina, onde uma precisão menor é aceitável.
163.4 TFLOPS

Diversos

Unidades de Sombreamento
?
A unidade de processamento mais fundamental é o Processador de Streaming (SP), onde instruções e tarefas específicas são executadas. GPUs realizam computação paralela.
19456
TDP
750W

Classificações

FP32 (flutuante)
Pontuação
163.4 TFLOPS

Comparado com outra GPU

FP32 (flutuante) / TFLOPS
105.525 -35.4%
90.219 -44.8%
79.478 -51.4%
65.572 -59.9%