AMD Instinct MI300X
AMD Instinct MI300X: 192 GB HBM3 e a aposta da AMD em grandes modelos de IA
Principais características do AMD Instinct MI300X: 192 GB HBM3 e largura de banda de memória de 5,3 TB/s. Este é um acelerador de servidor projetado para grandes modelos de IA e HPC, onde o volume e a velocidade da memória, os cálculos matriciais e o alto desempenho FP64 são essenciais.
O MI300X se tornou o primeiro acelerador da AMD a competir seriamente com o NVIDIA H100 em grandes sistemas de IA. No entanto, sua vantagem se manifesta de maneira diferente em várias cargas de trabalho.
CDNA 3: arquitetura para IA e HPC
Na base do MI300X está a CDNA 3 - arquitetura de computação da AMD para data centers. Ela não é destinada a gráficos de jogos e é otimizada para operações matriciais, FP64, FP8/BF16, HBM e escalabilidade de múltiplos aceleradores.
O MI300X contém 304 Unidades de Cálculo, 1216 Núcleos Matriciais e 19.456 processadores de fluxo. A frequência de pico alcança 2,1 GHz. Oito XCDs de computação estão combinados em um único módulo, e o número total de transistores atinge 153 bilhões.
Para diferentes formatos de cálculos, a AMD menciona os seguintes desempenhos máximos:
| Formato de Cálculo | Desempenho Máximo |
|---|---|
| FP8 | 2,61 PFLOPS |
| FP8 com esparsidade estrutural | 5,22 PFLOPS |
| BF16 | 1,30 PFLOPS |
| FP16 | 1,30 PFLOPS |
| TF32 Matriz | 653,7 TFLOPS |
| FP32 | 163,4 TFLOPS |
| FP64 Matriz | 163,4 TFLOPS |
| FP64 Vetor | 81,7 TFLOPS |
Comparar esses números com GPUs para jogos diretamente não é apropriado: o MI300X é voltado para IA e HPC, não para rasterização e cargas de trabalho de jogos.
192 GB HBM3 - a principal vantagem do MI300X
O acelerador possui 192 GB HBM3 em um barramento de 8192 bits com largura de banda de 5,3 TB/s. O volume da Infinity Cache é de 256 MB.
Em termos de volume e largura de banda de memória, o MI300X supera o H100 e o H200:
| Acelerador | Memória | Largura de Banda |
|---|---|---|
| AMD Instinct MI300X | 192 GB HBM3 | 5,3 TB/s |
| NVIDIA H100 SXM | 80 GB HBM3 | 3,35 TB/s |
| NVIDIA H200 SXM | 141 GB HBM3E | 4,8 TB/s |
Para grandes modelos de linguagem, o volume de HBM impacta a quantidade de aceleradores necessária para armazenar os pesos do modelo e os dados intermediários. Quanto menos GPUs forem necessárias para alocar o modelo, menos dados precisam ser transferidos entre os aceleradores durante a inferência.
No MLPerf Inference v4.1, um MI300X conseguiu alocar Llama 2 70B completamente na memória de um único acelerador. Na configuração com oito GPUs, os resultados do MI300X nos modos Server e Offline foram próximos aos de um sistema com oito H100.
Desempenho em grandes LLM
Em modelos menores, grande volume de memória por si só não garante liderança.
Nos testes publicados pela AMD, o Llama 3.1 foi executado em sistemas com oito MI300X e oito H100:
| Modelo, FP8 | Input / Output | 8× MI300X | 8× H100 |
|---|---|---|---|
| Llama 3.1 70B | 128 / 2048 | 15 105 tokens/s | 15 810 tokens/s |
| Llama 3.1 70B | 2048 / 2048 | 8 239 tokens/s | 8 245 tokens/s |
| Llama 3.1 405B | 128 / 2048 | 4 065 tokens/s | 3 265 tokens/s |
| Llama 3.1 405B | 128 / 4096 | 3 171 tokens/s | 1 957 tokens/s |
No Llama 3.1 70B, o H100 é ligeiramente mais rápido ou os resultados são praticamente iguais. No Llama 3.1 405B, o MI300X assume a liderança, especialmente durante a geração longa.
Esses resultados foram publicados pela AMD, portanto, é mais apropriado considerá-los como comparações de configurações bem otimizadas, e não como um ranking universal independente.
A vantagem do MI300X depende da natureza da carga de trabalho. Quanto mais a performance estiver limitada pela memória, mais evidente será a vantagem de 192 GB HBM3 e largura de banda de 5,3 TB/s.
Alto desempenho FP64
O MI300X é projetado não apenas para IA, mas também para HPC.
O desempenho pico em FP64 é de 81,7 TFLOPS para operações vetoriais e 163,4 TFLOPS para operações matriciais.
Esse tipo de desempenho é demandado em hidrodinâmica computacional, modelagem climática e física, dinâmica molecular, geofísica e outros cálculos científicos.
Para HPC, a alta velocidade em FP64 é uma das prioridades arquitetônicas do MI300X, em vez de uma capacidade secundária.
Oito MI300X equivalem a 1,5 TB HBM3
Em um sistema com oito MI300X, está disponível 1 536 GB HBM3, ou seja, cerca de 1,5 TB de memória diretamente nos aceleradores.
Esse volume permite alocar modelos grandes dentro de um único servidor em vez de distribuí-los entre vários nós.
O MI300X é fabricado no formato OAM e instalado em plataformas de servidor Universal Base Board. Entre os aceleradores, utiliza-se o Infinity Fabric.
Cada MI300X é equipado com sete canais de Infinity Fabric com largura de banda de até 128 GB/s cada. A conexão com o processador é feita por meio de PCIe 5.0 x16.
Até 750 W por acelerador
O TBP máximo do MI300X é de 750 W.
O formato OAM e esse nível de consumo de energia excluem o uso do MI300X em estações de trabalho convencionais. O módulo não possui refrigeração ativa própria - o fluxo de ar necessário é garantido pela plataforma do servidor.
Oito MI300X consomem até 6 kW apenas para os aceleradores, sem contar CPU, memória, armazenamento e equipamentos de rede.
ROCm - a principal limitação do MI300X
O hardware do MI300X é competitivo, mas para um acelerador de servidor, o ecossistema de software é igualmente importante.
A AMD desenvolve o ROCm, que suporta PyTorch, TensorFlow, JAX, Triton e outras ferramentas. Com o lançamento do MI300X, a empresa expandiu o suporte a frameworks de IA modernos e otimizações para grandes modelos.
O CUDA, por sua vez, continua a ser uma das maiores vantagens da NVIDIA. Muitas bibliotecas e pilhas de computação corporativa foram inicialmente criadas para ela.
Portanto, a escolha entre o MI300X e o H100 não pode ser reduzia apenas a TFLOPS ou volume de memória. Se a carga de trabalho já opera no ROCm, as diferenças de hardware se tornam mais importantes - principalmente o volume de HBM e sua largura de banda.
Contexto oculto da linha
Com a geração MI300, a linha Instinct mudou significativamente de cargas predominantemente de HPC para IA generativa.
| Série | Arquitetura | Ano de Introdução da Arquitetura |
|---|---|---|
| Instinct MI100 | CDNA | 2020 |
| Instinct MI200 | CDNA 2 | 2021 |
| Instinct MI300 | CDNA 3 | 2023 |
| Instinct MI350 | CDNA 4 | 2025 |
O MI100 foi o primeiro acelerador da AMD na arquitetura CDNA. O MI200 desenvolveu a direção de HPC e foi utilizado em sistemas exaFLOPS.
Na arquitetura MI300, a CDNA 3 obteve FP8, Núcleos Matriciais mais robustos e uma ênfase mais notável em redes neurais.
O próximo MI325X manteve a CDNA 3, mas obteve mais memória e uma largura de banda mais alta. A transição para uma nova arquitetura ocorreu já na série MI350 com a CDNA 4.
O MI300X foi o primeiro Instinct que a AMD começou a posicionar diretamente contra os principais aceleradores de IA da NVIDIA.
Conclusão
A principal vantagem do MI300X é 192 GB HBM3 com largura de banda de 5,3 TB/s. Juntamente com um alto desempenho em FP64 e cálculos matriciais, isso torna o acelerador especialmente adequado para grandes LLM e HPC.
Em LLMs de tamanho médio, o H100 pode ser mais rápido ou apresentar resultados comparáveis. Em modelos maiores, a vantagem do MI300X em volume e largura de banda de memória se torna mais evidente.
A principal limitação continua sendo de software: o CUDA, pela maturidade do ecossistema, ainda proporciona à NVIDIA uma vantagem considerável.
O MI300X já não é o acelerador mais novo da AMD, mas foi o primeiro modelo da empresa que poderia ser realmente comparado com o H100 em grandes sistemas de IA.
Básico
Especificações de memória
Desempenho Teórico
Diversos
Classificações
Comparado com outra GPU
Comparações de GPU relacionadas
Compartilhar nas redes sociais
Ou faça um link para nós
<a href="https://cputronic.com/pt/gpu/amd-instinct-mi300x" target="_blank">AMD Instinct MI300X</a>