AMD Instinct MI300X

AMD Instinct MI300X
Обзор видеокарты AMD Instinct MI300X

AMD Instinct MI300X: 192 ГБ HBM3 и ставка AMD на большие AI-модели

Главные особенности AMD Instinct MI300X - 192 ГБ HBM3 и пропускная способность памяти 5,3 ТБ/с. Это серверный ускоритель для крупных ИИ-моделей и HPC, где важны объём и скорость памяти, матричные вычисления и высокая производительность FP64.

MI300X стал первым ускорителем AMD, который всерьёз начал конкурировать с NVIDIA H100 в крупных AI-системах. Но его преимущество проявляется не во всех нагрузках одинаково.

CDNA 3: архитектура для AI и HPC

В основе MI300X лежит CDNA 3 - вычислительная архитектура AMD для дата-центров. Она не рассчитана на игровую графику и оптимизирована для матричных операций, FP64, FP8/BF16, HBM и масштабирования нескольких ускорителей.

MI300X содержит 304 Compute Unit, 1216 Matrix Core и 19 456 потоковых процессоров. Пиковая частота достигает 2,1 ГГц. Восемь вычислительных XCD объединены в одном модуле, а общее количество транзисторов достигает 153 млрд.

Для разных форматов вычислений AMD указывает следующие пиковые показатели:

Формат вычислений Пиковая производительность
FP8 2,61 PFLOPS
FP8 со структурной разреженностью 5,22 PFLOPS
BF16 1,30 PFLOPS
FP16 1,30 PFLOPS
TF32 Matrix 653,7 TFLOPS
FP32 163,4 TFLOPS
FP64 Matrix 163,4 TFLOPS
FP64 Vector 81,7 TFLOPS

Сравнивать эти показатели с игровыми GPU напрямую некорректно: MI300X ориентирован на AI и HPC, а не на растеризацию и игровые нагрузки.

192 ГБ HBM3 - главное преимущество MI300X

Ускоритель получил 192 ГБ HBM3 на 8192-битной шине с пропускной способностью 5,3 ТБ/с. Объём Infinity Cache составляет 256 МБ.

По объёму и пропускной способности памяти MI300X превосходит H100 и H200:

Ускоритель Память Пропускная способность
AMD Instinct MI300X 192 ГБ HBM3 5,3 ТБ/с
NVIDIA H100 SXM 80 ГБ HBM3 3,35 ТБ/с
NVIDIA H200 SXM 141 ГБ HBM3E 4,8 ТБ/с

Для больших языковых моделей объём HBM влияет на количество ускорителей, необходимое для размещения весов модели и промежуточных данных. Чем меньше GPU требуется для размещения модели, тем меньше данных приходится передавать между ускорителями во время инференса.

В MLPerf Inference v4.1 один MI300X смог разместить Llama 2 70B целиком в памяти одного ускорителя. В конфигурации с восемью GPU результаты MI300X в режимах Server и Offline были близки к системе с восемью H100.

Производительность на крупных LLM

На моделях меньшего размера большой объём памяти сам по себе не гарантирует лидерства.

В опубликованных AMD тестах Llama 3.1 использовались системы с восемью MI300X и восемью H100:

Модель, FP8 Input / Output 8× MI300X 8× H100
Llama 3.1 70B 128 / 2048 15 105 ток/с 15 810 ток/с
Llama 3.1 70B 2048 / 2048 8 239 ток/с 8 245 ток/с
Llama 3.1 405B 128 / 2048 4 065 ток/с 3 265 ток/с
Llama 3.1 405B 128 / 4096 3 171 ток/с 1 957 ток/с

На Llama 3.1 70B H100 немного быстрее либо результаты практически совпадают. На Llama 3.1 405B MI300X выходит вперёд, особенно при длинной генерации.

Эти результаты опубликованы AMD, поэтому их правильнее рассматривать как сравнение хорошо оптимизированных конфигураций, а не как независимый универсальный рейтинг.

Преимущество MI300X зависит от характера нагрузки. Чем сильнее производительность ограничена памятью, тем заметнее преимущество 192 ГБ HBM3 и пропускной способности 5,3 ТБ/с.

Высокая производительность FP64

MI300X рассчитан не только на AI, но и на HPC.

Пиковая производительность FP64 достигает 81,7 TFLOPS для векторных операций и 163,4 TFLOPS для матричных.

Такая производительность востребована в вычислительной гидродинамике, климатическом и физическом моделировании, молекулярной динамике, геофизике и других научных расчётах.

Для HPC высокая скорость FP64 является одним из архитектурных приоритетов MI300X, а не второстепенной возможностью.

Восемь MI300X - это 1,5 ТБ HBM3

В системе из восьми MI300X доступно 1 536 ГБ HBM3, то есть около 1,5 ТБ памяти непосредственно на ускорителях.

Такой объём позволяет размещать крупные модели внутри одного сервера вместо распределения между несколькими узлами.

MI300X выпускается в формате OAM и устанавливается на серверные платформы Universal Base Board. Между ускорителями используется Infinity Fabric.

Каждый MI300X оснащён семью каналами Infinity Fabric с пропускной способностью до 128 ГБ/с каждый. С процессором система соединяется через PCIe 5.0 x16.

До 750 Вт на один ускоритель

Максимальный TBP MI300X составляет 750 Вт.

Форм-фактор OAM и такой уровень энергопотребления исключают использование MI300X в обычных рабочих станциях. Собственного активного охлаждения у модуля нет - необходимый воздушный поток обеспечивает серверная платформа.

Восемь MI300X дают до 6 кВт потребления только на ускорители, без учёта CPU, памяти, накопителей и сетевого оборудования.

ROCm - главное ограничение MI300X

Аппаратная часть MI300X конкурентоспособна, но для серверного ускорителя программная экосистема не менее важна.

AMD развивает ROCm, который поддерживает PyTorch, TensorFlow, JAX, Triton и другие инструменты. С выходом MI300X компания расширила поддержку современных AI-фреймворков и оптимизации для крупных моделей.

CUDA при этом остаётся одним из сильнейших преимуществ NVIDIA. Многие библиотеки и корпоративные вычислительные стеки изначально создавались именно под неё.

Поэтому выбор между MI300X и H100 нельзя сводить только к TFLOPS или объёму памяти. Если нагрузка уже работает в ROCm, различия в аппаратной части становятся важнее - прежде всего объём HBM и её пропускная способность.

Скрытый контекст линейки

С поколением MI300 линейка Instinct заметно сместилась от преимущественно HPC-нагрузок к генеративному AI.

Серия Архитектура Год появления архитектуры
Instinct MI100 CDNA 2020
Instinct MI200 CDNA 2 2021
Instinct MI300 CDNA 3 2023
Instinct MI350 CDNA 4 2025

MI100 стал первым ускорителем AMD на CDNA. MI200 развил направление HPC и использовался в экзафлопсных системах.

В MI300 архитектура CDNA 3 получила FP8, более мощные Matrix Core и более выраженную ориентацию на нейросети.

Следующий MI325X сохранил CDNA 3, но получил больше памяти и более высокую пропускную способность. Переход на новую архитектуру произошёл уже в MI350 Series с CDNA 4.

MI300X стал первым Instinct, который AMD начала позиционировать непосредственно против ведущих AI-ускорителей NVIDIA.

Итог

Главное преимущество MI300X - 192 ГБ HBM3 с пропускной способностью 5,3 ТБ/с. Вместе с высокой производительностью FP64 и матричных вычислений это делает ускоритель особенно подходящим для крупных LLM и HPC.

На LLM среднего размера H100 может быть быстрее или показывать сопоставимый результат. На более крупных моделях преимущество MI300X по объёму и пропускной способности памяти становится заметнее.

Главное ограничение остаётся программным: CUDA по зрелости экосистемы всё ещё даёт NVIDIA серьёзное преимущество.

MI300X уже не является самым новым ускорителем AMD, но именно он стал первой моделью компании, которую можно было всерьёз ставить рядом с H100 в крупных AI-системах.

Общая информация

Производитель
AMD
Платформа
Professional
Дата выпуска
December 2023
GPU Lithography
TSMC 5 nm / 6 nm FinFET
Название модели
Instinct MI300X
Поколение
Instinct MI300 Series
Boost Частота
2100MHz
Интерфейс шины
PCIe 5.0 x16
Транзисторы
153 billion
Вычислительные юниты
304
Архитектура
CDNA 3

Характеристики памяти

Объем памяти
192GB
Тип памяти
HBM3
Шина памяти
?
Ширина шины памяти обозначает количество бит данных, которые видеопамять может передать за один такт. Чем больше ширина шины, тем больший объем данных может быть передан мгновенно, что делает ее одним из важнейших параметров видеопамяти. Пропускная способность памяти рассчитывается как: Пропускная способность памяти = Частота памяти x Ширина шины памяти / 8. Следовательно, если частоты памяти одинаковы, ширина шины памяти будет определять размер пропускной способности памяти.
8192bit
Частота памяти
5200MHz
Пропускная способность
?
Пропускная способность памяти — это скорость передачи данных между графическим чипом и видеопамятью. Он измеряется в байтах в секунду, и формула для его расчета: пропускная способность памяти = рабочая частота × ширина шины памяти / 8 бит.
5300 GB/s

Теоретическая производительность

FP16 (half)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность. Числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики, а числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности.
1300 TFLOPS
FP64 (double)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности, а числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность.
81.7 TFLOPS
FP32 (float)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики, а числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность.
163.4 TFLOPS

Другое

Блоки шейдинга
?
Самым фундаментальным процессором является потоковый процессор (SP), в котором выполняются определенные инструкции и задачи. Графические процессоры выполняют параллельные вычисления, что означает, что несколько процессоров SP работают одновременно для обработки задач.
19456
TDP
750W

Бенчмарки

FP32 (float)
163.4 TFLOPS

По сравнению с другими GPU

FP32 (float) / TFLOPS
166.668
106.896 -35.9%
91.042 -45.4%
80.086 -51.9%
66.228 -60.3%