AMD Instinct MI300X
AMD Instinct MI300X: 192 ГБ HBM3 и ставка AMD на большие AI-модели
Главные особенности AMD Instinct MI300X - 192 ГБ HBM3 и пропускная способность памяти 5,3 ТБ/с. Это серверный ускоритель для крупных ИИ-моделей и HPC, где важны объём и скорость памяти, матричные вычисления и высокая производительность FP64.
MI300X стал первым ускорителем AMD, который всерьёз начал конкурировать с NVIDIA H100 в крупных AI-системах. Но его преимущество проявляется не во всех нагрузках одинаково.
CDNA 3: архитектура для AI и HPC
В основе MI300X лежит CDNA 3 - вычислительная архитектура AMD для дата-центров. Она не рассчитана на игровую графику и оптимизирована для матричных операций, FP64, FP8/BF16, HBM и масштабирования нескольких ускорителей.
MI300X содержит 304 Compute Unit, 1216 Matrix Core и 19 456 потоковых процессоров. Пиковая частота достигает 2,1 ГГц. Восемь вычислительных XCD объединены в одном модуле, а общее количество транзисторов достигает 153 млрд.
Для разных форматов вычислений AMD указывает следующие пиковые показатели:
| Формат вычислений | Пиковая производительность |
|---|---|
| FP8 | 2,61 PFLOPS |
| FP8 со структурной разреженностью | 5,22 PFLOPS |
| BF16 | 1,30 PFLOPS |
| FP16 | 1,30 PFLOPS |
| TF32 Matrix | 653,7 TFLOPS |
| FP32 | 163,4 TFLOPS |
| FP64 Matrix | 163,4 TFLOPS |
| FP64 Vector | 81,7 TFLOPS |
Сравнивать эти показатели с игровыми GPU напрямую некорректно: MI300X ориентирован на AI и HPC, а не на растеризацию и игровые нагрузки.
192 ГБ HBM3 - главное преимущество MI300X
Ускоритель получил 192 ГБ HBM3 на 8192-битной шине с пропускной способностью 5,3 ТБ/с. Объём Infinity Cache составляет 256 МБ.
По объёму и пропускной способности памяти MI300X превосходит H100 и H200:
| Ускоритель | Память | Пропускная способность |
|---|---|---|
| AMD Instinct MI300X | 192 ГБ HBM3 | 5,3 ТБ/с |
| NVIDIA H100 SXM | 80 ГБ HBM3 | 3,35 ТБ/с |
| NVIDIA H200 SXM | 141 ГБ HBM3E | 4,8 ТБ/с |
Для больших языковых моделей объём HBM влияет на количество ускорителей, необходимое для размещения весов модели и промежуточных данных. Чем меньше GPU требуется для размещения модели, тем меньше данных приходится передавать между ускорителями во время инференса.
В MLPerf Inference v4.1 один MI300X смог разместить Llama 2 70B целиком в памяти одного ускорителя. В конфигурации с восемью GPU результаты MI300X в режимах Server и Offline были близки к системе с восемью H100.
Производительность на крупных LLM
На моделях меньшего размера большой объём памяти сам по себе не гарантирует лидерства.
В опубликованных AMD тестах Llama 3.1 использовались системы с восемью MI300X и восемью H100:
| Модель, FP8 | Input / Output | 8× MI300X | 8× H100 |
|---|---|---|---|
| Llama 3.1 70B | 128 / 2048 | 15 105 ток/с | 15 810 ток/с |
| Llama 3.1 70B | 2048 / 2048 | 8 239 ток/с | 8 245 ток/с |
| Llama 3.1 405B | 128 / 2048 | 4 065 ток/с | 3 265 ток/с |
| Llama 3.1 405B | 128 / 4096 | 3 171 ток/с | 1 957 ток/с |
На Llama 3.1 70B H100 немного быстрее либо результаты практически совпадают. На Llama 3.1 405B MI300X выходит вперёд, особенно при длинной генерации.
Эти результаты опубликованы AMD, поэтому их правильнее рассматривать как сравнение хорошо оптимизированных конфигураций, а не как независимый универсальный рейтинг.
Преимущество MI300X зависит от характера нагрузки. Чем сильнее производительность ограничена памятью, тем заметнее преимущество 192 ГБ HBM3 и пропускной способности 5,3 ТБ/с.
Высокая производительность FP64
MI300X рассчитан не только на AI, но и на HPC.
Пиковая производительность FP64 достигает 81,7 TFLOPS для векторных операций и 163,4 TFLOPS для матричных.
Такая производительность востребована в вычислительной гидродинамике, климатическом и физическом моделировании, молекулярной динамике, геофизике и других научных расчётах.
Для HPC высокая скорость FP64 является одним из архитектурных приоритетов MI300X, а не второстепенной возможностью.
Восемь MI300X - это 1,5 ТБ HBM3
В системе из восьми MI300X доступно 1 536 ГБ HBM3, то есть около 1,5 ТБ памяти непосредственно на ускорителях.
Такой объём позволяет размещать крупные модели внутри одного сервера вместо распределения между несколькими узлами.
MI300X выпускается в формате OAM и устанавливается на серверные платформы Universal Base Board. Между ускорителями используется Infinity Fabric.
Каждый MI300X оснащён семью каналами Infinity Fabric с пропускной способностью до 128 ГБ/с каждый. С процессором система соединяется через PCIe 5.0 x16.
До 750 Вт на один ускоритель
Максимальный TBP MI300X составляет 750 Вт.
Форм-фактор OAM и такой уровень энергопотребления исключают использование MI300X в обычных рабочих станциях. Собственного активного охлаждения у модуля нет - необходимый воздушный поток обеспечивает серверная платформа.
Восемь MI300X дают до 6 кВт потребления только на ускорители, без учёта CPU, памяти, накопителей и сетевого оборудования.
ROCm - главное ограничение MI300X
Аппаратная часть MI300X конкурентоспособна, но для серверного ускорителя программная экосистема не менее важна.
AMD развивает ROCm, который поддерживает PyTorch, TensorFlow, JAX, Triton и другие инструменты. С выходом MI300X компания расширила поддержку современных AI-фреймворков и оптимизации для крупных моделей.
CUDA при этом остаётся одним из сильнейших преимуществ NVIDIA. Многие библиотеки и корпоративные вычислительные стеки изначально создавались именно под неё.
Поэтому выбор между MI300X и H100 нельзя сводить только к TFLOPS или объёму памяти. Если нагрузка уже работает в ROCm, различия в аппаратной части становятся важнее - прежде всего объём HBM и её пропускная способность.
Скрытый контекст линейки
С поколением MI300 линейка Instinct заметно сместилась от преимущественно HPC-нагрузок к генеративному AI.
| Серия | Архитектура | Год появления архитектуры |
|---|---|---|
| Instinct MI100 | CDNA | 2020 |
| Instinct MI200 | CDNA 2 | 2021 |
| Instinct MI300 | CDNA 3 | 2023 |
| Instinct MI350 | CDNA 4 | 2025 |
MI100 стал первым ускорителем AMD на CDNA. MI200 развил направление HPC и использовался в экзафлопсных системах.
В MI300 архитектура CDNA 3 получила FP8, более мощные Matrix Core и более выраженную ориентацию на нейросети.
Следующий MI325X сохранил CDNA 3, но получил больше памяти и более высокую пропускную способность. Переход на новую архитектуру произошёл уже в MI350 Series с CDNA 4.
MI300X стал первым Instinct, который AMD начала позиционировать непосредственно против ведущих AI-ускорителей NVIDIA.
Итог
Главное преимущество MI300X - 192 ГБ HBM3 с пропускной способностью 5,3 ТБ/с. Вместе с высокой производительностью FP64 и матричных вычислений это делает ускоритель особенно подходящим для крупных LLM и HPC.
На LLM среднего размера H100 может быть быстрее или показывать сопоставимый результат. На более крупных моделях преимущество MI300X по объёму и пропускной способности памяти становится заметнее.
Главное ограничение остаётся программным: CUDA по зрелости экосистемы всё ещё даёт NVIDIA серьёзное преимущество.
MI300X уже не является самым новым ускорителем AMD, но именно он стал первой моделью компании, которую можно было всерьёз ставить рядом с H100 в крупных AI-системах.
Общая информация
Характеристики памяти
Теоретическая производительность
Другое
Бенчмарки
По сравнению с другими GPU
Поделиться в социальных сетях
Или разместите ссылку на нас
<a href="https://cputronic.com/ru/gpu/amd-instinct-mi300x" target="_blank">AMD Instinct MI300X</a>