NVIDIA GB10

NVIDIA GB10
Обзор видеокарты NVIDIA GB10

NVIDIA GB10: 1 PFLOP и 128 ГБ памяти для локального AI

GB10 разработан для компактных AI-станций вроде NVIDIA DGX Spark и заметно отличается от обычных видеокарт Blackwell. В одном корпусе объединены 20-ядерный Arm-процессор, графика Blackwell и 128 ГБ общей памяти LPDDR5X. NVIDIA заявляет производительность до 1 PFLOP FP4, и реальные тесты подтверждают этот уровень. В практических AI-задачах важным ограничением становится пропускная способность памяти.

Чем GB10 отличается от GeForce

GB10 впервые показали в январе 2025 года в составе Project DIGITS. Позже эта концепция легла в основу DGX Spark, а платформу начали использовать и другие производители. На GB10 построены ASUS Ascent GX10, Lenovo ThinkStation PGX, HP ZGX Nano G1n, GIGABYTE AI TOP ATOM, Acer Veriton GN100 и другие компактные AI-системы.

Главное преимущество GB10 заключается в 128 ГБ общей памяти для CPU и GPU.

За счет такого объема GB10 может локально запускать модели, которые не помещаются в 16-32 ГБ VRAM большинства потребительских видеокарт. По данным NVIDIA, системы на GB10 способны работать с моделями до 200 млрд параметров при подходящей квантизации и оптимизациях.

Тесты подтверждают заявленный 1 PFLOP

Значение 1 PFLOP относится к вычислениям FP4 с разреженностью 2:4. По этой цифре нельзя напрямую судить об общей скорости графической части или о скорости генерации токенов в LLM.

В 2026 году появились воспроизводимые результаты nvfp4bench, который тестирует Tensor Cores GB10 в вычислениях NVFP4. Серийные системы показывают примерно 486-504 TFLOPS в плотном NVFP4 и около 1 PFLOP при разреженности 2:4.

GB10 в конкретных устройствах

Устройство NVFP4 Dense NVFP4 Sparse 2:4 Пропускная способность памяти
HP ZGX Nano G1n 503,9 TFLOPS 1007,8 TFLOPS 207 ГБ/с
Lenovo ThinkStation PGX 498,4 TFLOPS 996,7 TFLOPS 213 ГБ/с
ASUS Ascent GX10 497,5 TFLOPS 994,8 TFLOPS 205 ГБ/с
GIGABYTE AI TOP ATOM 496,6 TFLOPS 993,4 TFLOPS 214 ГБ/с
NVIDIA DGX Spark 486,3 TFLOPS 973,2 TFLOPS 207 ГБ/с

Все результаты получены одним типом теста, поэтому их можно сравнивать напрямую. Разброс между системами небольшой, а различия в корпусе, охлаждении и настройках слабо влияют на итоговый результат.

Ограничение по пропускной способности памяти

Tensor Cores обеспечивают высокую производительность в низкой точности, тогда как официальная пропускная способность 128 ГБ LPDDR5X составляет до 273 ГБ/с. В практических тестах системы обычно показывают около 200-214 ГБ/с.

Для локального инференса LLM этот показатель особенно важен. При последовательной генерации токенов веса модели постоянно считываются из памяти, поэтому скорость часто ограничивается ее пропускной способностью.

Поэтому 1 PFLOP нельзя напрямую переводить в скорость работы конкретной нейросети.

При длинном prefill, пакетной обработке и параллельных запросах Tensor Cores загружаются эффективнее. GB10 способен размещать в общей памяти модели, которые не помещаются в VRAM одной обычной настольной видеокарты.

Объем памяти велик, но ее пропускная способность заметно ниже, чем у GDDR7 на мощных дискретных GPU.

Сколько токенов в секунду выдает GB10

Практические тесты LLM лучше показывают характер GB10, чем пиковая производительность FP4. На NVIDIA DGX Spark с Ollama 0.18.3 и CUDA 13.0 скорость заметно падает по мере роста плотной модели, зато 128 ГБ памяти позволяют запускать модели, которые не помещаются на большинстве потребительских видеокарт.

Модель Размер в памяти Генерация Обработка запроса
Llama 3.1 8B 4,9 ГБ 42,86 ток/с 574,79 ток/с
Qwen3 32B 20 ГБ 9,88 ток/с 141,91 ток/с
Llama 3.1 70B 42 ГБ 4,76 ток/с 67,92 ток/с
Mistral Large 123B 73 ГБ 2,28 ток/с 10,43 ток/с

Результаты хорошо показывают ограничение LPDDR5X. Llama 3.1 8B генерирует около 43 токенов в секунду, а у Llama 3.1 70B скорость снижается примерно до 4,8 токена в секунду. Mistral Large 123B работает еще медленнее, но сама возможность разместить модель такого размера в памяти одной компактной системы и составляет одно из преимуществ GB10.

Архитектура модели тоже сильно влияет на результат. В отдельных тестах llama.cpp Qwen3 30B с архитектурой MoE показывал около 89 токенов в секунду, тогда как плотный Qwen3 32B достигал примерно 11 токенов в секунду. У MoE в генерации задействуется только часть параметров, поэтому такая модель заметно меньше зависит от пропускной способности памяти GB10.

Сколько стоят компьютеры с GB10

К августу 2026 года GB10 используется в нескольких серийных системах. Производительность чипа различается незначительно, а цены и объем накопителя заметно зависят от конкретной модели.

Система Накопитель Цена от
ASUS Ascent GX10 1 ТБ около €3 999
Lenovo ThinkStation PGX 1 ТБ около €4 733
HP ZGX Nano G1n 2 ТБ около €5 199
GIGABYTE AI TOP ATOM 4 ТБ около €5 499
NVIDIA DGX Spark Founders Edition 4 ТБ около €5 599
Acer Veriton GN100 4 ТБ около €5 999

Цены относятся к предложениям на европейском рынке и зависят от конкретной конфигурации.

По соотношению цены и производительности ASUS Ascent GX10 выглядит выгоднее остальных. Он дешевле некоторых конкурентов более чем на €1 000, а результаты NVFP4 отличаются всего на несколько процентов.

Переплата за более дорогие модели обычно приходится на SSD, набор портов, гарантию и поддержку. Существенного прироста производительности GB10 она не дает.

Как связаны Project DIGITS, DGX Spark и GB10

У GB10 несколько связанных названий, появившихся на разных этапах развития платформы. В январе 2025 года NVIDIA представила платформу под названием Project DIGITS. Позже собственная система NVIDIA получила название DGX Spark, а GB10 начали использовать ASUS, Lenovo, HP, GIGABYTE и другие производители.

Название Что это
Project DIGITS первоначальная концепция компактного AI-компьютера
NVIDIA GB10 Grace Blackwell Superchip
NVIDIA DGX Spark собственная серийная система NVIDIA на GB10
ASUS GX10, Lenovo PGX, HP ZGX и другие OEM-системы на той же платформе

ASUS GX10, Lenovo PGX и HP ZGX используют одну и ту же вычислительную платформу GB10. Различия между этими системами касаются прежде всего корпуса, накопителя, охлаждения и периферии.

GB10 корректнее рассматривать как специализированный SoC для AI-рабочих станций. Графическая часть использует архитектуру Blackwell, а платформа объединяет CPU, GPU и общую память в одном решении.

Итог

При цене от примерно €4 000 GB10 ориентирован на узкий круг задач. Если нужная модель помещается в VRAM обычной RTX, дискретная видеокарта чаще обеспечит больше вычислительной производительности за те же деньги.

Преимущество GB10 появляется в задачах, где 24-32 ГБ VRAM уже недостаточно. Его 128 ГБ общей памяти позволяют локально запускать крупные AI-модели без нескольких дискретных GPU и сложного распределения весов между ними.

Реальные системы подтверждают заявленный уровень около 1 PFLOP FP4 при разреженности 2:4. Практические LLM-тесты одновременно показывают ограничение пропускной способности LPDDR5X: крупные плотные модели помещаются в память, но генерируют токены сравнительно медленно. Сильная сторона GB10 заключается в сочетании 128 ГБ общей памяти, CUDA и компактного форм-фактора.

Общая информация

Производитель
NVIDIA
Платформа
Desktop
Дата выпуска
August 2025
Название модели
GB10
Поколение
Server Blackwell
Базоввая частота
1665 MHz
Boost Частота
2525 MHz
Интерфейс шины
PCIe 5.0 x16
Транзисторы
Unknown
RT ядра
48
Tensor ядра
?
Тензорные ядра — это специализированные процессоры, разработанные специально для глубокого обучения, обеспечивающие более высокую производительность обучения и вывода по сравнению с обучением FP32. Они позволяют выполнять быстрые вычисления в таких областях, как компьютерное зрение, обработка естественного языка, распознавание речи, преобразование текста в речь и персонализированные рекомендации. Два наиболее заметных применения тензорных ядер — это DLSS (Deep Learning Super Sampling) и AI Denoiser для снижения шума.
384
TMU
?
Блоки наложения текстур (TMU) служат компонентами графического процессора, которые способны вращать, масштабировать и искажать двоичные изображения, а затем размещать их в виде текстур на любой плоскости заданной трехмерной модели. Этот процесс называется отображением текстур.
384
Производитель
TSMC
Размер процесса
3 nm
Архитектура
Blackwell

Характеристики памяти

Объем памяти
128GB
Тип памяти
LPDDR5X
Шина памяти
?
Ширина шины памяти обозначает количество бит данных, которые видеопамять может передать за один такт. Чем больше ширина шины, тем больший объем данных может быть передан мгновенно, что делает ее одним из важнейших параметров видеопамяти. Пропускная способность памяти рассчитывается как: Пропускная способность памяти = Частота памяти x Ширина шины памяти / 8. Следовательно, если частоты памяти одинаковы, ширина шины памяти будет определять размер пропускной способности памяти.
256bit
Частота памяти
1067 MHz
Пропускная способность
?
Пропускная способность памяти — это скорость передачи данных между графическим чипом и видеопамятью. Он измеряется в байтах в секунду, и формула для его расчета: пропускная способность памяти = рабочая частота × ширина шины памяти / 8 бит.
273.2GB/s

Дисплей и мультимедиа

Выходы
1x HDMI

Теоретическая производительность

Пиксельный филлрейт
?
Скорость заполнения пикселей — это количество пикселей, которые графический процессор (GPU) может визуализировать в секунду, измеряется в мегапикселях/с (миллион пикселей в секунду) или GPixels/s (миллиард пикселей в секунду). Это наиболее часто используемый показатель для оценки производительности обработки пикселей видеокарты.
121.2 GPixel/s
Текстурный филлрейт
?
Скорость заполнения текстуры — это количество элементов карты текстур (текселей), которые графический процессор может сопоставить с пикселями за одну секунду.
969.6 GTexel/s
FP16 (half)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность. Числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики, а числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности.
124.1 TFLOPS
FP64 (double)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности, а числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность.
15.51 TFLOPS
FP32 (float)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики, а числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность.
31.651 TFLOPS

Другое

Потоковый мультипроцессор (SM)
?
Несколько потоковых процессоров (SP) вместе с другими ресурсами образуют потоковый мультипроцессор (SM), который также называется основным ядром графического процессора. Эти дополнительные ресурсы включают в себя такие компоненты, как планировщики деформации, регистры и общую память. SM можно считать сердцем графического процессора, аналогично ядру ЦП, при этом регистры и общая память являются дефицитными ресурсами внутри SM.
48
Блоки шейдинга
?
Самым фундаментальным процессором является потоковый процессор (SP), в котором выполняются определенные инструкции и задачи. Графические процессоры выполняют параллельные вычисления, что означает, что несколько процессоров SP работают одновременно для обработки задач.
6144
Кэш L1
256 KB (per SM)
Кэш L2
50 MB
TDP
Unknown
Версия OpenCL
3.0
CUDA
10.1
Разъемы питания
None
ROP
?
Конвейер растровых операций (ROP) в первую очередь отвечает за расчеты освещения и отражений в играх, а также за управление такими эффектами, как сглаживание (AA), высокое разрешение, дым и огонь. Чем более требовательны к сглаживанию и световым эффектам в игре, тем выше требования к производительности для ROP; в противном случае это может привести к резкому падению частоты кадров.
48
Требуемый блок питания
200 W

Бенчмарки

FP32 (float)
31.651 TFLOPS
OpenCL
143663

По сравнению с другими GPU

FP32 (float) / TFLOPS
36.853 +16.4%
31.651
28.876 -8.8%
25.931 -18.1%
OpenCL
388405 +170.4%
186397 +29.7%
143663
90580 -36.9%
66428 -53.8%