NVIDIA GeForce RTX 5090 D

NVIDIA GeForce RTX 5090 D
Обзор видеокарты NVIDIA GeForce RTX 5090 D

NVIDIA GeForce RTX 5090 D: урезали AI, но почти не тронули игры

GeForce RTX 5090 D появилась для китайского рынка из-за экспортных ограничений США. В отличие от RTX 4090 D, NVIDIA почти не стала урезать её игровую часть: количество CUDA-ядер, память и основные блоки GPU остались на уровне обычной RTX 5090. Главное ограничение коснулось AI-производительности.

Что именно урезали в RTX 5090 D

RTX 5090 D сохранила 21 760 CUDA-ядер, 680 Tensor Cores, 170 RT Cores, 32 ГБ GDDR7, 512-битную шину памяти и 575-ваттный лимит мощности.

Главное различие - заявленная производительность Tensor-ядер: 2375 AI TOPS у RTX 5090 D против 3352 AI TOPS у обычной RTX 5090, то есть примерно на 29% меньше.

В играх это ограничение почти не мешает: растеризация, трассировка лучей и подсистема памяти у RTX 5090 D не урезаны.

Производительность конкретных RTX 5090 D

Для RTX 5090 D особенно показательны тесты партнёрских моделей.

Видеокарта 3DMark Time Spy Extreme Graphics 3DMark Port Royal
Colorful iGame GeForce RTX 5090 D Advanced 32GB 25 497 36 497
ZOTAC GeForce RTX 5090 D SOLID OC 32GB 25 901 35 252
GALAX GeForce RTX 5090 D Xingyao LUNA OC 24 946 34 017

Результаты получены на разных тестовых системах, поэтому сравнивать модели по нескольким сотням баллов напрямую не стоит. Разброс между тремя картами составляет всего несколько процентов - обычная разница между разными версиями одного GPU.

Заводской разгон даёт немного, поэтому конкретную RTX 5090 D лучше выбирать по охлаждению, шуму, габаритам и лимиту мощности.

RTX 5090 D в 4K

4K - наиболее показательный режим для RTX 5090 D: в 1440p и особенно 1080p результат всё чаще ограничивает процессор или игровой движок.

Результаты с DLSS 4 Multi Frame Generation лучше отделять от обычных тестов: генерация кадров резко увеличивает счётчик FPS, но сама видеокарта не начинает отрисовывать кадры во столько же раз быстрее. Поэтому для прямого сравнения RTX 5090 D показательнее тесты без Frame Generation.

Зачем оригинальной RTX 5090 D нужны 32 ГБ

Оригинальная RTX 5090 D получила 32 ГБ GDDR7, 512-битную шину и пропускную способность 1792 ГБ/с.

В большинстве современных игр 32 ГБ нужны далеко не всегда, зато такой объём пригодится в 3D-рендеринге, видеомонтаже, крупных сценах и при запуске локальных AI-моделей.

Но для вычислительных задач RTX 5090 D уже не полный аналог обычной RTX 5090. Заявленная AI-производительность у версии D ниже, а реальная разница зависит от приложения и формата вычислений.

В AI-задачах ограничения версии D заметно важнее, чем в играх.

575 Вт требуют серьёзного питания и охлаждения

RTX 5090 D сохранила 575-ваттный TGP обычной RTX 5090. Партнёрские версии с расширенными лимитами мощности могут потреблять ещё больше.

Понадобятся мощный блок питания, хорошо продуваемый корпус и достаточно места под массивную видеокарту. Крупные партнёрские модели занимают до четырёх слотов и весят больше 2,5 кг.

Для столь тяжёлых карт опора под видеокарту уже не декоративный аксессуар.

RTX 5090 D и RTX 5090 D V2 - не одно и то же

Оригинальная RTX 5090 D получила:

  • 32 ГБ GDDR7;
  • 512-битную шину памяти;
  • пропускную способность 1792 ГБ/с.

Позднее появилась RTX 5090 D V2: те же 21 760 CUDA-ядер, но уже 24 ГБ GDDR7 и 384-битная шина. Пропускная способность памяти снизилась до 1344 ГБ/с.

V2 появилась после очередного ужесточения экспортных ограничений и фактически заменила первоначальную версию на китайском рынке.

В играх сокращение памяти и пропускной способности обычно сказывается слабее, чем в рабочих нагрузках, но для AI и тяжёлых профессиональных задач разница заметнее. Поэтому обозначение V2 нельзя воспринимать как обычную ревизию той же карты.

Итог

Оригинальная RTX 5090 D почти не уступает RTX 5090 по игровой части: основные ограничения NVIDIA перенесла в AI-вычисления.

Если обычная RTX 5090 стоит столько же, смысла выбирать D нет. Но при более низкой цене оригинальная 32-гигабайтная RTX 5090 D почти ничего не теряет в играх.

Главное при покупке - не перепутать её с RTX 5090 D V2. У V2 уже 24 ГБ памяти и 384-битная шина: это не косметическая ревизия, а заметно изменённая версия карты.

Общая информация

Производитель
NVIDIA
Платформа
Desktop
Дата выпуска
January 2025
Название модели
GeForce RTX 5090 D
Поколение
GeForce 50
Базоввая частота
2017 MHz
Boost Частота
2407 MHz
Интерфейс шины
PCIe 5.0 x16
Транзисторы
92 billion
RT ядра
170
Tensor ядра
?
Тензорные ядра — это специализированные процессоры, разработанные специально для глубокого обучения, обеспечивающие более высокую производительность обучения и вывода по сравнению с обучением FP32. Они позволяют выполнять быстрые вычисления в таких областях, как компьютерное зрение, обработка естественного языка, распознавание речи, преобразование текста в речь и персонализированные рекомендации. Два наиболее заметных применения тензорных ядер — это DLSS (Deep Learning Super Sampling) и AI Denoiser для снижения шума.
680
TMU
?
Блоки наложения текстур (TMU) служат компонентами графического процессора, которые способны вращать, масштабировать и искажать двоичные изображения, а затем размещать их в виде текстур на любой плоскости заданной трехмерной модели. Этот процесс называется отображением текстур.
680
Производитель
TSMC
Размер процесса
4 nm
Архитектура
Blackwell

Характеристики памяти

Объем памяти
32GB
Тип памяти
GDDR7
Шина памяти
?
Ширина шины памяти обозначает количество бит данных, которые видеопамять может передать за один такт. Чем больше ширина шины, тем больший объем данных может быть передан мгновенно, что делает ее одним из важнейших параметров видеопамяти. Пропускная способность памяти рассчитывается как: Пропускная способность памяти = Частота памяти x Ширина шины памяти / 8. Следовательно, если частоты памяти одинаковы, ширина шины памяти будет определять размер пропускной способности памяти.
512bit
Частота памяти
1750 MHz
Пропускная способность
?
Пропускная способность памяти — это скорость передачи данных между графическим чипом и видеопамятью. Он измеряется в байтах в секунду, и формула для его расчета: пропускная способность памяти = рабочая частота × ширина шины памяти / 8 бит.
1.79TB/s

Дисплей и мультимедиа

Выходы
1x HDMI 2.1b
3x DisplayPort 2.1b

Теоретическая производительность

Пиксельный филлрейт
?
Скорость заполнения пикселей — это количество пикселей, которые графический процессор (GPU) может визуализировать в секунду, измеряется в мегапикселях/с (миллион пикселей в секунду) или GPixels/s (миллиард пикселей в секунду). Это наиболее часто используемый показатель для оценки производительности обработки пикселей видеокарты.
423.6 GPixel/s
Текстурный филлрейт
?
Скорость заполнения текстуры — это количество элементов карты текстур (текселей), которые графический процессор может сопоставить с пикселями за одну секунду.
1637 GTexel/s
FP16 (half)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность. Числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики, а числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности.
104.8 TFLOPS
FP64 (double)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности, а числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность.
1.637 TFLOPS
FP32 (float)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики, а числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность.
104.8 TFLOPS

Другое

Потоковый мультипроцессор (SM)
?
Несколько потоковых процессоров (SP) вместе с другими ресурсами образуют потоковый мультипроцессор (SM), который также называется основным ядром графического процессора. Эти дополнительные ресурсы включают в себя такие компоненты, как планировщики деформации, регистры и общую память. SM можно считать сердцем графического процессора, аналогично ядру ЦП, при этом регистры и общая память являются дефицитными ресурсами внутри SM.
170
Блоки шейдинга
?
Самым фундаментальным процессором является потоковый процессор (SP), в котором выполняются определенные инструкции и задачи. Графические процессоры выполняют параллельные вычисления, что означает, что несколько процессоров SP работают одновременно для обработки задач.
21760
Кэш L1
128 KB (per SM)
Кэш L2
96 MB
TDP
575W
Версия Vulkan
?
Vulkan — это кроссплатформенный графический и вычислительный API от Khronos Group, предлагающий высокую производительность и низкую нагрузку на процессор. Он позволяет разработчикам напрямую управлять графическим процессором, снижает затраты на рендеринг и поддерживает многопоточные и многоядерные процессоры.
1.4
Версия OpenCL
3.0
OpenGL
4.6
CUDA
12.0
DirectX
12 Ultimate (12_2)
Разъемы питания
1x 16-pin
ROP
?
Конвейер растровых операций (ROP) в первую очередь отвечает за расчеты освещения и отражений в играх, а также за управление такими эффектами, как сглаживание (AA), высокое разрешение, дым и огонь. Чем более требовательны к сглаживанию и световым эффектам в игре, тем выше требования к производительности для ROP; в противном случае это может привести к резкому падению частоты кадров.
176
Шейдерная модель
6.8
Требуемый блок питания
1000 W

Бенчмарки

FP32 (float)
104.8 TFLOPS
3DMark Steel Nomad
14475
Blender
14853.7
Vulkan
382809
OpenCL
385013

По сравнению с другими GPU

FP32 (float) / TFLOPS
163.4 +55.9%
105.525 +0.7%
79.478 -24.2%
65.572 -37.4%
3DMark Steel Nomad
14544 +0.5%
9237 -36.2%
8858 -38.8%
Blender
15026.3 +1.2%
1265.43 -91.5%
630 -95.8%
Vulkan
152166 -60.3%
100987 -73.6%
76392 -80%
49804 -87%
OpenCL
388405 +0.9%
126692 -67.1%
90580 -76.5%
66428 -82.7%