NVIDIA Tesla P40
vs
NVIDIA Tesla V100 PCIe 16 GB

vs
Сравнение видеокарт NVIDIA Tesla P40 vs NVIDIA Tesla V100 PCIe 16 GB

Результат сравнения видеокарт

NVIDIA Tesla P40 против Tesla V100 PCIe 16 GB: 24 ГБ памяти или более мощная архитектура

NVIDIA Tesla P40 и Tesla V100 PCIe 16 GB потребляют одинаковые 250 Вт, но рассчитаны на разные нагрузки. P40 делает ставку на 24 ГБ памяти, инференс, виртуализацию и обработку видео. V100 предлагает более совершенную архитектуру Volta, Tensor-ядра, быструю HBM2 и полноценную производительность в научных вычислениях.

Поэтому сравнивать эти ускорители только по CUDA-ядрам или FP32 бессмысленно. P40 выбирают, когда рабочая нагрузка не помещается в 16 ГБ, а V100 - когда важны скорость обучения, пропускная способность памяти и вычисления FP64.

Ключевые различия

Характеристика Tesla P40 Tesla V100 PCIe 16 GB
Архитектура Pascal Volta
CUDA-ядер 3840 5120
Tensor-ядер Нет 640
Видеопамять 24 ГБ GDDR5 16 ГБ HBM2
Пропускная способность 346 ГБ/с до 900 ГБ/с
FP32 до 12 Тфлопс до 14 Тфлопс
Основные задачи Инференс, vGPU, видео Обучение ИИ, HPC, CUDA

Разница в FP32 невелика, но она плохо отражает реальное соотношение сил. V100 получила не только больше CUDA-ядер, но и Tensor-ядра, значительно более быструю память и архитектурные улучшения Volta.

Pascal против Volta

Tesla P40 построена на архитектуре Pascal и оснащена 3840 CUDA-ядрами. Она создавалась как серверный ускоритель инференса, способный обслуживать несколько моделей или пользователей одновременно. Поддержка INT8 и 24 ГБ памяти сделали её востребованной в системах машинного обучения, виртуальных рабочих станциях и медиасерверах.

Tesla V100 использует архитектуру Volta, 5120 CUDA-ядер и 640 Tensor-ядер. Последние ускоряют матричные вычисления, на которых строится обучение нейросетей. В задачах со смешанной точностью V100 получает преимущество, которое нельзя увидеть по одной лишь производительности FP32.

Заявленные 47 TOPS у P40 и тензорные показатели V100 нельзя сопоставлять напрямую: они относятся к разным форматам данных. P40 хорошо работает с оптимизированным INT8-инференсом, тогда как V100 значительно универсальнее и лучше приспособлена к обучению моделей.

Память: объём против скорости

Главное преимущество P40 - 24 ГБ GDDR5. Дополнительные 8 ГБ могут оказаться важнее более мощного GPU, если модель, сцена или массив данных не помещаются в память V100.

Особенно заметно это при локальном запуске языковых моделей. Даже более быстрый ускоритель теряет преимущество, если часть весов приходится выгружать в оперативную память или распределять между несколькими устройствами.

V100 ограничена 16 ГБ, но её HBM2 обеспечивает пропускную способность до 900 ГБ/с - примерно в 2,6 раза больше, чем у P40. Для обучения нейросетей, обработки крупных матриц и научных расчётов высокая скорость памяти часто важнее её объёма.

Выбор здесь предельно простой:

  • P40 вмещает более крупные нагрузки;
  • V100 быстрее обрабатывает данные в пределах 16 ГБ;
  • при нехватке памяти преимущество V100 быстро сокращается.

Обучение и инференс нейросетей

Для обучения моделей V100 предпочтительнее почти всегда, пока достаточно 16 ГБ. Tensor-ядра, HBM2 и поддержка смешанной точности заметно ускоряют современные вычислительные нагрузки.

P40 логичнее использовать для развертывания уже обученных моделей. Она подходит для INT8-инференса, пакетной обработки запросов и сценариев, где важна стоимость одного гигабайта видеопамяти.

В локальных ИИ-системах выбор зависит от размера модели. Компактная модель обычно быстрее работает на V100. Если же она не помещается в 16 ГБ, 24-гигабайтная P40 может оказаться практичнее, несмотря на более старую архитектуру и отсутствие Tensor-ядер.

Научные вычисления и CUDA

В вычислениях двойной точности P40 не конкурирует с V100. Pascal-ускоритель проектировался для инференса и графической виртуализации, а не для тяжёлых задач FP64.

V100, напротив, создавалась для HPC. Она подходит для инженерного моделирования, вычислительной химии, физики, анализа данных и других нагрузок, где требуется высокая производительность двойной точности.

В обычных CUDA-приложениях V100 также чаще оказывается быстрее благодаря более мощному GPU и высокой пропускной способности памяти. Исключение возникает, когда рабочему набору требуется больше 16 ГБ.

Рендеринг

В CUDA-рендеринге V100 обычно быстрее P40, если сцена помещается в память. Однако обе карты лишены RT-ядер, поэтому уступают более новым RTX-ускорителям в движках с аппаратной трассировкой лучей.

P40 может выиграть на крупных сценах, которым недостаточно 16 ГБ. Здесь дополнительная память важнее скорости: сцена либо помещается в GPU целиком, либо рендерер вынужден использовать более медленный обходной режим.

Перед покупкой стоит проверить поддержку конкретного движка. Старые Tesla работают не со всеми актуальными версиями программ и драйверов.

Видео и виртуализация

P40 создавалась не только для вычислений. Она хорошо подходит для виртуальных рабочих станций, удалённых рабочих мест, транскодирования и серверной обработки видео.

Для V100 эти задачи вторичны. Покупать её ради видеокодирования или vGPU обычно нерационально: большая часть стоимости приходится на вычислительную архитектуру, Tensor-ядра и возможности HPC.

Установка в обычный компьютер

Обе карты используют пассивное охлаждение и рассчитаны на серверный воздушный поток. В обычном корпусе без направленного обдува они быстро перегреваются и снижают частоты.

Перед покупкой необходимо учитывать:

  • отсутствие встроенных вентиляторов;
  • отсутствие видеовыходов;
  • особенности разъёма питания;
  • длину и двухслотовый корпус;
  • совместимость драйверов и программ;
  • энергопотребление до 250 Вт.

Низкая цена на вторичном рынке не означает простую установку. Для стабильной работы потребуется мощный блок питания, воздуховод или отдельные вентиляторы и корпус с хорошей вентиляцией.

Что проверить при покупке

Tesla P40 и V100 давно продаются преимущественно на вторичном рынке. Их состояние зависит от условий эксплуатации, температуры и продолжительности работы в сервере.

Перед покупкой желательно проверить:

  • определение карты в системе;
  • объём и ошибки памяти;
  • стабильность под длительной нагрузкой;
  • рабочие температуры;
  • отсутствие троттлинга;
  • совместимость с нужной версией CUDA;
  • поддержку карты выбранным фреймворком или рендерером.

V100 обычно стоит заметно дороже P40. Переплата оправдана для обучения нейросетей, FP64 и тяжёлых вычислений, но не всегда имеет смысл для простого инференса.

Что выбрать

Tesla P40 стоит рассматривать, если:

  • требуется больше 16 ГБ видеопамяти;
  • основная задача - инференс;
  • запускаются крупные локальные модели;
  • используется виртуализация;
  • важны обработка и транскодирование видео;
  • критична стоимость за гигабайт памяти.

Tesla V100 PCIe 16 GB лучше, если:

  • планируется обучение нейросетей;
  • нужны Tensor-ядра;
  • используется смешанная точность;
  • выполняются научные расчёты;
  • важна производительность FP64;
  • рабочая нагрузка помещается в 16 ГБ.

Итог

Tesla V100 PCIe 16 GB - более быстрый и универсальный вычислительный ускоритель. Она заметно лучше подходит для обучения нейросетей, научных расчётов и тяжёлых CUDA-задач.

Tesla P40 имеет смысл выбирать ради 24 ГБ памяти, недорогого инференса, виртуализации или обработки видео. Если нагрузке достаточно 16 ГБ, V100 почти всегда предпочтительнее. Если же модель или сцена превышает этот объём, дополнительные 8 ГБ P40 могут оказаться важнее всей вычислительной мощности Volta.

Преимущества

  • Выше Boost Частота: 1531MHz (1531MHz vs 1380MHz)
  • Больше Объем памяти: 24GB (24GB vs 16GB)
  • Выше Пропускная способность: 897.0 GB/s (694.3 GB/s vs 897.0 GB/s)
  • Больше Блоки шейдинга: 5120 (3840 vs 5120)
  • Новее Дата выпуска: June 2017 (September 2016 vs June 2017)

Общая информация

NVIDIA
Производитель
NVIDIA
September 2016
Дата выпуска
June 2017
Professional
Платформа
Professional
Tesla P40
Название модели
Tesla V100 PCIe 16 GB
Tesla Pascal
Поколение
Tesla
1303MHz
Базоввая частота
1245MHz
1531MHz
Boost Частота
1380MHz
PCIe 3.0 x16
Интерфейс шины
PCIe 3.0 x16
11,800 million
Транзисторы
21,100 million
-
Tensor ядра
?
Тензорные ядра — это специализированные процессоры, разработанные специально для глубокого обучения, обеспечивающие более высокую производительность обучения и вывода по сравнению с обучением FP32. Они позволяют выполнять быстрые вычисления в таких областях, как компьютерное зрение, обработка естественного языка, распознавание речи, преобразование текста в речь и персонализированные рекомендации. Два наиболее заметных применения тензорных ядер — это DLSS (Deep Learning Super Sampling) и AI Denoiser для снижения шума.
640
240
TMU
?
Блоки наложения текстур (TMU) служат компонентами графического процессора, которые способны вращать, масштабировать и искажать двоичные изображения, а затем размещать их в виде текстур на любой плоскости заданной трехмерной модели. Этот процесс называется отображением текстур.
320
TSMC
Производитель
TSMC
16 nm
Размер процесса
12 nm
Pascal
Архитектура
Volta

Характеристики памяти

24GB
Объем памяти
16GB
GDDR5X
Тип памяти
HBM2
384bit
Шина памяти
?
Ширина шины памяти обозначает количество бит данных, которые видеопамять может передать за один такт. Чем больше ширина шины, тем больший объем данных может быть передан мгновенно, что делает ее одним из важнейших параметров видеопамяти. Пропускная способность памяти рассчитывается как: Пропускная способность памяти = Частота памяти x Ширина шины памяти / 8. Следовательно, если частоты памяти одинаковы, ширина шины памяти будет определять размер пропускной способности памяти.
4096bit
1808MHz
Частота памяти
876MHz
694.3 GB/s
Пропускная способность
?
Пропускная способность памяти — это скорость передачи данных между графическим чипом и видеопамятью. Он измеряется в байтах в секунду, и формула для его расчета: пропускная способность памяти = рабочая частота × ширина шины памяти / 8 бит.
897.0 GB/s

Дисплей и мультимедиа

No outputs
Выходы
No outputs

Теоретическая производительность

147.0 GPixel/s
Пиксельный филлрейт
?
Скорость заполнения пикселей — это количество пикселей, которые графический процессор (GPU) может визуализировать в секунду, измеряется в мегапикселях/с (миллион пикселей в секунду) или GPixels/s (миллиард пикселей в секунду). Это наиболее часто используемый показатель для оценки производительности обработки пикселей видеокарты.
176.6 GPixel/s
367.4 GTexel/s
Текстурный филлрейт
?
Скорость заполнения текстуры — это количество элементов карты текстур (текселей), которые графический процессор может сопоставить с пикселями за одну секунду.
441.6 GTexel/s
183.7 GFLOPS
FP16 (half)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность. Числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики, а числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности.
28.26 TFLOPS
367.4 GFLOPS
FP64 (double)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности, а числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность.
7.066 TFLOPS
11.995 TFLOPS
FP32 (float)
?
Важным показателем для измерения производительности графического процессора являются возможности вычислений с плавающей запятой. Числа с плавающей запятой одинарной точности (32-битные) используются для обычных задач обработки мультимедиа и графики, а числа с плавающей запятой двойной точности (64-битные) необходимы для научных вычислений, требующих широкого числового диапазона и высокой точности. Числа с плавающей запятой половинной точности (16 бит) используются в таких приложениях, как машинное обучение, где допустима более низкая точность.
14.413 TFLOPS

Другое

30
Потоковый мультипроцессор (SM)
?
Несколько потоковых процессоров (SP) вместе с другими ресурсами образуют потоковый мультипроцессор (SM), который также называется основным ядром графического процессора. Эти дополнительные ресурсы включают в себя такие компоненты, как планировщики деформации, регистры и общую память. SM можно считать сердцем графического процессора, аналогично ядру ЦП, при этом регистры и общая память являются дефицитными ресурсами внутри SM.
80
3840
Блоки шейдинга
?
Самым фундаментальным процессором является потоковый процессор (SP), в котором выполняются определенные инструкции и задачи. Графические процессоры выполняют параллельные вычисления, что означает, что несколько процессоров SP работают одновременно для обработки задач.
5120
48 KB (per SM)
Кэш L1
128 KB (per SM)
3MB
Кэш L2
6MB
250W
TDP
300W
1.3
Версия Vulkan
?
Vulkan — это кроссплатформенный графический и вычислительный API от Khronos Group, предлагающий высокую производительность и низкую нагрузку на процессор. Он позволяет разработчикам напрямую управлять графическим процессором, снижает затраты на рендеринг и поддерживает многопоточные и многоядерные процессоры.
1.3
3.0
Версия OpenCL
3.0
4.6
OpenGL
4.6
6.1
CUDA
7.0
12 (12_1)
DirectX
12 (12_1)
8-pin EPS
Разъемы питания
2x 8-pin
96
ROP
?
Конвейер растровых операций (ROP) в первую очередь отвечает за расчеты освещения и отражений в играх, а также за управление такими эффектами, как сглаживание (AA), высокое разрешение, дым и огонь. Чем более требовательны к сглаживанию и световым эффектам в игре, тем выше требования к производительности для ROP; в противном случае это может привести к резкому падению частоты кадров.
128
6.7
Шейдерная модель
6.6
600W
Требуемый блок питания
700W

Бенчмарки

FP32 (float) / TFLOPS
Tesla P40
11.995
Tesla V100 PCIe 16 GB
14.413 +20%
OctaneBench
Tesla P40
163
Tesla V100 PCIe 16 GB
345 +112%