NVIDIA Tesla P40
vs
NVIDIA Tesla V100 PCIe 16 GB

vs
Comparação de placas de vídeo NVIDIA Tesla P40 vs NVIDIA Tesla V100 PCIe 16 GB

Resultado de comparação de GPU

NVIDIA Tesla P40 contra Tesla V100 PCIe 16 GB: 24 GB de memória ou uma arquitetura mais poderosa

NVIDIA Tesla P40 e Tesla V100 PCIe 16 GB consomem os mesmos 250 W, mas são projetadas para cargas de trabalho diferentes. A P40 aposta em 24 GB de memória, inferência, virtualização e processamento de vídeo. A V100 oferece uma arquitetura Volta mais avançada, núcleos Tensor, HBM2 rápida e desempenho completo em cálculos científicos.

Portanto, comparar esses aceleradores apenas com base nos núcleos CUDA ou FP32 é irrelevante. A P40 é escolhida quando a carga de trabalho não cabe em 16 GB, enquanto a V100 é preferida quando a velocidade de treinamento, largura de banda de memória e cálculos FP64 são importantes.

Principais diferenças

Característica Tesla P40 Tesla V100 PCIe 16 GB
Arquitetura Pascal Volta
Núcleos CUDA 3840 5120
Núcleos Tensor Não 640
Memória de vídeo 24 GB GDDR5 16 GB HBM2
Largura de banda 346 GB/s até 900 GB/s
FP32 até 12 TFLOPS até 14 TFLOPS
Principais tarefas Inferência, vGPU, vídeo Treinamento de IA, HPC, CUDA

A diferença em FP32 não é grande, mas não reflete bem a verdadeira relação de forças. A V100 possui não apenas mais núcleos CUDA, mas também núcleos Tensor, memória muito mais rápida e melhorias arquitetônicas da Volta.

Pascal contra Volta

A Tesla P40 é construída na arquitetura Pascal e equipada com 3840 núcleos CUDA. Foi projetada como um acelerador de inferência para servidores, capaz de atender a múltiplos modelos ou usuários simultaneamente. O suporte a INT8 e 24 GB de memória a tornam popular em sistemas de aprendizado de máquina, estações de trabalho virtuais e servidores de mídia.

A Tesla V100 utiliza a arquitetura Volta, com 5120 núcleos CUDA e 640 núcleos Tensor. Estes últimos aceleram os cálculos matriciais, base dos treinamentos de redes neurais. Em tarefas de precisão mista, a V100 obtém vantagens que não podem ser vistas apenas com base no desempenho FP32.

Os 47 TOPS declarados da P40 e os índices tensorais da V100 não podem ser comparados diretamente: eles se referem a diferentes formatos de dados. A P40 funciona bem com inferência otimizada em INT8, enquanto a V100 é significativamente mais versátil e melhor adaptada para treinamento de modelos.

Memória: volume contra velocidade

A principal vantagem da P40 é os 24 GB GDDR5. Os 8 GB adicionais podem ser mais importantes do que uma GPU mais poderosa se o modelo, a cena ou o conjunto de dados não caberem na memória da V100.

Isso é especialmente perceptível ao executar modelos de linguagem localmente. Mesmo um acelerador mais rápido perde sua vantagem se parte dos pesos precisar ser descarregada na memória RAM ou distribuída entre vários dispositivos.

A V100 é limitada a 16 GB, mas sua HBM2 fornece uma largura de banda de até 900 GB/s - cerca de 2,6 vezes maior do que a da P40. Para treinamentos de redes neurais, processamento de matrizes grandes e cálculos científicos, alta velocidade de memória muitas vezes é mais importante do que seu volume.

A escolha aqui é bastante simples:

  • A P40 acomoda cargas de trabalho maiores;
  • A V100 processa dados mais rapidamente dentro dos 16 GB;
  • Quando a memória é escassa, a vantagem da V100 diminui rapidamente.

Treinamento e inferência de redes neurais

Para treinar modelos, a V100 é geralmente preferível, desde que os 16 GB sejam suficientes. Os núcleos Tensor, HBM2 e suporte a precisão mista aceleram significativamente as cargas computacionais modernas.

A P40 é mais lógica para implantar modelos já treinados. Ela é adequada para inferência INT8, processamento em lote de solicitações e cenários onde o custo por gigabyte de memória é importante.

Em sistemas de IA locais, a escolha depende do tamanho do modelo. Um modelo compacto geralmente funciona mais rápido na V100. No entanto, se não couber nos 16 GB, a P40 de 24 GB pode ser mais prática, apesar de sua arquitetura mais antiga e da falta de núcleos Tensor.

Cálculos científicos e CUDA

Nos cálculos de precisão dupla, a P40 não compete com a V100. O acelerador Pascal foi projetado para inferência e virtualização gráfica, e não para tarefas pesadas de FP64.

A V100, em contrapartida, foi criada para HPC. Ela é adequada para modelagem de engenharia, química computacional, física, análise de dados e outras cargas onde alta performance de precisão dupla é necessária.

Em aplicativos CUDA comuns, a V100 geralmente é mais rápida devido a uma GPU mais potente e alta largura de banda de memória. A exceção surge quando o conjunto de trabalho exige mais de 16 GB.

Renderização

Na renderização CUDA, a V100 geralmente é mais rápida que a P40, se a cena couber na memória. No entanto, ambas as placas carecem de núcleos RT, portanto, ficam atrás de aceleradores RTX mais novos em motores com rastreamento de raios por hardware.

A P40 pode ter vantagem em cenas grandes que não cabem nos 16 GB. Aqui, a memória adicional é mais importante do que a velocidade: a cena ou cabe totalmente na GPU ou o renderer é forçado a usar um modo alternativo mais lento.

Antes da compra, é importante verificar o suporte ao motor específico. As placas Tesla mais antigas não funcionam com todas as versões atualizadas de software e drivers.

Vídeo e virtualização

A P40 não foi concebida apenas para cálculos. Ela é bem adequada para estações de trabalho virtuais, locais de trabalho remotos, transcodificação e processamento de vídeo em servidor.

Para a V100, essas tarefas são secundárias. Comprar a V100 apenas para codificação de vídeo ou vGPU geralmente não é racional: a maior parte do custo está na arquitetura computacional, núcleos Tensor e capacidades HPC.

Instalação em computador convencional

Ambas as placas utilizam resfriamento passivo e são projetadas para fluxo de ar de servidor. Em um case comum sem ventilação direcionada, elas superaquecerão rapidamente e reduzirão suas frequências.

Antes da compra, é necessário considerar:

  • ausência de ventiladores embutidos;
  • ausência de saídas de vídeo;
  • características do conector de alimentação;
  • comprimento e case de dois slots;
  • compatibilidade de drivers e softwares;
  • consumo de energia de até 250 W.

Um preço baixo no mercado secundário não significa instalação simples. Para um funcionamento estável, será necessário uma fonte de alimentação potente, dutos de ar ou ventoinhas separadas e um case com boa ventilação.

O que verificar ao comprar

As placas Tesla P40 e V100 estão há muito à venda, principalmente no mercado secundário. Seu estado depende das condições de uso, temperatura e tempo de funcionamento no servidor.

Antes da compra, é desejável verificar:

  • identificação da placa no sistema;
  • capacidade e erros de memória;
  • estabilidade sob carga prolongada;
  • temperaturas de operação;
  • ausência de throttling;
  • compatibilidade da placa com a versão desejada do CUDA;
  • suporte da placa ao framework ou renderer escolhido.

A V100 geralmente custa significativamente mais do que a P40. O valor adicional é justificado para treinamento de redes neurais, FP64 e cálculos pesados, mas nem sempre faz sentido para simples inferência.

O que escolher

A Tesla P40 deve ser considerada se:

  • é necessário mais de 16 GB de memória de vídeo;
  • a tarefa principal é a inferência;
  • modelos locais grandes estão sendo executados;
  • virtualização está em uso;
  • processamento e transcodificação de vídeo são importantes;
  • o custo por gigabyte de memória é crítico.

A Tesla V100 PCIe 16 GB é melhor se:

  • o plano é treinar redes neurais;
  • núcleos Tensor são necessários;
  • precisão mista está sendo utilizada;
  • cálculos científicos estão sendo realizados;
  • o desempenho de FP64 é importante;
  • a carga de trabalho cabe em 16 GB.

Conclusão

A Tesla V100 PCIe 16 GB é um acelerador computacional mais rápido e versátil. É significativamente mais adequada para treinamento de redes neurais, cálculos científicos e tarefas CUDA pesadas.

A Tesla P40 deve ser escolhida por seus 24 GB de memória, inferência de baixo custo, virtualização ou processamento de vídeo. Se a carga de trabalho se enquadra em 16 GB, a V100 é quase sempre preferível. Contudo, se o modelo ou a cena exceder esse limite, os 8 GB adicionais da P40 podem se mostrar mais importantes do que toda a potência computacional da Volta.

Vantagens

  • Mais alto Relógio Boost: 1531MHz (1531MHz vs 1380MHz)
  • Maior Tamanho da Memória: 24GB (24GB vs 16GB)
  • Mais alto Largura de Banda: 897.0 GB/s (694.3 GB/s vs 897.0 GB/s)
  • Mais Unidades de Sombreamento: 5120 (3840 vs 5120)
  • Mais recente Data de lançamento: June 2017 (September 2016 vs June 2017)

Básico

NVIDIA
Nome do rótulo
NVIDIA
September 2016
Data de lançamento
June 2017
Professional
Plataforma
Professional
Tesla P40
Nome do modelo
Tesla V100 PCIe 16 GB
Tesla Pascal
Geração
Tesla
1303MHz
Relógio Base
1245MHz
1531MHz
Relógio Boost
1380MHz
PCIe 3.0 x16
Interface de ônibus
PCIe 3.0 x16
11,800 million
Transistores
21,100 million
-
Núcleos Tensor
?
Os Tensor Cores são unidades de processamento especializadas projetadas especificamente para aprendizado profundo, oferecendo maior desempenho de treinamento e inferência em comparação ao treinamento FP32.
640
240
TMUs
?
As Unidades de Mapeamento de Textura (TMUs) servem como componentes da GPU, capazes de girar, dimensionar e distorcer imagens binárias.
320
TSMC
Fundição
TSMC
16 nm
Tamanho do Processo
12 nm
Pascal
Arquitetura
Volta

Especificações de memória

24GB
Tamanho da Memória
16GB
GDDR5X
Tipo de Memória
HBM2
384bit
Barramento de Memória
?
A largura do barramento de memória se refere ao número de bits de dados que a memória de vídeo pode transferir em um ciclo de clock. Quanto maior a largura do barramento, maior a quantidade de dados que pode ser transmitida instantaneamente.
4096bit
1808MHz
Relógio de Memória
876MHz
694.3 GB/s
Largura de Banda
?
A largura de banda da memória se refere à taxa de transferência de dados entre o chip gráfico e a memória de vídeo. É medida em bytes por segundo.
897.0 GB/s

Tela e multimídia

No outputs
Saídas
No outputs

Desempenho Teórico

147.0 GPixel/s
Taxa de Pixel
?
A taxa de preenchimento de pixels refere-se ao número de pixels que uma unidade de processamento gráfico (GPU) pode renderizar por segundo, medida em MPixels/s ou GPixels/s.
176.6 GPixel/s
367.4 GTexel/s
Taxa de Textura
?
A taxa de preenchimento de textura se refere ao número de elementos do mapa de textura (texels) que uma GPU pode mapear para pixels em um único segundo.
441.6 GTexel/s
183.7 GFLOPS
FP16 (metade)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de meia precisão (16 bits) são usados em aplicações como aprendizado de máquina.
28.26 TFLOPS
367.4 GFLOPS
FP64 (duplo)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de precisão dupla (64 bits) são necessários para computação científica.
7.066 TFLOPS
11.995 TFLOPS
FP32 (flutuante)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de precisão simples (32 bits) são usados para tarefas comuns de processamento multimídia e gráfico, enquanto números de ponto flutuante de precisão dupla (64 bits) são necessários para computação científica que exige uma ampla faixa numérica e alta precisão. Números de ponto flutuante de meia precisão (16 bits) são usados para aplicações como aprendizado de máquina, onde uma precisão menor é aceitável.
14.413 TFLOPS

Diversos

30
Contagem de SM
?
Vários Processadores de Streaming (SPs), juntamente com outros recursos, formam um Multiprocessador de Streaming (SM), que também é referido como um núcleo principal da GPU.
80
3840
Unidades de Sombreamento
?
A unidade de processamento mais fundamental é o Processador de Streaming (SP), onde instruções e tarefas específicas são executadas. GPUs realizam computação paralela.
5120
48 KB (per SM)
Cache L1
128 KB (per SM)
3MB
Cache L2
6MB
250W
TDP
300W
1.3
Versão Vulkan
?
Vulkan é uma API gráfica e de computação multiplataforma do Khronos Group, que oferece alto desempenho e baixa sobrecarga de CPU. Ele permite que os desenvolvedores controlem a GPU diretamente, reduz a sobrecarga de renderização e oferece suporte a processadores multi-threading e multi-core.
1.3
3.0
Versão OpenCL
3.0
4.6
OpenGL
4.6
6.1
CUDA
7.0
12 (12_1)
DirectX
12 (12_1)
8-pin EPS
Conectores de Energia
2x 8-pin
96
ROPs
?
O Raster Operations Pipeline (ROPs) é responsável por lidar com cálculos de iluminação e reflexão em jogos, além de gerenciar efeitos como anti-aliasing (AA), alta resolução, fumaça e fogo.
128
6.7
Modelo de Shader
6.6
600W
PSU Sugerido
700W

Classificações

FP32 (flutuante) / TFLOPS
Tesla P40
11.995
Tesla V100 PCIe 16 GB
14.413 +20%
OctaneBench
Tesla P40
163
Tesla V100 PCIe 16 GB
345 +112%