NVIDIA Tesla P40
vs
NVIDIA Tesla P100 PCIe 16 GB

vs
Comparação de placas de vídeo NVIDIA Tesla P40 vs NVIDIA Tesla P100 PCIe 16 GB

Resultado de comparação de GPU

NVIDIA Tesla P40 vs Tesla P100 PCIe 16 GB: o que é melhor para IA, renderização e computações

NVIDIA Tesla P40 e Tesla P100 pertencem à geração Pascal, mas foram criadas para diferentes tarefas. A P40 é voltada para inferência, virtualização e computações de precisão única. A P100 é um acelerador específico para HPC com memória HBM2 rápida, alta performance FP64 e computações aceleradas FP16.

Portanto, uma maior quantidade de núcleos CUDA na P40 não a torna uma placa mais poderosa em todos os cenários.

Principais diferenças

Característica Tesla P40 Tesla P100 PCIe 16 GB
Núcleos CUDA 3840 3584
Memória de vídeo 24 GB GDDR5 16 GB HBM2
Largura de banda 346 GB/s 732 GB/s
FP32 cerca de 12 TFLOPS cerca de 9,3 TFLOPS
FP64 fortemente limitada cerca de 4,7 TFLOPS
FP16 sem aceleração significativa cerca de 18,7 TFLOPS
INT8 até 47 TOPS não é modo principal
TDP 250 W 250 W

Onde a Tesla P40 se destaca

A Tesla P40 oferece 3840 núcleos CUDA, 24 GB de memória e maior performance de pico FP32.

A principal vantagem prática é a quantidade de memória de vídeo. Os adicionais 8 GB permitem acomodar modelos, cenas e conjuntos de dados maiores. Isso é útil para renderização, processamento de imagens e execução de redes neurais que não cabem em 16 GB.

A P40 também suporta aceleração INT8 de até 47 TOPS. Portanto, ela se adequa melhor às tarefas de inferência, onde um modelo já treinado processa um grande número de requisições.

Pontos fortes da P40:

  • 24 GB de memória de vídeo;
  • alta velocidade FP32;
  • aceleração INT8;
  • renderização de cenas grandes;
  • inferência sem Tensor Cores.

Por que a P100 é mais rápida em HPC

A Tesla P100 utiliza memória HBM2 com largura de banda de 732 GB/s - mais do que o dobro do valor da P40. Isso é especialmente importante em tarefas onde o GPU transferindo constantemente grandes volumes de dados entre a memória e os blocos de computação.

A alta largura de banda é útil em álgebra linear, simulação, cálculos de engenharia e aplicações científicas. Em algoritmos limitados pela velocidade da memória, a P100 pode ser mais rápida, apesar de ter uma performance de pico FP32 mais baixa.

A principal vantagem da P100 é a velocidade total de precisão dupla. Ela entrega cerca de 4,7 TFLOPS FP64, enquanto na P40 esse modo é severamente restringido. Em programas científicos e de engenharia, a diferença pode ser medida não em porcentagens, mas em várias vezes.

A P100 é claramente a preferida para:

  • simulações físicas e climáticas;
  • química computacional;
  • análise de engenharia;
  • modelagem financeira;
  • cálculos científicos FP64;
  • algoritmos sensíveis à velocidade da memória.

O que escolher para redes neurais

Ambas as placas surgiram antes dos Tensor Cores, portanto, ficam significativamente atrás dos aceleradores modernos nas cargas de trabalho atuais de IA.

A P100 é mais adequada para treinar modelos devido à rápida HBM2 e alta velocidade FP16. A P40 é mais lógica para inferência, especialmente quando 24 GB de memória ou INT8 são essenciais.

No entanto, o resultado depende muito do software. Os frameworks modernos estão cada vez mais otimizados para Tensor Cores, BF16 e arquiteturas mais recentes, portanto, o potencial de Pascal não se revela em todas as tarefas.

Renderização e CUDA

Na renderização e em cálculos CUDA comuns, a P40 muitas vezes parece mais atraente. Ela ganha onde a performance é determinada pelo número de operações FP32 e pela quantidade de memória disponível.

A P100 consegue se destacar se o aplicativo é limitado pela velocidade de troca de dados. Portanto, o resultado depende da carga específica: a P40 é mais forte em tarefas computacionalmente intensivas FP32, enquanto a P100 brilha em algoritmos com intensivo uso de memória.

Ambas as placas utilizam resfriamento passivo e precisam de um forte fluxo de ar direcionado. Em um gabinete comum sem refrigeração separada, elas superaquecem rapidamente. Também não há saídas de vídeo, tornando esses aceleradores inadequados para um computador para jogos.

Vale a pena comprá-las hoje?

Ambos os modelos estão desatualizados e não suportam Tensor Cores. Eles devem ser considerados principalmente no mercado de segunda mão e apenas para tarefas específicas.

A Tesla P40 é interessante por seus 24 GB de memória de vídeo, inferência barata e renderização. A Tesla P100 mantém seu valor onde são necessários FP64, FP16 e alta largura de banda HBM2.

Ao comprar, também é importante considerar o estado da placa, compatibilidade com drivers, requisitos de energia e a necessidade de resfriamento separado.

Conclusão

A Tesla P40 é mais adequada para inferência, renderização e tarefas que necessitam de 24 GB de memória de vídeo. Suas vantagens incluem alta velocidade FP32, suporte a INT8 e maior volume de memória.

A Tesla P100 PCIe 16 GB é significativamente mais forte em HPC, FP64, FP16 e cargas que dependem da largura de banda da memória. A HBM2 e os blocos de precisão dupla a tornam um acelerador especializado para cálculos científicos e de engenharia.

A P40 é a escolha pela quantidade de memória e FP32/INT8. A P100 é a ferramenta para tarefas onde a precisão dos cálculos e a velocidade de troca de dados são mais importantes.

Vantagens

  • Mais alto Relógio Boost: 1531MHz (1531MHz vs 1329MHz)
  • Maior Tamanho da Memória: 24GB (24GB vs 16GB)
  • Mais Unidades de Sombreamento: 3840 (3840 vs 3584)
  • Mais recente Data de lançamento: September 2016 (September 2016 vs June 2016)
  • Mais alto Largura de Banda: 732.2 GB/s (694.3 GB/s vs 732.2 GB/s)

Básico

NVIDIA
Nome do rótulo
NVIDIA
September 2016
Data de lançamento
June 2016
Professional
Plataforma
Professional
Tesla P40
Nome do modelo
Tesla P100 PCIe 16 GB
Tesla Pascal
Geração
Tesla
1303MHz
Relógio Base
1190MHz
1531MHz
Relógio Boost
1329MHz
PCIe 3.0 x16
Interface de ônibus
PCIe 3.0 x16
11,800 million
Transistores
15,300 million
240
TMUs
?
As Unidades de Mapeamento de Textura (TMUs) servem como componentes da GPU, capazes de girar, dimensionar e distorcer imagens binárias.
224
TSMC
Fundição
TSMC
16 nm
Tamanho do Processo
16 nm
Pascal
Arquitetura
Pascal

Especificações de memória

24GB
Tamanho da Memória
16GB
GDDR5X
Tipo de Memória
HBM2
384bit
Barramento de Memória
?
A largura do barramento de memória se refere ao número de bits de dados que a memória de vídeo pode transferir em um ciclo de clock. Quanto maior a largura do barramento, maior a quantidade de dados que pode ser transmitida instantaneamente.
4096bit
1808MHz
Relógio de Memória
715MHz
694.3 GB/s
Largura de Banda
?
A largura de banda da memória se refere à taxa de transferência de dados entre o chip gráfico e a memória de vídeo. É medida em bytes por segundo.
732.2 GB/s

Tela e multimídia

No outputs
Saídas
No outputs

Desempenho Teórico

147.0 GPixel/s
Taxa de Pixel
?
A taxa de preenchimento de pixels refere-se ao número de pixels que uma unidade de processamento gráfico (GPU) pode renderizar por segundo, medida em MPixels/s ou GPixels/s.
127.6 GPixel/s
367.4 GTexel/s
Taxa de Textura
?
A taxa de preenchimento de textura se refere ao número de elementos do mapa de textura (texels) que uma GPU pode mapear para pixels em um único segundo.
297.7 GTexel/s
183.7 GFLOPS
FP16 (metade)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de meia precisão (16 bits) são usados em aplicações como aprendizado de máquina.
19.05 TFLOPS
367.4 GFLOPS
FP64 (duplo)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de precisão dupla (64 bits) são necessários para computação científica.
4.763 TFLOPS
11.995 TFLOPS
FP32 (flutuante)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de precisão simples (32 bits) são usados para tarefas comuns de processamento multimídia e gráfico, enquanto números de ponto flutuante de precisão dupla (64 bits) são necessários para computação científica que exige uma ampla faixa numérica e alta precisão. Números de ponto flutuante de meia precisão (16 bits) são usados para aplicações como aprendizado de máquina, onde uma precisão menor é aceitável.
9.335 TFLOPS

Diversos

30
Contagem de SM
?
Vários Processadores de Streaming (SPs), juntamente com outros recursos, formam um Multiprocessador de Streaming (SM), que também é referido como um núcleo principal da GPU.
56
3840
Unidades de Sombreamento
?
A unidade de processamento mais fundamental é o Processador de Streaming (SP), onde instruções e tarefas específicas são executadas. GPUs realizam computação paralela.
3584
48 KB (per SM)
Cache L1
24 KB (per SM)
3MB
Cache L2
4MB
250W
TDP
250W
1.3
Versão Vulkan
?
Vulkan é uma API gráfica e de computação multiplataforma do Khronos Group, que oferece alto desempenho e baixa sobrecarga de CPU. Ele permite que os desenvolvedores controlem a GPU diretamente, reduz a sobrecarga de renderização e oferece suporte a processadores multi-threading e multi-core.
1.3
3.0
Versão OpenCL
3.0
4.6
OpenGL
4.6
6.1
CUDA
6.0
12 (12_1)
DirectX
12 (12_1)
8-pin EPS
Conectores de Energia
1x 8-pin
96
ROPs
?
O Raster Operations Pipeline (ROPs) é responsável por lidar com cálculos de iluminação e reflexão em jogos, além de gerenciar efeitos como anti-aliasing (AA), alta resolução, fumaça e fogo.
96
6.7
Modelo de Shader
6.4
600W
PSU Sugerido
600W

Classificações

FP32 (flutuante) / TFLOPS
Tesla P40
11.995 +28%
Tesla P100 PCIe 16 GB
9.335
Blender
Tesla P40
802
Tesla P100 PCIe 16 GB
1200 +50%
OctaneBench
Tesla P40
163
Tesla P100 PCIe 16 GB
217 +33%