NVIDIA Tesla P40
vs
NVIDIA Tesla V100 PCIe 16 GB

vs
Comparación de tarjetas gráficas NVIDIA Tesla P40 vs NVIDIA Tesla V100 PCIe 16 GB

Resultado de la comparación de GPU

NVIDIA Tesla P40 contra Tesla V100 PCIe 16 GB: 24 GB de memoria o una arquitectura más potente

NVIDIA Tesla P40 y Tesla V100 PCIe 16 GB consume la misma cantidad de 250 W, pero están diseñadas para diferentes cargas de trabajo. P40 apuesta por 24 GB de memoria, inferencia, virtualización y procesamiento de video. V100 ofrece una arquitectura Volta más avanzada, núcleos Tensor, rápida HBM2 y rendimiento completo en cálculos científicos.

Por lo tanto, comparar estos aceleradores solo por núcleos CUDA o FP32 no tiene sentido. Se elige la P40 cuando la carga de trabajo no cabe en 16 GB, mientras que la V100 se escoge cuando son importantes la velocidad de entrenamiento, el ancho de banda de memoria y los cálculos FP64.

Diferencias clave

Característica Tesla P40 Tesla V100 PCIe 16 GB
Arquitectura Pascal Volta
Núcleos CUDA 3840 5120
Núcleos Tensor No 640
Memoria de video 24 GB GDDR5 16 GB HBM2
Ancho de banda 346 GB/s hasta 900 GB/s
FP32 hasta 12 TFLOPS hasta 14 TFLOPS
Principales tareas Inferencia, vGPU, video Entrenamiento de IA, HPC, CUDA

La diferencia en FP32 es pequeña, pero no refleja bien la verdadera relación de fuerzas. La V100 no solo tiene más núcleos CUDA, sino también núcleos Tensor, memoria significativamente más rápida y mejoras arquitectónicas de Volta.

Pascal contra Volta

Tesla P40 se basa en la arquitectura Pascal y cuenta con 3840 núcleos CUDA. Fue creada como un acelerador de servidor para inferencia, capaz de atender múltiples modelos o usuarios a la vez. El soporte para INT8 y 24 GB de memoria la han hecho demandada en sistemas de aprendizaje automático, estaciones de trabajo virtuales y servidores de medios.

Tesla V100 utiliza la arquitectura Volta, 5120 núcleos CUDA y 640 núcleos Tensor. Estos últimos aceleran los cálculos matriciales en los que se basa el entrenamiento de redes neuronales. En tareas de precisión mixta, la V100 obtiene una ventaja que no se puede ver solo con el rendimiento FP32.

Los 47 TOPS declarados de la P40 y las métricas tensoriales de la V100 no se pueden comparar directamente: se refieren a diferentes formatos de datos. La P40 trabaja bien con inferencia optimizada en INT8, mientras que la V100 es significativamente más versátil y mejor adaptada al entrenamiento de modelos.

Memoria: volumen contra velocidad

La principal ventaja de la P40 es su memoria de 24 GB GDDR5. Los 8 GB adicionales pueden ser más importantes que una GPU más potente si el modelo, la escena o el conjunto de datos no caben en la memoria de la V100.

Esto se hace especialmente evidente al ejecutar modelos de lenguaje de forma local. Incluso un acelerador más rápido pierde su ventaja si una parte de los pesos tiene que descargarse en la memoria RAM o distribuirse entre varios dispositivos.

La V100 está limitada a 16 GB, pero su HBM2 proporciona un ancho de banda de hasta 900 GB/s, aproximadamente 2.6 veces más que el de la P40. Para el entrenamiento de redes neuronales, el procesamiento de grandes matrices y cálculos científicos, la alta velocidad de la memoria suele ser más importante que su volumen.

La elección aquí es extremadamente simple:

  • La P40 aloja cargas de trabajo más grandes;
  • La V100 procesa datos más rápido dentro de los 16 GB;
  • cuando falta memoria, la ventaja de la V100 se reduce rápidamente.

Entrenamiento e inferencia de redes neuronales

Para el entrenamiento de modelos, la V100 es casi siempre preferible mientras que se disponga de 16 GB. Los núcleos Tensor, HBM2 y el soporte para precisión mixta aceleran notablemente las cargas computacionales modernas.

La P40 resulta más lógica para implementar modelos ya entrenados. Es adecuada para inferencia en INT8, procesamiento por lotes de solicitudes y escenarios donde el costo por gigabyte de memoria es importante.

En sistemas de IA locales, la elección depende del tamaño del modelo. Un modelo compacto generalmente funciona más rápido en la V100. Sin embargo, si no cabe en 16 GB, la P40 de 24 GB puede resultar más práctica, a pesar de su arquitectura más antigua y la ausencia de núcleos Tensor.

Cálculos científicos y CUDA

En cálculos de doble precisión, la P40 no compite con la V100. El acelerador Pascal fue diseñado para inferencia y virtualización gráfica, y no para tareas pesadas de FP64.

La V100, por el contrario, fue creada para HPC. Es adecuada para modelado ingenieril, química computacional, física, análisis de datos y otras cargas que requieren un alto rendimiento de doble precisión.

En aplicaciones CUDA normales, la V100 también suele ser más rápida gracias a su GPU más potente y su alto ancho de banda de memoria. La excepción ocurre cuando el conjunto de trabajo requiere más de 16 GB.

Renderizado

En el renderizado CUDA, la V100 generalmente es más rápida que la P40 si la escena cabe en la memoria. Sin embargo, ambas tarjetas carecen de núcleos RT, por lo que se quedan atrás frente a los aceleradores RTX más nuevos en motores con trazado de rayos por hardware.

La P40 puede sobresalir en escenas grandes que superan los 16 GB. Aquí, la memoria adicional es más importante que la velocidad: la escena se carga completamente en la GPU o el renderizador se ve obligado a usar un modo de recorrido más lento.

Antes de comprar, vale la pena verificar la compatibilidad con el motor específico. Las Tesla antiguas no funcionan con todas las versiones actuales de software y controladores.

Video y virtualización

La P40 fue creada no solo para cálculos. Es muy adecuada para estaciones de trabajo virtuales, puestos de trabajo remotos, transcoding y procesamiento de video en servidor.

Para la V100, estas tareas son secundarias. Comprar la V100 solo para codificación de video o vGPU generalmente no tiene sentido: gran parte del costo se debe a la arquitectura de computación, núcleos Tensor y capacidades HPC.

Instalación en una computadora convencional

Ambas tarjetas utilizan refrigeración pasiva y están diseñadas para flujo de aire de servidor. En una carcasa convencional sin flujo dirigido, se sobrecalientan rápidamente y reducen sus frecuencias.

Antes de comprar, es necesario tener en cuenta:

  • la falta de ventiladores integrados;
  • la ausencia de salidas de video;
  • las características del conector de alimentación;
  • la longitud y el cuerpo de doble ranura;
  • la compatibilidad de controladores y programas;
  • el consumo de energía de hasta 250 W.

Un precio bajo en el mercado secundario no significa una instalación sencilla. Para un funcionamiento estable, se necesita una fuente de alimentación potente, ductos de aire o ventiladores individuales y una carcasa con buena ventilación.

Qué verificar al comprar

La Tesla P40 y la V100 se han estado vendiendo principalmente en el mercado secundario durante mucho tiempo. Su estado depende de las condiciones de uso, temperatura y duración de funcionamiento en el servidor.

Antes de comprar, es recomendable verificar:

  • la detección de la tarjeta en el sistema;
  • el volumen y los errores de memoria;
  • la estabilidad bajo carga prolongada;
  • las temperaturas de funcionamiento;
  • la ausencia de thermal throttling;
  • la compatibilidad de la tarjeta con la versión de CUDA necesaria;
  • el soporte de la tarjeta por el framework o renderizador elegido.

La V100 suele costar significativamente más que la P40. La sobrecarga está justificada para el entrenamiento de redes neuronales, FP64 y cálculos pesados, pero no siempre tiene sentido para la inferencia simple.

Qué elegir

La Tesla P40 debe considerarse si:

  • se requiere más de 16 GB de memoria de video;
  • la tarea principal es la inferencia;
  • se ejecutan modelos locales grandes;
  • se utiliza virtualización;
  • son importantes el procesamiento y la transcoding de video;
  • el costo por gigabyte de memoria es crítico.

La Tesla V100 PCIe 16 GB es mejor si:

  • se planea entrenar redes neuronales;
  • se necesitan núcleos Tensor;
  • se utiliza precisión mixta;
  • se realizan cálculos científicos;
  • el rendimiento FP64 es importante;
  • la carga de trabajo cabe en 16 GB.

Conclusión

La Tesla V100 PCIe 16 GB es un acelerador de cómputo más rápido y versátil. Es notablemente más adecuada para el entrenamiento de redes neuronales, cálculos científicos y tareas pesadas de CUDA.

La Tesla P40 tiene sentido elegirla por sus 24 GB de memoria, inferencia económica, virtualización o procesamiento de video. Si la carga de trabajo se puede manejar con 16 GB, la V100 casi siempre es preferible. Sin embargo, si el modelo o la escena supera ese volumen, los 8 GB adicionales de la P40 pueden resultar más importantes que toda la potencia computacional de Volta.

Ventajas

  • Mas alto Reloj de impulso: 1531MHz (1531MHz vs 1380MHz)
  • Más grande Tamaño de memoria: 24GB (24GB vs 16GB)
  • Mas alto Ancho de banda: 897.0 GB/s (694.3 GB/s vs 897.0 GB/s)
  • Más Unidades de sombreado: 5120 (3840 vs 5120)
  • Más nuevo Fecha de Lanzamiento: June 2017 (September 2016 vs June 2017)

Básico

NVIDIA
Nombre de Etiqueta
NVIDIA
September 2016
Fecha de Lanzamiento
June 2017
Professional
Plataforma
Professional
Tesla P40
Nombre del modelo
Tesla V100 PCIe 16 GB
Tesla Pascal
Generación
Tesla
1303MHz
Reloj base
1245MHz
1531MHz
Reloj de impulso
1380MHz
PCIe 3.0 x16
Interfaz de bus
PCIe 3.0 x16
11,800 million
Transistores
21,100 million
-
Núcleos tensor
?
Los Tensor Cores son unidades de procesamiento especializadas diseñadas específicamente para el aprendizaje profundo, proporcionando un rendimiento de entrenamiento e inferencia más alto en comparación con el entrenamiento FP32. Permiten cálculos rápidos en áreas como la visión por computadora, el procesamiento del lenguaje natural, el reconocimiento de voz, la conversión de texto a voz y las recomendaciones personalizadas. Las dos aplicaciones más destacadas de los Tensor Cores son DLSS (Deep Learning Super Sampling) y AI Denoiser para la reducción de ruido.
640
240
TMUs
?
Las unidades de mapeo de texturas (TMUs) funcionan como componentes de la GPU, capaces de rotar, escalar y distorsionar imágenes binarias, para luego colocarlas como texturas sobre cualquier plano de un modelo 3D dado. Este proceso se llama mapeo de texturas.
320
TSMC
Fundición
TSMC
16 nm
Tamaño proceso
12 nm
Pascal
Arquitectura
Volta

Especificaciones de Memoria

24GB
Tamaño de memoria
16GB
GDDR5X
Tipo de memoria
HBM2
384bit
Bus de memoria
?
La anchura del bus de memoria se refiere al número de bits de datos que la memoria de video puede transferir en un solo ciclo de reloj. Cuanto mayor sea la anchura del bus, mayor será la cantidad de datos que se pueden transmitir instantáneamente, lo que lo convierte en uno de los parámetros cruciales de la memoria de video. El ancho de banda de memoria se calcula como: Ancho de banda de memoria = Frecuencia de memoria x Anchura de bus de memoria / 8. Por lo tanto, cuando las frecuencias de memoria son similares, la anchura del bus de memoria determinará el tamaño del ancho de banda de memoria.
4096bit
1808MHz
Reloj de memoria
876MHz
694.3 GB/s
Ancho de banda
?
La "ancho de banda de memoria" se refiere a la tasa de transferencia de datos entre el chip gráfico y la memoria de video. Se mide en bytes por segundo, y la fórmula para calcularlo es: ancho de banda de memoria = frecuencia de trabajo × ancho de bus de memoria / 8 bits.
897.0 GB/s

Pantalla y multimedia

No outputs
Salidas
No outputs

Rendimiento teórico

147.0 GPixel/s
Tasa de píxeles
?
La tasa de llenado de píxeles se refiere al número de píxeles que una unidad de procesamiento gráfico (GPU) puede renderizar por segundo, medida en MPíxeles/s (millones de píxeles por segundo) o GPíxeles/s (miles de millones de píxeles por segundo). Es la métrica más comúnmente utilizada para evaluar el rendimiento de procesamiento de píxeles de una tarjeta gráfica.
176.6 GPixel/s
367.4 GTexel/s
Tasa de texturas
?
La tasa de llenado de texturas se refiere al número de elementos del mapa de textura (texels) que una GPU puede asignar a píxeles en un solo segundo.
441.6 GTexel/s
183.7 GFLOPS
FP16 (mitad)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
28.26 TFLOPS
367.4 GFLOPS
FP64 (doble)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
7.066 TFLOPS
11.995 TFLOPS
FP32 (flotante)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
14.413 TFLOPS

Misceláneos

30
Cuenta de SM
?
Múltiples Procesadores de Transmisión (SP), junto con otros recursos, forman un Multiprocesador de Transmisión (SM), que también se conoce como el núcleo principal de una GPU. Estos recursos adicionales incluyen componentes como planificadores de bloques, registros y memoria compartida. El SM puede considerarse como el corazón de la GPU, similar a un núcleo de CPU, donde los registros y la memoria compartida son recursos escasos dentro del SM.
80
3840
Unidades de sombreado
?
La unidad de procesamiento más fundamental es el Procesador de Secuencias (SP), donde se ejecutan instrucciones y tareas específicas. Las GPU realizan cómputo paralelo, lo que significa que varios SP trabajan simultáneamente para procesar tareas.
5120
48 KB (per SM)
Caché L1
128 KB (per SM)
3MB
Caché L2
6MB
250W
TDP
300W
1.3
Vulkan Versión
?
Vulkan es una API de gráficos y computación multiplataforma de Khronos Group, ofrece alto rendimiento y bajo consumo de CPU. Permite a los desarrolladores controlar la GPU directamente, reduce el overhead de renderización y soporta multi-threading y procesadores multi-núcleo.
1.3
3.0
OpenCL Versión
3.0
4.6
OpenGL
4.6
6.1
CUDA
7.0
12 (12_1)
DirectX
12 (12_1)
8-pin EPS
Conectores de alimentación
2x 8-pin
96
ROPs
?
La tubería de operaciones raster (ROPs) es principalmente responsable de manejar los cálculos de iluminación y reflexión en los juegos, así como de administrar efectos como el anti-aliasing (AA), alta resolución, humo y fuego. Cuanto más exigentes sean el anti-aliasing y los efectos de iluminación en un juego, mayores serán los requisitos de rendimiento para los ROPs; de lo contrario, puede resultar en una caída brusca en la velocidad de fotogramas.
128
6.7
Modelo de sombreado
6.6
600W
PSU sugerida
700W

Clasificaciones

FP32 (flotante) / TFLOPS
Tesla P40
11.995
Tesla V100 PCIe 16 GB
14.413 +20%
OctaneBench
Tesla P40
163
Tesla V100 PCIe 16 GB
345 +112%