NVIDIA GB10

NVIDIA GB10
Análisis de la tarjeta gráfica NVIDIA GB10

NVIDIA GB10: 1 PFLOP y 128 GB de memoria para AI local

El GB10 está diseñado para estaciones AI compactas como la NVIDIA DGX Spark y se diferencia notablemente de las tarjetas gráficas Blackwell convencionales. En una sola carcasa se combinan un procesador Arm de 20 núcleos, gráficos Blackwell y 128 GB de memoria compartida LPDDR5X. NVIDIA afirma un rendimiento de hasta 1 PFLOP FP4, y las pruebas reales confirman este nivel. En tareas AI prácticas, un importante límite se convierte en el ancho de banda de la memoria.

¿En qué se diferencia el GB10 de GeForce?

El GB10 se presentó por primera vez en enero de 2025 como parte del Project DIGITS. Más tarde, este concepto se convirtió en la base de DGX Spark, y la plataforma comenzó a ser utilizada por otros fabricantes. Basándose en el GB10 se han construido los sistemas ASUS Ascent GX10, Lenovo ThinkStation PGX, HP ZGX Nano G1n, GIGABYTE AI TOP ATOM, Acer Veriton GN100 y otros sistemas AI compactos.

La principal ventaja del GB10 radica en sus 128 GB de memoria compartida para CPU y GPU.

Gracias a este volumen, el GB10 puede ejecutar localmente modelos que no caben en los 16-32 GB de VRAM de la mayoría de las tarjetas gráficas de consumo. Según NVIDIA, los sistemas basados en el GB10 pueden trabajar con modelos de hasta 200 mil millones de parámetros con la cuantización y optimizaciones adecuadas.

Pruebas confirman el rendimiento declarado de 1 PFLOP

El valor de 1 PFLOP se refiere a cálculos FP4 con una sparsidad de 2:4. A partir de esta cifra, no se puede juzgar directamente sobre la velocidad total de la parte gráfica o sobre la velocidad de generación de tokens en LLM.

En 2026, aparecieron resultados reproducibles de nvfp4bench, que pone a prueba los Tensor Cores del GB10 en cálculos NVFP4. Los sistemas en serie muestran aproximadamente entre 486 y 504 TFLOPS en NVFP4 denso y alrededor de 1 PFLOP con 2:4 de sparsidad.

GB10 en dispositivos específicos

Dispositivo NVFP4 Denso NVFP4 Sparse 2:4 Ancho de banda de memoria
HP ZGX Nano G1n 503,9 TFLOPS 1007,8 TFLOPS 207 GB/s
Lenovo ThinkStation PGX 498,4 TFLOPS 996,7 TFLOPS 213 GB/s
ASUS Ascent GX10 497,5 TFLOPS 994,8 TFLOPS 205 GB/s
GIGABYTE AI TOP ATOM 496,6 TFLOPS 993,4 TFLOPS 214 GB/s
NVIDIA DGX Spark 486,3 TFLOPS 973,2 TFLOPS 207 GB/s

Todos los resultados se obtuvieron a partir de un único tipo de prueba, por lo que se pueden comparar directamente. La variación entre los sistemas es pequeña, y las diferencias en la carcasa, refrigeración y configuraciones afectan poco el resultado final.

Limitación en el ancho de banda de la memoria

Los Tensor Cores ofrecen un alto rendimiento en baja precisión, mientras que el ancho de banda oficial de la memoria LPDDR5X de 128 GB es de hasta 273 GB/s. En pruebas prácticas, los sistemas suelen mostrar alrededor de 200-214 GB/s.

Para la inferencia local de LLM, esta métrica es especialmente importante. Durante la generación secuencial de tokens, los pesos del modelo se leen constantemente de la memoria, por lo que la velocidad a menudo se ve limitada por su ancho de banda.

Por lo tanto, no se puede traducir directamente 1 PFLOP en la velocidad de funcionamiento de una red neuronal específica.

Con prefill largo, procesamiento por lotes y consultas paralelas, los Tensor Cores se cargan de manera más eficiente. El GB10 puede alojar en la memoria compartida modelos que no caben en la VRAM de una tarjeta gráfica de escritorio convencional.

El volumen de memoria es grande, pero su ancho de banda es notablemente inferior al de GDDR7 en potentes GPU discretas.

¿Cuántos tokens por segundo genera el GB10?

Las pruebas prácticas de LLM muestran mejor la naturaleza del GB10 que el rendimiento máximo de FP4. En la NVIDIA DGX Spark con Ollama 0.18.3 y CUDA 13.0, la velocidad disminuye notablemente a medida que aumenta el tamaño del modelo denso, pero los 128 GB de memoria permiten ejecutar modelos que no caben en la mayoría de las tarjetas gráficas de consumo.

Modelo Tamaño en memoria Generación Procesamiento de consulta
Llama 3.1 8B 4,9 GB 42,86 tok/s 574,79 tok/s
Qwen3 32B 20 GB 9,88 tok/s 141,91 tok/s
Llama 3.1 70B 42 GB 4,76 tok/s 67,92 tok/s
Mistral Large 123B 73 GB 2,28 tok/s 10,43 tok/s

Los resultados muestran claramente la limitación de LPDDR5X. Llama 3.1 8B genera alrededor de 43 tokens por segundo, mientras que la velocidad de Llama 3.1 70B se reduce a aproximadamente 4,8 tokens por segundo. Mistral Large 123B funciona aún más lento, pero la posibilidad de alojar un modelo de este tamaño en la memoria de un solo sistema compacto es una de las ventajas del GB10.

La arquitectura del modelo también influye significativamente en el resultado. En pruebas específicas, llama.cpp Qwen3 30B con arquitectura MoE mostró alrededor de 89 tokens por segundo, mientras que el denso Qwen3 32B alcanzó aproximadamente 11 tokens por segundo. En MoE, solo una parte de los parámetros se utiliza en la generación, por lo que este modelo depende menos del ancho de banda de la memoria del GB10.

¿Cuánto cuestan las computadoras con GB10?

Para agosto de 2026, el GB10 se utiliza en varios sistemas de serie. El rendimiento del chip varía ligeramente, mientras que los precios y la capacidad del almacenamiento dependen considerablemente del modelo específico.

Sistema Almacenamiento Precio desde
ASUS Ascent GX10 1 TB alrededor de €3 999
Lenovo ThinkStation PGX 1 TB alrededor de €4 733
HP ZGX Nano G1n 2 TB alrededor de €5 199
GIGABYTE AI TOP ATOM 4 TB alrededor de €5 499
NVIDIA DGX Spark Founders Edition 4 TB alrededor de €5 599
Acer Veriton GN100 4 TB alrededor de €5 999

Los precios se refieren a las ofertas en el mercado europeo y dependen de la configuración específica.

En relación calidad-precio, el ASUS Ascent GX10 parece ser más atractivo que los demás. Es más barato que algunos competidores en más de €1 000, y los resultados de NVFP4 difieren sólo unos pocos por ciento.

El sobrecoste por modelos más caros generalmente se relaciona con el SSD, el conjunto de puertos, la garantía y el soporte. No ofrece un aumento significativo en el rendimiento del GB10.

¿Cómo se relacionan Project DIGITS, DGX Spark y GB10?

El GB10 tiene varios nombres interrelacionados, que aparecieron en diferentes etapas de desarrollo de la plataforma. En enero de 2025, NVIDIA presentó la plataforma bajo el nombre de Project DIGITS. Posteriormente, el propio sistema de NVIDIA recibió el nombre de DGX Spark, y el GB10 comenzó a ser utilizado por ASUS, Lenovo, HP, GIGABYTE y otros fabricantes.

Nombre Qué es
Project DIGITS concepto inicial de una computadora AI compacta
NVIDIA GB10 Grace Blackwell Superchip
NVIDIA DGX Spark sistema de serie de NVIDIA basado en GB10
ASUS GX10, Lenovo PGX, HP ZGX y otros sistemas OEM en la misma plataforma

ASUS GX10, Lenovo PGX y HP ZGX utilizan la misma plataforma computacional GB10. Las diferencias entre estos sistemas se refieren principalmente a la carcasa, el almacenamiento, la refrigeración y la periferia.

Es más adecuado considerar el GB10 como un SoC especializado para estaciones de trabajo AI. La parte gráfica utiliza la arquitectura Blackwell, y la plataforma combina CPU, GPU y memoria compartida en una única solución.

Conclusión

Con un precio de aproximadamente €4 000, el GB10 está orientado a un nicho específico de tareas. Si el modelo requerido cabe en la VRAM de una RTX convencional, generalmente una tarjeta gráfica discreta proporcionará más rendimiento computacional por el mismo dinero.

La ventaja del GB10 se manifiesta en tareas donde 24-32 GB de VRAM ya son insuficientes. Su memoria compartida de 128 GB permite ejecutar localmente grandes modelos de AI sin requerir varias GPU discretas y complicadas distribuciones de pesos entre ellas.

Los sistemas reales confirman el nivel declarado de alrededor de 1 PFLOP FP4 con una sparsidad de 2:4. Las pruebas prácticas de LLM también muestran la limitación del ancho de banda de LPDDR5X: los modelos densos grandes caben en la memoria, pero generan tokens relativamente lento. El punto fuerte del GB10 radica en la combinación de 128 GB de memoria compartida, CUDA y un factor de forma compacto.

Básico

Nombre de Etiqueta
NVIDIA
Plataforma
Desktop
Fecha de Lanzamiento
August 2025
Nombre del modelo
GB10
Generación
Server Blackwell
Reloj base
1665 MHz
Reloj de impulso
2525 MHz
Interfaz de bus
PCIe 5.0 x16
Transistores
Unknown
Núcleos RT
48
Núcleos tensor
?
Los Tensor Cores son unidades de procesamiento especializadas diseñadas específicamente para el aprendizaje profundo, proporcionando un rendimiento de entrenamiento e inferencia más alto en comparación con el entrenamiento FP32. Permiten cálculos rápidos en áreas como la visión por computadora, el procesamiento del lenguaje natural, el reconocimiento de voz, la conversión de texto a voz y las recomendaciones personalizadas. Las dos aplicaciones más destacadas de los Tensor Cores son DLSS (Deep Learning Super Sampling) y AI Denoiser para la reducción de ruido.
384
TMUs
?
Las unidades de mapeo de texturas (TMUs) funcionan como componentes de la GPU, capaces de rotar, escalar y distorsionar imágenes binarias, para luego colocarlas como texturas sobre cualquier plano de un modelo 3D dado. Este proceso se llama mapeo de texturas.
384
Fundición
TSMC
Tamaño proceso
3 nm
Arquitectura
Blackwell

Especificaciones de Memoria

Tamaño de memoria
128GB
Tipo de memoria
LPDDR5X
Bus de memoria
?
La anchura del bus de memoria se refiere al número de bits de datos que la memoria de video puede transferir en un solo ciclo de reloj. Cuanto mayor sea la anchura del bus, mayor será la cantidad de datos que se pueden transmitir instantáneamente, lo que lo convierte en uno de los parámetros cruciales de la memoria de video. El ancho de banda de memoria se calcula como: Ancho de banda de memoria = Frecuencia de memoria x Anchura de bus de memoria / 8. Por lo tanto, cuando las frecuencias de memoria son similares, la anchura del bus de memoria determinará el tamaño del ancho de banda de memoria.
256bit
Reloj de memoria
1067 MHz
Ancho de banda
?
La "ancho de banda de memoria" se refiere a la tasa de transferencia de datos entre el chip gráfico y la memoria de video. Se mide en bytes por segundo, y la fórmula para calcularlo es: ancho de banda de memoria = frecuencia de trabajo × ancho de bus de memoria / 8 bits.
273.2GB/s

Pantalla y multimedia

Salidas
1x HDMI

Rendimiento teórico

Tasa de píxeles
?
La tasa de llenado de píxeles se refiere al número de píxeles que una unidad de procesamiento gráfico (GPU) puede renderizar por segundo, medida en MPíxeles/s (millones de píxeles por segundo) o GPíxeles/s (miles de millones de píxeles por segundo). Es la métrica más comúnmente utilizada para evaluar el rendimiento de procesamiento de píxeles de una tarjeta gráfica.
121.2 GPixel/s
Tasa de texturas
?
La tasa de llenado de texturas se refiere al número de elementos del mapa de textura (texels) que una GPU puede asignar a píxeles en un solo segundo.
969.6 GTexel/s
FP16 (mitad)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
124.1 TFLOPS
FP64 (doble)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
15.51 TFLOPS
FP32 (flotante)
?
Una métrica importante para medir el rendimiento de la GPU es la capacidad de cómputo de punto flotante. Los números de punto flotante de media precisión (16 bits) se utilizan para aplicaciones como el aprendizaje automático, donde se acepta una menor precisión. Los números de punto flotante de precisión simple (32 bits) se utilizan para tareas comunes de procesamiento multimedia y gráfico, mientras que los números de punto flotante de doble precisión (64 bits) son necesarios para la computación científica que requiere un amplio rango numérico y alta precisión.
31.651 TFLOPS

Misceláneos

Cuenta de SM
?
Múltiples Procesadores de Transmisión (SP), junto con otros recursos, forman un Multiprocesador de Transmisión (SM), que también se conoce como el núcleo principal de una GPU. Estos recursos adicionales incluyen componentes como planificadores de bloques, registros y memoria compartida. El SM puede considerarse como el corazón de la GPU, similar a un núcleo de CPU, donde los registros y la memoria compartida son recursos escasos dentro del SM.
48
Unidades de sombreado
?
La unidad de procesamiento más fundamental es el Procesador de Secuencias (SP), donde se ejecutan instrucciones y tareas específicas. Las GPU realizan cómputo paralelo, lo que significa que varios SP trabajan simultáneamente para procesar tareas.
6144
Caché L1
256 KB (per SM)
Caché L2
50 MB
TDP
Unknown
OpenCL Versión
3.0
CUDA
10.1
Conectores de alimentación
None
ROPs
?
La tubería de operaciones raster (ROPs) es principalmente responsable de manejar los cálculos de iluminación y reflexión en los juegos, así como de administrar efectos como el anti-aliasing (AA), alta resolución, humo y fuego. Cuanto más exigentes sean el anti-aliasing y los efectos de iluminación en un juego, mayores serán los requisitos de rendimiento para los ROPs; de lo contrario, puede resultar en una caída brusca en la velocidad de fotogramas.
48
PSU sugerida
200 W

Clasificaciones

FP32 (flotante)
Puntaje
31.651 TFLOPS
OpenCL
Puntaje
143663

Comparado con Otras GPU

FP32 (flotante) / TFLOPS
36.853 +16.4%
31.651
28.876 -8.8%
25.931 -18.1%
OpenCL
388405 +170.4%
186397 +29.7%
143663
90580 -36.9%
66428 -53.8%