NVIDIA GB10

NVIDIA GB10
Análise da placa de vídeo NVIDIA GB10

NVIDIA GB10: 1 PFLOP e 128 GB de memória para IA local

O GB10 foi projetado para estações de IA compactas, como o NVIDIA DGX Spark, e é claramente diferente das placas de vídeo Blackwell convencionais. Em um único chassi, ele combina um processador Arm de 20 núcleos, gráficos Blackwell e 128 GB de memória compartilhada LPDDR5X. A NVIDIA afirma ter desempenho de até 1 PFLOP FP4, e testes reais confirmam esse nível. Em tarefas práticas de IA, a largura de banda da memória se torna uma limitação importante.

O que diferencia o GB10 da GeForce

O GB10 foi apresentado pela primeira vez em janeiro de 2025 como parte do Project DIGITS. Mais tarde, esse conceito foi a base do DGX Spark, e a plataforma começou a ser utilizada por outros fabricantes. O GB10 é a base de sistemas como ASUS Ascent GX10, Lenovo ThinkStation PGX, HP ZGX Nano G1n, GIGABYTE AI TOP ATOM, Acer Veriton GN100 e outros sistemas compactos de IA.

A principal vantagem do GB10 é a sua memória compartilhada de 128 GB para CPU e GPU.

Com essa quantidade, o GB10 pode executar localmente modelos que não cabem nos 16-32 GB de VRAM da maioria das placas de vídeo de consumo. De acordo com a NVIDIA, os sistemas baseados no GB10 são capazes de trabalhar com modelos de até 200 bilhões de parâmetros, desde que a quantização e as otimizações sejam adequadas.

Testes confirmam o 1 PFLOP declarado

O valor de 1 PFLOP refere-se a cálculos FP4 com esparsidade de 2:4. Não é possível julgar diretamente a velocidade total da parte gráfica ou a rapidez da geração de tokens em LLM com base nesse número.

Em 2026, surgiram resultados reproduzíveis com o nvfp4bench, que testa os Tensor Cores do GB10 em cálculos NVFP4. Os sistemas de produção mostram cerca de 486-504 TFLOPS em NVFP4 denso e aproximadamente 1 PFLOP em esparsidade de 2:4.

GB10 em dispositivos específicos

Dispositivo NVFP4 Denso NVFP4 Esparso 2:4 Largura de banda da memória
HP ZGX Nano G1n 503,9 TFLOPS 1007,8 TFLOPS 207 GB/s
Lenovo ThinkStation PGX 498,4 TFLOPS 996,7 TFLOPS 213 GB/s
ASUS Ascent GX10 497,5 TFLOPS 994,8 TFLOPS 205 GB/s
GIGABYTE AI TOP ATOM 496,6 TFLOPS 993,4 TFLOPS 214 GB/s
NVIDIA DGX Spark 486,3 TFLOPS 973,2 TFLOPS 207 GB/s

Todos os resultados foram obtidos com um único tipo de teste, portanto, eles podem ser comparados diretamente. A variação entre os sistemas é pequena, e as diferenças em chassi, refrigeração e configurações têm pouco impacto no resultado final.

Limitações de largura de banda da memória

Os Tensor Cores oferecem alto desempenho em baixa precisão, enquanto a largura de banda oficial de 128 GB LPDDR5X é de até 273 GB/s. Em testes práticos, os sistemas geralmente apresentam cerca de 200-214 GB/s.

Para inferência local de LLM, esse número é especialmente importante. Durante a geração sequencial de tokens, os pesos do modelo são constantemente lidos da memória, portanto, a velocidade é frequentemente limitada pela largura de banda da memória.

Por isso, 1 PFLOP não pode ser traduzido diretamente na velocidade de operação de uma rede neural específica.

Durante o pré-preenchimento longo, processamento em lote e consultas paralelas, os Tensor Cores são carregados de forma mais eficiente. O GB10 pode alocar na memória compartilhada modelos que não cabem na VRAM de uma única placa de vídeo convencional.

Embora a capacidade de memória seja grande, sua largura de banda é significativamente menor do que a da GDDR7 em GPUs discretas de alto desempenho.

Quantos tokens por segundo o GB10 gera

Testes práticos de LLM mostram melhor o caráter do GB10 do que o desempenho máximo em FP4. No NVIDIA DGX Spark com Ollama 0.18.3 e CUDA 13.0, a velocidade diminui visivelmente à medida que o modelo denso cresce, mas 128 GB de memória permitem executar modelos que não cabem na maioria das placas de vídeo de consumo.

Modelo Tamanho na memória Geração Processamento de consulta
Llama 3.1 8B 4,9 GB 42,86 tok/s 574,79 tok/s
Qwen3 32B 20 GB 9,88 tok/s 141,91 tok/s
Llama 3.1 70B 42 GB 4,76 tok/s 67,92 tok/s
Mistral Large 123B 73 GB 2,28 tok/s 10,43 tok/s

Os resultados evidenciam a limitação do LPDDR5X. O Llama 3.1 8B gera cerca de 43 tokens por segundo, enquanto o Llama 3.1 70B tem uma velocidade reduzida para cerca de 4,8 tokens por segundo. O Mistral Large 123B opera ainda mais lentamente, mas a capacidade de alocar um modelo desse tamanho na memória de um sistema compacto é uma das vantagens do GB10.

A arquitetura do modelo também exerce uma forte influência sobre o resultado. Em testes específicos, o llama.cpp Qwen3 30B com arquitetura MoE apresentou cerca de 89 tokens por segundo, enquanto o denso Qwen3 32B alcançou cerca de 11 tokens por segundo. No MoE, apenas parte dos parâmetros é utilizada na geração, o que faz com que esse modelo dependa menos da largura de banda da memória do GB10.

Quanto custam os computadores com GB10

Até agosto de 2026, o GB10 é utilizado em vários sistemas de produção. O desempenho do chip varia apenas ligeiramente, enquanto os preços e a capacidade de armazenamento variam significativamente de acordo com o modelo específico.

Sistema Armazenamento Preço a partir de
ASUS Ascent GX10 1 TB cerca de €3 999
Lenovo ThinkStation PGX 1 TB cerca de €4 733
HP ZGX Nano G1n 2 TB cerca de €5 199
GIGABYTE AI TOP ATOM 4 TB cerca de €5 499
NVIDIA DGX Spark Founders Edition 4 TB cerca de €5 599
Acer Veriton GN100 4 TB cerca de €5 999

Os preços referem-se às ofertas no mercado europeu e dependem da configuração específica.

Em relação ao custo-benefício, o ASUS Ascent GX10 se destaca em comparação com os demais. Ele é mais barato do que alguns concorrentes em mais de €1.000, enquanto os resultados em NVFP4 diferem apenas alguns por cento.

O custo adicional para modelos mais caros geralmente se deve ao SSD, quantidade de portas, garantia e suporte. Isso não resulta em um aumento significativo no desempenho do GB10.

Como o Project DIGITS, DGX Spark e GB10 estão relacionados

O GB10 possui vários nomes relacionados, que surgiram em diferentes etapas do desenvolvimento da plataforma. Em janeiro de 2025, a NVIDIA apresentou a plataforma sob o nome de Project DIGITS. Mais tarde, seu sistema próprio recebeu o nome de DGX Spark, e o GB10 começou a ser utilizado pela ASUS, Lenovo, HP, GIGABYTE e outros fabricantes.

Nome O que é
Project DIGITS conceito inicial de computador compacto de IA
NVIDIA GB10 Superchip Grace Blackwell
NVIDIA DGX Spark sistema de produção da NVIDIA baseado no GB10
ASUS GX10, Lenovo PGX, HP ZGX e outros sistemas OEM na mesma plataforma

ASUS GX10, Lenovo PGX e HP ZGX utilizam a mesma plataforma computacional GB10. As diferenças entre esses sistemas referem-se principalmente ao chassi, armazenamento, refrigeração e periféricos.

O GB10 deve ser considerado como um SoC especializado para estações de trabalho de IA. A parte gráfica utiliza a arquitetura Blackwell, e a plataforma combina CPU, GPU e memória compartilhada em uma única solução.

Conclusão

Com um preço a partir de cerca de €4.000, o GB10 é voltado para um nicho específico de tarefas. Se o modelo necessário cabe na VRAM de uma RTX convencional, uma placa de vídeo discreta geralmente oferece mais desempenho computacional pelo mesmo preço.

A vantagem do GB10 aparece em tarefas onde 24-32 GB de VRAM já são insuficientes. Seus 128 GB de memória compartilhada permitem a execução local de grandes modelos de IA sem a necessidade de várias GPUs discretas e de uma complexa distribuição de pesos entre elas.

Sistemas reais confirmam o nível declarado de cerca de 1 PFLOP FP4 com esparsidade de 2:4. Testes práticos de LLM mostram simultaneamente a limitação da largura de banda LPDDR5X: modelos densos de grande porte cabem na memória, mas geram tokens de forma relativamente lenta. O ponto forte do GB10 está na combinação de 128 GB de memória compartilhada, CUDA e um fator de forma compacto.

Básico

Nome do rótulo
NVIDIA
Plataforma
Desktop
Data de lançamento
August 2025
Nome do modelo
GB10
Geração
Server Blackwell
Relógio Base
1665 MHz
Relógio Boost
2525 MHz
Interface de ônibus
PCIe 5.0 x16
Transistores
Unknown
Núcleos RT
48
Núcleos Tensor
?
Os Tensor Cores são unidades de processamento especializadas projetadas especificamente para aprendizado profundo, oferecendo maior desempenho de treinamento e inferência em comparação ao treinamento FP32.
384
TMUs
?
As Unidades de Mapeamento de Textura (TMUs) servem como componentes da GPU, capazes de girar, dimensionar e distorcer imagens binárias.
384
Fundição
TSMC
Tamanho do Processo
3 nm
Arquitetura
Blackwell

Especificações de memória

Tamanho da Memória
128GB
Tipo de Memória
LPDDR5X
Barramento de Memória
?
A largura do barramento de memória se refere ao número de bits de dados que a memória de vídeo pode transferir em um ciclo de clock. Quanto maior a largura do barramento, maior a quantidade de dados que pode ser transmitida instantaneamente.
256bit
Relógio de Memória
1067 MHz
Largura de Banda
?
A largura de banda da memória se refere à taxa de transferência de dados entre o chip gráfico e a memória de vídeo. É medida em bytes por segundo.
273.2GB/s

Tela e multimídia

Saídas
1x HDMI

Desempenho Teórico

Taxa de Pixel
?
A taxa de preenchimento de pixels refere-se ao número de pixels que uma unidade de processamento gráfico (GPU) pode renderizar por segundo, medida em MPixels/s ou GPixels/s.
121.2 GPixel/s
Taxa de Textura
?
A taxa de preenchimento de textura se refere ao número de elementos do mapa de textura (texels) que uma GPU pode mapear para pixels em um único segundo.
969.6 GTexel/s
FP16 (metade)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de meia precisão (16 bits) são usados em aplicações como aprendizado de máquina.
124.1 TFLOPS
FP64 (duplo)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de precisão dupla (64 bits) são necessários para computação científica.
15.51 TFLOPS
FP32 (flutuante)
?
Uma métrica importante para medir o desempenho da GPU é a capacidade de computação de ponto flutuante. Números de ponto flutuante de precisão simples (32 bits) são usados para tarefas comuns de processamento multimídia e gráfico, enquanto números de ponto flutuante de precisão dupla (64 bits) são necessários para computação científica que exige uma ampla faixa numérica e alta precisão. Números de ponto flutuante de meia precisão (16 bits) são usados para aplicações como aprendizado de máquina, onde uma precisão menor é aceitável.
31.651 TFLOPS

Diversos

Contagem de SM
?
Vários Processadores de Streaming (SPs), juntamente com outros recursos, formam um Multiprocessador de Streaming (SM), que também é referido como um núcleo principal da GPU.
48
Unidades de Sombreamento
?
A unidade de processamento mais fundamental é o Processador de Streaming (SP), onde instruções e tarefas específicas são executadas. GPUs realizam computação paralela.
6144
Cache L1
256 KB (per SM)
Cache L2
50 MB
TDP
Unknown
Versão OpenCL
3.0
CUDA
10.1
Conectores de Energia
None
ROPs
?
O Raster Operations Pipeline (ROPs) é responsável por lidar com cálculos de iluminação e reflexão em jogos, além de gerenciar efeitos como anti-aliasing (AA), alta resolução, fumaça e fogo.
48
PSU Sugerido
200 W

Classificações

FP32 (flutuante)
Pontuação
31.651 TFLOPS
OpenCL
Pontuação
143663

Comparado com outra GPU

FP32 (flutuante) / TFLOPS
36.853 +16.4%
31.651
28.876 -8.8%
25.931 -18.1%
OpenCL
388405 +170.4%
186397 +29.7%
143663
90580 -36.9%
66428 -53.8%