NVIDIA GB10

NVIDIA GB10
Recensione della scheda video NVIDIA GB10

NVIDIA GB10: 1 PFLOP e 128 GB di memoria per AI locale

Il GB10 è progettato per stazioni AI compatte come la NVIDIA DGX Spark e differisce notevolmente dalle comuni schede grafiche Blackwell. In un'unica unità sono integrati un processore Arm a 20 core, la grafica Blackwell e 128 GB di memoria LPDDR5X condivisa. NVIDIA dichiara prestazioni fino a 1 PFLOP FP4, e i test reali confermano questo livello. In pratica, per i compiti AI, la larghezza di banda della memoria diventa un importante vincolo.

In cosa si differenzia il GB10 dalla GeForce

Il GB10 è stato mostrato per la prima volta a gennaio 2025 all'interno del Project DIGITS. Successivamente, questo concetto ha gettato le basi per la DGX Spark, e la piattaforma è stata adottata anche da altri produttori. Sui modelli basati su GB10 si trovano il ASUS Ascent GX10, il Lenovo ThinkStation PGX, l'HP ZGX Nano G1n, il GIGABYTE AI TOP ATOM, l'Acer Veriton GN100 e altri sistemi AI compatti.

Il principale vantaggio del GB10 risiede nei 128 GB di memoria condivisa per CPU e GPU.

Grazie a questo volume, il GB10 può eseguire localmente modelli che non rientrano nei 16-32 GB di VRAM della maggior parte delle schede grafiche per consumatori. Secondo NVIDIA, i sistemi basati su GB10 sono in grado di lavorare con modelli fino a 200 miliardi di parametri con una quantizzazione e ottimizzazioni appropriate.

I test confermano l'affermazione di 1 PFLOP

Il valore di 1 PFLOP si riferisce ai calcoli FP4 con una sparsità di 2:4. Da questo numero non si può giudicare direttamente la velocità complessiva della parte grafica o la velocità di generazione dei token negli LLM.

Nel 2026 sono emersi risultati riproducibili da nvfp4bench, che testa i Tensor Cores del GB10 nei calcoli NVFP4. I sistemi in serie mostrano circa 486-504 TFLOPS in NVFP4 denso e circa 1 PFLOP con sparsità 2:4.

GB10 in dispositivi specifici

Dispositivo NVFP4 Denso NVFP4 Sparso 2:4 Larghezza di banda della memoria
HP ZGX Nano G1n 503,9 TFLOPS 1007,8 TFLOPS 207 GB/s
Lenovo ThinkStation PGX 498,4 TFLOPS 996,7 TFLOPS 213 GB/s
ASUS Ascent GX10 497,5 TFLOPS 994,8 TFLOPS 205 GB/s
GIGABYTE AI TOP ATOM 496,6 TFLOPS 993,4 TFLOPS 214 GB/s
NVIDIA DGX Spark 486,3 TFLOPS 973,2 TFLOPS 207 GB/s

Tutti i risultati sono stati ottenuti con un unico tipo di test, quindi possono essere confrontati direttamente. La variazione tra i sistemi è minima, e le differenze nel case, nel raffreddamento e nelle impostazioni hanno un impatto limitato sul risultato finale.

Vincolo di larghezza di banda della memoria

I Tensor Cores offrono alte prestazioni in bassa precisione, mentre la larghezza di banda ufficiale di 128 GB LPDDR5X è fino a 273 GB/s. Nei test pratici, i sistemi mostrano solitamente circa 200-214 GB/s.

Per l'inferenza locale degli LLM, questo dato è particolarmente importante. Durante la generazione sequenziale dei token, i pesi del modello vengono costantemente letti dalla memoria, pertanto la velocità è spesso limitata dalla larghezza di banda della memoria.

Quindi, 1 PFLOP non può essere tradotto direttamente in velocità di funzionamento di una specifica rete neurale.

Con lungo prefill, elaborazione batch e richieste parallele, i Tensor Cores vengono caricati in modo più efficace. Il GB10 è in grado di allocare nella memoria condivisa modelli che non si adattano nella VRAM di una normale scheda grafica desktop.

Il volume di memoria è ampio, ma la sua larghezza di banda è notevolmente inferiore rispetto a quella della GDDR7 su potenti GPU discrete.

Quanti token al secondo produce il GB10

I test pratici con gli LLM mostrano meglio la natura del GB10 rispetto alla massima prestazione FP4. Su NVIDIA DGX Spark con Ollama 0.18.3 e CUDA 13.0, la velocità diminuisce notevolmente con l'aumento della densità del modello, ma i 128 GB di memoria consentono di eseguire modelli che non si adattano alla maggior parte delle schede grafiche per consumatori.

Modello Dimensione in memoria Generazione Elaborazione della richiesta
Llama 3.1 8B 4,9 GB 42,86 tok/s 574,79 tok/s
Qwen3 32B 20 GB 9,88 tok/s 141,91 tok/s
Llama 3.1 70B 42 GB 4,76 tok/s 67,92 tok/s
Mistral Large 123B 73 GB 2,28 tok/s 10,43 tok/s

I risultati mostrano bene il vincolo dell’LPDDR5X. Llama 3.1 8B genera circa 43 token al secondo, mentre la Llama 3.1 70B vede la velocità ridursi a circa 4,8 token al secondo. Mistral Large 123B funziona ancora più lentamente, ma la possibilità stessa di allocare un modello di tale dimensione nella memoria di un'unica sistema compatto rappresenta uno dei vantaggi del GB10.

L'architettura del modello influisce notevolmente sul risultato. In test separati, la llama.cpp Qwen3 30B con architettura MoE ha mostrato circa 89 token al secondo, mentre la densa Qwen3 32B raggiungeva circa 11 token al secondo. Con la MoE, durante la generazione viene utilizzata solo una parte dei parametri, quindi questo modello dipende molto meno dalla larghezza di banda della memoria del GB10.

Quanto costano i computer con GB10

Fino ad agosto 2026, il GB10 è utilizzato in diversi sistemi in serie. Le prestazioni del chip variano leggermente, mentre i prezzi e la capacità di archiviazione dipendono notevolmente dal modello specifico.

Sistema Archiviazione Prezzo da
ASUS Ascent GX10 1 TB circa €3.999
Lenovo ThinkStation PGX 1 TB circa €4.733
HP ZGX Nano G1n 2 TB circa €5.199
GIGABYTE AI TOP ATOM 4 TB circa €5.499
NVIDIA DGX Spark Founders Edition 4 TB circa €5.599
Acer Veriton GN100 4 TB circa €5.999

I prezzi si riferiscono alle offerte sul mercato europeo e dipendono dalla configurazione specifica.

In termini di rapporto qualità-prezzo, l'ASUS Ascent GX10 appare più vantaggioso rispetto agli altri. È più economico di oltre €1.000 rispetto ad alcuni concorrenti, e i risultati NVFP4 differiscono solo di alcuni punti percentuali.

Il sovrapprezzo per i modelli più costosi è solitamente relativo agli SSD, al set di porte, alla garanzia e al supporto. Non fornisce un sostanziale incremento delle prestazioni del GB10.

Come sono correlati Project DIGITS, DGX Spark e GB10

Il GB10 ha diversi nomi correlati, emersi in vari stadi dello sviluppo della piattaforma. A gennaio 2025, NVIDIA ha presentato la piattaforma con il nome di Project DIGITS. Successivamente, il sistema di proprietà di NVIDIA è stato chiamato DGX Spark, e il GB10 è stato utilizzato anche da ASUS, Lenovo, HP, GIGABYTE e altri produttori.

Nome Cosa è
Project DIGITS concetto iniziale di computer AI compatto
NVIDIA GB10 Superchip Grace Blackwell
NVIDIA DGX Spark sistema in serie di proprietà NVIDIA basato sul GB10
ASUS GX10, Lenovo PGX, HP ZGX e altri sistemi OEM sulla stessa piattaforma

ASUS GX10, Lenovo PGX e HP ZGX utilizzano la stessa piattaforma di calcolo GB10. Le differenze tra questi sistemi riguardano principalmente il case, l'archiviazione, il raffreddamento e le periferiche.

Il GB10 è più corretto considerarlo come un SoC specializzato per stazioni di lavoro AI. La parte grafica utilizza l'architettura Blackwell, mentre la piattaforma riunisce CPU, GPU e memoria condivisa in un'unica soluzione.

Conclusione

Con un prezzo a partire da circa €4.000, il GB10 è orientato a un pubblico ristretto di compiti. Se il modello desiderato si adatta alla VRAM di una comune RTX, una scheda grafica discreta fornirà più prestazioni di calcolo per lo stesso prezzo.

Il vantaggio del GB10 emerge in compiti in cui 24-32 GB di VRAM non sono più sufficienti. I suoi 128 GB di memoria condivisa permettono di eseguire localmente grandi modelli AI senza la necessità di più GPU discrete e di una complessa distribuzione dei pesi tra di esse.

I sistemi reali confermano il livello dichiarato di circa 1 PFLOP FP4 con sparsità di 2:4. I test pratici sugli LLM rivelano simultaneamente il vincolo della larghezza di banda dell’LPDDR5X: modelli densi di grandi dimensioni vengono caricati in memoria, ma generano token relativamente lentamente. Il punto di forza del GB10 risiede nella combinazione di 128 GB di memoria condivisa, CUDA e un fattore di forma compatto.

Di base

Nome dell'etichetta
NVIDIA
Piattaforma
Desktop
Data di rilascio
August 2025
Nome del modello
GB10
Generazione
Server Blackwell
Clock base
1665 MHz
Boost Clock
2525 MHz
Interfaccia bus
PCIe 5.0 x16
Transistor
Unknown
Core RT
48
Core Tensor
?
I Tensor Cores sono unità di elaborazione specializzate progettate specificamente per l'apprendimento profondo. Consentono calcoli rapidi in aree come la visione artificiale, l'elaborazione del linguaggio naturale, il riconoscimento vocale, la conversione da testo a voce e le raccomandazioni personalizzate.
384
TMUs
?
Le unità di mappatura texture (TMUs) servono come componenti della GPU, in grado di ruotare, scalare, distorcere immagini binarie e poi posizionarle come texture su qualsiasi piano di un dato modello 3D. Questo processo è chiamato mappatura texture.
384
Fonderia
TSMC
Dimensione del processo
3 nm
Architettura
Blackwell

Specifiche della memoria

Dimensione memoria
128GB
Tipo di memoria
LPDDR5X
Bus memoria
?
La larghezza del bus di memoria si riferisce al numero di bit di dati che la memoria video può trasferire in un singolo ciclo di clock. Maggiore è la larghezza del bus, maggiore è la quantità di dati che può essere trasmessa istantaneamente. La larghezza del bus di memoria è un parametro cruciale della memoria video. La larghezza di banda della memoria si calcola così: Larghezza di banda della memoria = Frequenza della memoria x Larghezza del bus di memoria / 8.
256bit
Clock memoria
1067 MHz
Larghezza di banda
?
La larghezza di banda della memoria si riferisce alla velocità di trasferimento dati tra il chip grafico e la memoria video. Si misura in byte al secondo e la formula per calcolarla è: larghezza di banda della memoria = frequenza di lavoro × larghezza del bus di memoria / 8 bit.
273.2GB/s

Display e multimedia

Uscite
1x HDMI

Prestazioni teoriche

Tasso di pixel
?
Il tasso di riempimento dei pixel si riferisce al numero di pixel che una unità di elaborazione grafica (GPU) può renderizzare al secondo, misurato in MPixel/s o GPixel/s. È la metrica più comunemente usata per valutare le prestazioni di elaborazione dei pixel di una scheda grafica.
121.2 GPixel/s
Tasso di texture
?
Il tasso di riempimento della texture si riferisce al numero di elementi di mappa texture (texel) che una GPU può mappare su pixel in un secondo.
969.6 GTexel/s
FP16 (metà)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri in virgola mobile a metà precisione (16 bit) vengono utilizzati per applicazioni come l'apprendimento automatico, dove è accettabile una precisione inferiore.
124.1 TFLOPS
FP64 (doppio)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri in virgola mobile a doppia precisione (64 bit) sono richiesti per il calcolo scientifico che richiede un'ampia gamma numerica e un'alta precisione.
15.51 TFLOPS
FP32 (virgola mobile)
?
Una metrica importante per misurare le prestazioni della GPU è la capacità di calcolo in virgola mobile. I numeri a virgola mobile a precisione singola (32 bit) vengono utilizzati per attività comuni di elaborazione grafica e multimediale, mentre i numeri a virgola mobile a precisione doppia (64 bit) sono necessari per il calcolo scientifico che richiede un'ampia gamma numerica e un'elevata precisione. I numeri a virgola mobile a mezza precisione (16 bit) vengono utilizzati per applicazioni come l'apprendimento automatico, dove è accettabile una precisione inferiore.
31.651 TFLOPS

Varie

Conteggio SM
?
Più processori di streaming (SP), insieme ad altre risorse, formano un multiprocessore di streaming (SM), che è anche considerato come il nucleo principale di una GPU. Queste risorse aggiuntive includono componenti come i programmi di schedulazione warp, i registri e la memoria condivisa.
48
Unità di ombreggiatura
?
L'unità di elaborazione più fondamentale è il processore di streaming (SP), dove vengono eseguite istruzioni e compiti specifici. Le GPU eseguono il calcolo parallelo, il che significa che più SP lavorano contemporaneamente per elaborare i compiti.
6144
Cache L1
256 KB (per SM)
Cache L2
50 MB
TDP
Unknown
Versione OpenCL
3.0
CUDA
10.1
Connettori di alimentazione
None
ROPs
?
Il raster operations pipeline (ROPs) si occupa principalmente di gestire i calcoli di illuminazione e riflessione nei giochi, così come gestire effetti come l'anti-aliasing (AA), l'alta risoluzione, il fumo e il fuoco. Più esigenti sono gli effetti di anti-aliasing e illuminazione in un gioco, più alte sono le prestazioni richieste per i ROPs.
48
PSU suggerito
200 W

Classifiche

FP32 (virgola mobile)
Punto
31.651 TFLOPS
OpenCL
Punto
143663

Rispetto ad altre GPU

FP32 (virgola mobile) / TFLOPS
36.853 +16.4%
31.651
28.876 -8.8%
25.931 -18.1%
OpenCL
388405 +170.4%
186397 +29.7%
143663
90580 -36.9%
66428 -53.8%