NVIDIA GB10

NVIDIA GB10
Test de la carte graphique NVIDIA GB10

NVIDIA GB10 : 1 PFLOP et 128 Go de mémoire pour l'IA locale

Le GB10 est conçu pour des stations AI compactes comme le NVIDIA DGX Spark et se distingue nettement des cartes graphiques Blackwell classiques. Dans un même boîtier se trouvent un processeur Arm à 20 cœurs, un GPU Blackwell et 128 Go de mémoire LPDDR5X partagée. NVIDIA annonce des performances allant jusqu'à 1 PFLOP FP4, et des tests réels confirment ce niveau. Dans des tâches AI pratiques, la bande passante mémoire devient une contrainte importante.

En quoi le GB10 se distingue-t-il de la GeForce

Le GB10 a été présenté pour la première fois en janvier 2025 dans le cadre du projet DIGITS. Par la suite, ce concept a servi de base au DGX Spark, et la plateforme a été adoptée par d'autres fabricants. Le GB10 est intégré dans des systèmes compacts comme l'ASUS Ascent GX10, la Lenovo ThinkStation PGX, le HP ZGX Nano G1n, le GIGABYTE AI TOP ATOM, l'Acer Veriton GN100 et d'autres systèmes AI compacts.

Le principal avantage du GB10 réside dans ses 128 Go de mémoire partagée pour le CPU et le GPU.

Grâce à ce volume, le GB10 peut exécuter localement des modèles qui ne tiennent pas dans les 16-32 Go de VRAM de la plupart des cartes graphiques grand public. Selon NVIDIA, les systèmes basés sur le GB10 sont capables de traiter des modèles jusqu'à 200 milliards de paramètres avec une quantification et des optimisations appropriées.

Les tests confirment le 1 PFLOP annoncé

La valeur de 1 PFLOP se réfère aux calculs FP4 avec une sparsité de 2:4. Cette mesure ne permet pas de juger directement de la vitesse globale du GPU ou de la vitesse de génération des tokens dans les LLM.

En 2026, des résultats reproductibles du nvfp4bench sont apparus, testant les Tensor Cores du GB10 dans des calculs NVFP4. Les systèmes en série affichent environ 486-504 TFLOPS en densité NVFP4 et près de 1 PFLOP avec une sparsité de 2:4.

GB10 dans des dispositifs particuliers

Appareil NVFP4 Densité NVFP4 Sparse 2:4 Bande passante mémoire
HP ZGX Nano G1n 503,9 TFLOPS 1007,8 TFLOPS 207 Go/s
Lenovo ThinkStation PGX 498,4 TFLOPS 996,7 TFLOPS 213 Go/s
ASUS Ascent GX10 497,5 TFLOPS 994,8 TFLOPS 205 Go/s
GIGABYTE AI TOP ATOM 496,6 TFLOPS 993,4 TFLOPS 214 Go/s
NVIDIA DGX Spark 486,3 TFLOPS 973,2 TFLOPS 207 Go/s

Tous les résultats ont été obtenus avec un seul type de test, ce qui permet de les comparer directement. L'écart entre les systèmes est faible, et les différences de boîtier, de refroidissement et de configuration ont peu d'impact sur le résultat final.

Limitation de la bande passante mémoire

Les Tensor Cores offrent une haute performance en faible précision, tandis que la bande passante officielle des 128 Go de LPDDR5X atteint jusqu'à 273 Go/s. Dans des tests pratiques, les systèmes affichent généralement environ 200-214 Go/s.

Pour l'inférence locale des LLM, ce chiffre est particulièrement important. Lors de la génération séquentielle des tokens, les poids du modèle sont constamment lus depuis la mémoire, c'est pourquoi la vitesse est souvent limitée par sa bande passante.

Ainsi, le 1 PFLOP ne peut pas être directement traduit en vitesse de fonctionnement d'un réseau de neurones spécifique.

Avec un long pré-remplissage, un traitement par lots et des requêtes parallèles, les Tensor Cores sont plus efficaces. Le GB10 peut héberger en mémoire des modèles qui ne tiennent pas dans la VRAM d'une seule carte graphique de bureau classique.

Le volume de mémoire est important, mais sa bande passante est significativement inférieure à celle de la GDDR7 sur des GPU discrets puissants.

Combien de tokens par seconde le GB10 peut-il générer

Les tests pratiques des LLM montrent mieux le caractère du GB10 que des performances de pointe en FP4. Sur NVIDIA DGX Spark avec Ollama 0.18.3 et CUDA 13.0, la vitesse chute considérablement à mesure que la densité du modèle augmente, tandis que les 128 Go de mémoire permettent d'exécuter des modèles qui ne tiennent pas sur la plupart des cartes graphiques grand public.

Modèle Taille en mémoire Génération Traitement de la requête
Llama 3.1 8B 4,9 Go 42,86 tokens/s 574,79 tokens/s
Qwen3 32B 20 Go 9,88 tokens/s 141,91 tokens/s
Llama 3.1 70B 42 Go 4,76 tokens/s 67,92 tokens/s
Mistral Large 123B 73 Go 2,28 tokens/s 10,43 tokens/s

Les résultats montrent bien la limitation de la LPDDR5X. Llama 3.1 8B génère environ 43 tokens par seconde, tandis que Llama 3.1 70B voit sa vitesse tomber à environ 4,8 tokens par seconde. Mistral Large 123B fonctionne encore plus lentement, mais la possibilité même d'héberger un modèle de cette taille dans la mémoire d'un système compact constitue l'un des avantages du GB10.

L'architecture du modèle influence également fortement le résultat. Dans des tests spécifiques, llama.cpp Qwen3 30B avec une architecture MoE affichait environ 89 tokens par seconde, tandis que le dense Qwen3 32B atteignait environ 11 tokens par seconde. Avec MoE, seule une partie des paramètres est utilisée dans la génération, donc un tel modèle dépend beaucoup moins de la bande passante mémoire du GB10.

Combien coûtent les ordinateurs avec le GB10

En août 2026, le GB10 est utilisé dans plusieurs systèmes en série. Les performances de la puce varient peu, tandis que les prix et la capacité de stockage dépendent considérablement du modèle spécifique.

Système Stockage Prix à partir de
ASUS Ascent GX10 1 To environ 3 999 €
Lenovo ThinkStation PGX 1 To environ 4 733 €
HP ZGX Nano G1n 2 To environ 5 199 €
GIGABYTE AI TOP ATOM 4 To environ 5 499 €
NVIDIA DGX Spark Founders Edition 4 To environ 5 599 €
Acer Veriton GN100 4 To environ 5 999 €

Les prix concernent les offres sur le marché européen et dépendent de la configuration spécifique.

En termes de rapport qualité-prix, l'ASUS Ascent GX10 apparaît comme le plus avantageux par rapport aux autres. Il est moins cher que certains concurrents de plus de 1 000 €, alors que les résultats en NVFP4 diffèrent de seulement quelques pour cent.

Le supplément pour les modèles plus chers concerne généralement le SSD, le nombre de ports, la garantie et le support. Cela n'apporte pas de gain de performance significatif pour le GB10.

Comment Project DIGITS, DGX Spark et GB10 sont-ils liés

Le GB10 a plusieurs noms liés, apparus à différentes étapes de développement de la plateforme. En janvier 2025, NVIDIA a présenté une plateforme nommée Project DIGITS. Par la suite, le système propre à NVIDIA a été appelé DGX Spark, et le GB10 a commencé à être utilisé par ASUS, Lenovo, HP, GIGABYTE et d'autres fabricants.

Nom Qu'est-ce que c'est
Project DIGITS concept initial d'ordinateur AI compact
NVIDIA GB10 Grace Blackwell Superchip
NVIDIA DGX Spark système en série de NVIDIA utilisant le GB10
ASUS GX10, Lenovo PGX, HP ZGX et autres systèmes OEM sur la même plateforme

L'ASUS GX10, la Lenovo PGX et le HP ZGX utilisent la même plateforme de calcul GB10. Les différences entre ces systèmes concernent avant tout le boîtier, le stockage, le refroidissement et les périphériques.

Le GB10 doit être considéré comme un SoC spécialisé pour les stations de travail AI. La partie graphique utilise l'architecture Blackwell, tandis que la plateforme combine CPU, GPU et mémoire partagée dans une solution unique.

Conclusion

Avec un prix à partir d'environ 4 000 €, le GB10 est orienté vers un éventail restreint de tâches. Si le modèle requis tient dans la VRAM d'un RTX classique, une carte graphique discrète offrira souvent plus de performances de calcul pour le même prix.

L'avantage du GB10 apparaît dans des tâches où 24-32 Go de VRAM ne suffisent plus. Ses 128 Go de mémoire partagée permettent d'exécuter localement de grands modèles AI sans avoir besoin de plusieurs GPU discrets et d'une complexe répartition des poids entre eux.

Des systèmes réels confirment le niveau annoncé d'environ 1 PFLOP FP4 avec une sparsité de 2:4. Les tests LLM pratiques montrent simultanément la limitation de la bande passante LPDDR5X : de grands modèles denses entre en mémoire, mais génèrent des tokens de manière relativement lente. La force du GB10 réside dans la combinaison de 128 Go de mémoire partagée, de CUDA et d'un facteur de forme compact.

Basique

Nom de l'étiquette
NVIDIA
Plate-forme
Desktop
Date de lancement
August 2025
Nom du modèle
GB10
Génération
Server Blackwell
Horloge de base
1665 MHz
Horloge Boost
2525 MHz
Interface de bus
PCIe 5.0 x16
Transistors
Unknown
Cœurs RT
48
Cœurs de Tensor
?
Les Tensor Cores sont des unités de traitement spécialisées conçues spécifiquement pour l'apprentissage en profondeur, offrant des performances supérieures en matière d'entraînement et d'inférence par rapport à l'entraînement FP32. Ils permettent des calculs rapides dans des domaines tels que la vision par ordinateur, le traitement du langage naturel, la reconnaissance vocale, la conversion texte-parole et les recommandations personnalisées. Les deux applications les plus remarquables des Tensor Cores sont DLSS (Deep Learning Super Sampling) et AI Denoiser pour la réduction du bruit.
384
TMUs
?
Les unités de mappage de texture (TMUs) sont des composants du GPU qui sont capables de faire pivoter, mettre à l'échelle et déformer des images binaires, puis de les placer en tant que textures sur n'importe quel plan d'un modèle 3D donné. Ce processus est appelé mappage de texture.
384
Fonderie
TSMC
Taille de processus
3 nm
Architecture
Blackwell

Spécifications de la mémoire

Taille de Mémoire
128GB
Type de Mémoire
LPDDR5X
Bus de Mémoire
?
La largeur du bus mémoire fait référence au nombre de bits de données que la mémoire vidéo peut transférer lors d'un seul cycle d'horloge. Plus la largeur du bus est grande, plus la quantité de données qui peut être transmise instantanément est importante, ce qui en fait l'un des paramètres cruciaux de la mémoire vidéo. La bande passante mémoire est calculée comme suit : Bande passante mémoire = Fréquence mémoire x Largeur du bus mémoire / 8. Par conséquent, lorsque les fréquences mémoire sont similaires, la largeur du bus mémoire déterminera la taille de la bande passante mémoire.
256bit
Horloge Mémoire
1067 MHz
Bande Passante
?
La bande passante mémoire fait référence au débit de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde, et la formule pour la calculer est : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits. En français: La bande passante mémoire désigne le taux de transfert de données entre la puce graphique et la mémoire vidéo. Elle est mesurée en octets par seconde et la formule pour la calculer est la suivante : bande passante mémoire = fréquence de fonctionnement × largeur du bus mémoire / 8 bits.
273.2GB/s

Affichage et multimédia

Sorties
1x HDMI

Performance théorique

Taux de Pixel
?
Le taux de remplissage des pixels désigne le nombre de pixels qu'une unité de traitement graphique (GPU) peut rendre par seconde, mesuré en MPixels/s (million de pixels par seconde) ou en GPixels/s (milliard de pixels par seconde). C'est la mesure la plus couramment utilisée pour évaluer les performances de traitement des pixels d'une carte graphique.
121.2 GPixel/s
Taux de Texture
?
Le taux de remplissage de texture fait référence au nombre d'éléments de texture (texels) qu'un GPU peut mapper sur des pixels en une seule seconde.
969.6 GTexel/s
FP16 (demi)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
124.1 TFLOPS
FP64 (double précision)
?
Une mesure importante pour évaluer les performances des GPU est la capacité de calcul en virgule flottante. Les nombres en virgule flottante à demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable. Les nombres en virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de multimédia et de traitement graphique, tandis que les nombres en virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui nécessite une large plage numérique et une grande précision.
15.51 TFLOPS
FP32 (flottant)
?
Une mesure importante pour mesurer les performances du GPU est la capacité de calcul en virgule flottante. Les nombres à virgule flottante simple précision (32 bits) sont utilisés pour les tâches courantes de traitement multimédia et graphique, tandis que les nombres à virgule flottante double précision (64 bits) sont requis pour le calcul scientifique qui exige une large plage numérique et une grande précision. Les nombres à virgule flottante demi-précision (16 bits) sont utilisés pour des applications telles que l'apprentissage automatique, où une précision inférieure est acceptable.
31.651 TFLOPS

Divers

Nombre de SM
?
Plusieurs processeurs de flux (SPs), ainsi que d'autres ressources, forment un multiprocesseur de flux (SM), également appelé cœur principal du GPU. Ces ressources supplémentaires comprennent des composants tels que des ordonnanceurs de warp, des registres et de la mémoire partagée. Le SM peut être considéré comme le cœur du GPU, similaire à un cœur de CPU, les registres et la mémoire partagée étant des ressources limitées au sein du SM.
48
Unités d'Ombrage
?
L'unité de traitement la plus fondamentale est le processeur en continu (SP), où des instructions et des tâches spécifiques sont exécutées. Les GPU effectuent des calculs parallèles, ce qui signifie que plusieurs SP fonctionnent simultanément pour traiter les tâches.
6144
Cache L1
256 KB (per SM)
Cache L2
50 MB
TDP
Unknown
Version OpenCL
3.0
CUDA
10.1
Connecteurs d'alimentation
None
ROPs
?
Le pipeline des opérations de rasterisation (ROPs) est principalement responsable de la gestion des calculs d'éclairage et de réflexion dans les jeux, ainsi que de la gestion d'effets tels que l'anti-aliasing (AA), la haute résolution, la fumée et le feu. Plus les effets d'anti-aliasing et d'éclairage sont exigeants dans un jeu, plus les exigences de performances pour les ROPs sont élevées ; sinon, cela peut entraîner une chute importante du taux de rafraîchissement.
48
Alimentation suggérée
200 W

Benchmarks

FP32 (flottant)
Score
31.651 TFLOPS
OpenCL
Score
143663

Comparé aux autres GPU

FP32 (flottant) / TFLOPS
36.853 +16.4%
31.651
28.876 -8.8%
25.931 -18.1%
OpenCL
388405 +170.4%
186397 +29.7%
143663
90580 -36.9%
66428 -53.8%