NVIDIA GB10
NVIDIA GB10 : 1 PFLOP et 128 Go de mémoire pour l'IA locale
Le GB10 est conçu pour des stations AI compactes comme le NVIDIA DGX Spark et se distingue nettement des cartes graphiques Blackwell classiques. Dans un même boîtier se trouvent un processeur Arm à 20 cœurs, un GPU Blackwell et 128 Go de mémoire LPDDR5X partagée. NVIDIA annonce des performances allant jusqu'à 1 PFLOP FP4, et des tests réels confirment ce niveau. Dans des tâches AI pratiques, la bande passante mémoire devient une contrainte importante.
En quoi le GB10 se distingue-t-il de la GeForce
Le GB10 a été présenté pour la première fois en janvier 2025 dans le cadre du projet DIGITS. Par la suite, ce concept a servi de base au DGX Spark, et la plateforme a été adoptée par d'autres fabricants. Le GB10 est intégré dans des systèmes compacts comme l'ASUS Ascent GX10, la Lenovo ThinkStation PGX, le HP ZGX Nano G1n, le GIGABYTE AI TOP ATOM, l'Acer Veriton GN100 et d'autres systèmes AI compacts.
Le principal avantage du GB10 réside dans ses 128 Go de mémoire partagée pour le CPU et le GPU.
Grâce à ce volume, le GB10 peut exécuter localement des modèles qui ne tiennent pas dans les 16-32 Go de VRAM de la plupart des cartes graphiques grand public. Selon NVIDIA, les systèmes basés sur le GB10 sont capables de traiter des modèles jusqu'à 200 milliards de paramètres avec une quantification et des optimisations appropriées.
Les tests confirment le 1 PFLOP annoncé
La valeur de 1 PFLOP se réfère aux calculs FP4 avec une sparsité de 2:4. Cette mesure ne permet pas de juger directement de la vitesse globale du GPU ou de la vitesse de génération des tokens dans les LLM.
En 2026, des résultats reproductibles du nvfp4bench sont apparus, testant les Tensor Cores du GB10 dans des calculs NVFP4. Les systèmes en série affichent environ 486-504 TFLOPS en densité NVFP4 et près de 1 PFLOP avec une sparsité de 2:4.
GB10 dans des dispositifs particuliers
| Appareil | NVFP4 Densité | NVFP4 Sparse 2:4 | Bande passante mémoire |
|---|---|---|---|
| HP ZGX Nano G1n | 503,9 TFLOPS | 1007,8 TFLOPS | 207 Go/s |
| Lenovo ThinkStation PGX | 498,4 TFLOPS | 996,7 TFLOPS | 213 Go/s |
| ASUS Ascent GX10 | 497,5 TFLOPS | 994,8 TFLOPS | 205 Go/s |
| GIGABYTE AI TOP ATOM | 496,6 TFLOPS | 993,4 TFLOPS | 214 Go/s |
| NVIDIA DGX Spark | 486,3 TFLOPS | 973,2 TFLOPS | 207 Go/s |
Tous les résultats ont été obtenus avec un seul type de test, ce qui permet de les comparer directement. L'écart entre les systèmes est faible, et les différences de boîtier, de refroidissement et de configuration ont peu d'impact sur le résultat final.
Limitation de la bande passante mémoire
Les Tensor Cores offrent une haute performance en faible précision, tandis que la bande passante officielle des 128 Go de LPDDR5X atteint jusqu'à 273 Go/s. Dans des tests pratiques, les systèmes affichent généralement environ 200-214 Go/s.
Pour l'inférence locale des LLM, ce chiffre est particulièrement important. Lors de la génération séquentielle des tokens, les poids du modèle sont constamment lus depuis la mémoire, c'est pourquoi la vitesse est souvent limitée par sa bande passante.
Ainsi, le 1 PFLOP ne peut pas être directement traduit en vitesse de fonctionnement d'un réseau de neurones spécifique.
Avec un long pré-remplissage, un traitement par lots et des requêtes parallèles, les Tensor Cores sont plus efficaces. Le GB10 peut héberger en mémoire des modèles qui ne tiennent pas dans la VRAM d'une seule carte graphique de bureau classique.
Le volume de mémoire est important, mais sa bande passante est significativement inférieure à celle de la GDDR7 sur des GPU discrets puissants.
Combien de tokens par seconde le GB10 peut-il générer
Les tests pratiques des LLM montrent mieux le caractère du GB10 que des performances de pointe en FP4. Sur NVIDIA DGX Spark avec Ollama 0.18.3 et CUDA 13.0, la vitesse chute considérablement à mesure que la densité du modèle augmente, tandis que les 128 Go de mémoire permettent d'exécuter des modèles qui ne tiennent pas sur la plupart des cartes graphiques grand public.
| Modèle | Taille en mémoire | Génération | Traitement de la requête |
|---|---|---|---|
| Llama 3.1 8B | 4,9 Go | 42,86 tokens/s | 574,79 tokens/s |
| Qwen3 32B | 20 Go | 9,88 tokens/s | 141,91 tokens/s |
| Llama 3.1 70B | 42 Go | 4,76 tokens/s | 67,92 tokens/s |
| Mistral Large 123B | 73 Go | 2,28 tokens/s | 10,43 tokens/s |
Les résultats montrent bien la limitation de la LPDDR5X. Llama 3.1 8B génère environ 43 tokens par seconde, tandis que Llama 3.1 70B voit sa vitesse tomber à environ 4,8 tokens par seconde. Mistral Large 123B fonctionne encore plus lentement, mais la possibilité même d'héberger un modèle de cette taille dans la mémoire d'un système compact constitue l'un des avantages du GB10.
L'architecture du modèle influence également fortement le résultat. Dans des tests spécifiques, llama.cpp Qwen3 30B avec une architecture MoE affichait environ 89 tokens par seconde, tandis que le dense Qwen3 32B atteignait environ 11 tokens par seconde. Avec MoE, seule une partie des paramètres est utilisée dans la génération, donc un tel modèle dépend beaucoup moins de la bande passante mémoire du GB10.
Combien coûtent les ordinateurs avec le GB10
En août 2026, le GB10 est utilisé dans plusieurs systèmes en série. Les performances de la puce varient peu, tandis que les prix et la capacité de stockage dépendent considérablement du modèle spécifique.
| Système | Stockage | Prix à partir de |
|---|---|---|
| ASUS Ascent GX10 | 1 To | environ 3 999 € |
| Lenovo ThinkStation PGX | 1 To | environ 4 733 € |
| HP ZGX Nano G1n | 2 To | environ 5 199 € |
| GIGABYTE AI TOP ATOM | 4 To | environ 5 499 € |
| NVIDIA DGX Spark Founders Edition | 4 To | environ 5 599 € |
| Acer Veriton GN100 | 4 To | environ 5 999 € |
Les prix concernent les offres sur le marché européen et dépendent de la configuration spécifique.
En termes de rapport qualité-prix, l'ASUS Ascent GX10 apparaît comme le plus avantageux par rapport aux autres. Il est moins cher que certains concurrents de plus de 1 000 €, alors que les résultats en NVFP4 diffèrent de seulement quelques pour cent.
Le supplément pour les modèles plus chers concerne généralement le SSD, le nombre de ports, la garantie et le support. Cela n'apporte pas de gain de performance significatif pour le GB10.
Comment Project DIGITS, DGX Spark et GB10 sont-ils liés
Le GB10 a plusieurs noms liés, apparus à différentes étapes de développement de la plateforme. En janvier 2025, NVIDIA a présenté une plateforme nommée Project DIGITS. Par la suite, le système propre à NVIDIA a été appelé DGX Spark, et le GB10 a commencé à être utilisé par ASUS, Lenovo, HP, GIGABYTE et d'autres fabricants.
| Nom | Qu'est-ce que c'est |
|---|---|
| Project DIGITS | concept initial d'ordinateur AI compact |
| NVIDIA GB10 | Grace Blackwell Superchip |
| NVIDIA DGX Spark | système en série de NVIDIA utilisant le GB10 |
| ASUS GX10, Lenovo PGX, HP ZGX et autres | systèmes OEM sur la même plateforme |
L'ASUS GX10, la Lenovo PGX et le HP ZGX utilisent la même plateforme de calcul GB10. Les différences entre ces systèmes concernent avant tout le boîtier, le stockage, le refroidissement et les périphériques.
Le GB10 doit être considéré comme un SoC spécialisé pour les stations de travail AI. La partie graphique utilise l'architecture Blackwell, tandis que la plateforme combine CPU, GPU et mémoire partagée dans une solution unique.
Conclusion
Avec un prix à partir d'environ 4 000 €, le GB10 est orienté vers un éventail restreint de tâches. Si le modèle requis tient dans la VRAM d'un RTX classique, une carte graphique discrète offrira souvent plus de performances de calcul pour le même prix.
L'avantage du GB10 apparaît dans des tâches où 24-32 Go de VRAM ne suffisent plus. Ses 128 Go de mémoire partagée permettent d'exécuter localement de grands modèles AI sans avoir besoin de plusieurs GPU discrets et d'une complexe répartition des poids entre eux.
Des systèmes réels confirment le niveau annoncé d'environ 1 PFLOP FP4 avec une sparsité de 2:4. Les tests LLM pratiques montrent simultanément la limitation de la bande passante LPDDR5X : de grands modèles denses entre en mémoire, mais génèrent des tokens de manière relativement lente. La force du GB10 réside dans la combinaison de 128 Go de mémoire partagée, de CUDA et d'un facteur de forme compact.
Basique
Spécifications de la mémoire
Affichage et multimédia
Performance théorique
Divers
Benchmarks
Comparé aux autres GPU
Partager sur les réseaux sociaux
Ou créez un lien vers nous
<a href="https://cputronic.com/index.php/fr/gpu/nvidia-gb10" target="_blank">NVIDIA GB10</a>