NVIDIA GB10
NVIDIA GB10: 1 PFLOP und 128 GB Speicher für lokale KI
Der GB10 wurde für kompakte KI-Stationen wie die NVIDIA DGX Spark entwickelt und unterscheidet sich deutlich von herkömmlichen Blackwell-Grafikkarten. In einem Gehäuse vereint er einen 20-Kern-Arm-Prozessor, Blackwell-Grafik und 128 GB gemeinsamen LPDDR5X-Speicher. NVIDIA gibt eine Leistung von bis zu 1 PFLOP FP4 an, und reale Tests bestätigen dieses Niveau. Bei praktischen KI-Aufgaben wird die Bandbreite des Speichers zu einer wichtigen Einschränkung.
Was unterscheidet GB10 von GeForce
Der GB10 wurde erstmals im Januar 2025 im Rahmen des Project DIGITS vorgestellt. Später wurde dieses Konzept zur Grundlage der DGX Spark, und die Plattform begann, auch von anderen Herstellern genutzt zu werden. Auf dem GB10 basieren Systeme wie ASUS Ascent GX10, Lenovo ThinkStation PGX, HP ZGX Nano G1n, GIGABYTE AI TOP ATOM, Acer Veriton GN100 und weitere kompakte KI-Systeme.
Der Hauptvorteil des GB10 liegt in den 128 GB gemeinsamem Speicher für CPU und GPU.
Dank dieses Speichervolumens kann der GB10 lokal Modelle ausführen, die nicht in die 16-32 GB VRAM der meisten Consumer-Grafikkarten passen. Laut NVIDIA sind Systeme auf Basis des GB10 in der Lage, mit Modellen von bis zu 200 Milliarden Parametern bei geeigneter Quantisierung und Optimierungen zu arbeiten.
Tests bestätigen die angegebene Leistung von 1 PFLOP
Der Wert von 1 PFLOP bezieht sich auf Berechnungen in FP4 mit einer Sparsamkeit von 2:4. Anhand dieser Zahl kann man nicht direkt auf die gesamte Geschwindigkeit des grafischen Teils oder die Geschwindigkeit der Token-Generierung in LLM schließen.
Im Jahr 2026 wurden reproduzierbare Ergebnisse von nvfp4bench veröffentlicht, das die Tensor Cores des GB10 in NVFP4-Berechnungen testet. Die Serienmodelle zeigen etwa 486-504 TFLOPS in dichtem NVFP4 und rund 1 PFLOP bei einer Sparsamkeit von 2:4.
GB10 in bestimmten Geräten
| Gerät | NVFP4 Dense | NVFP4 Sparse 2:4 | Speicherbandbreite |
|---|---|---|---|
| HP ZGX Nano G1n | 503,9 TFLOPS | 1007,8 TFLOPS | 207 GB/s |
| Lenovo ThinkStation PGX | 498,4 TFLOPS | 996,7 TFLOPS | 213 GB/s |
| ASUS Ascent GX10 | 497,5 TFLOPS | 994,8 TFLOPS | 205 GB/s |
| GIGABYTE AI TOP ATOM | 496,6 TFLOPS | 993,4 TFLOPS | 214 GB/s |
| NVIDIA DGX Spark | 486,3 TFLOPS | 973,2 TFLOPS | 207 GB/s |
Alle Ergebnisse wurden mit demselben Testtyp erzielt, daher sind sie direkt vergleichbar. Die Streuung zwischen den Systemen ist gering, und Unterschiede im Gehäuse, der Kühlung und den Einstellungen haben nur einen geringen Einfluss auf das Endergebnis.
Einschränkung der Speicherbandbreite
Die Tensor Cores bieten eine hohe Leistung bei niedriger Präzision, während die offizielle Bandbreite von 128 GB LPDDR5X bis zu 273 GB/s beträgt. In praktischen Tests zeigen Systeme in der Regel etwa 200-214 GB/s.
Für lokale Inferenz LLM ist dieser Wert besonders wichtig. Bei der sequenziellen Generierung von Tokens werden die Gewichte des Modells ständig aus dem Speicher gelesen, weshalb die Geschwindigkeit oft durch die Bandbreite begrenzt wird.
Daher lässt sich 1 PFLOP nicht direkt in die Arbeitsgeschwindigkeit eines bestimmten neuronalen Netzes umrechnen.
Bei langen Prefill, Batch-Verarbeitung und parallelen Anfragen werden die Tensor Cores effizienter geladen. Der GB10 kann in dem gemeinsamen Speicher Modelle unterbringen, die nicht in die VRAM einer herkömmlichen Desktop-Grafikkarte passen.
Das Speichervolumen ist groß, aber die Bandbreite ist deutlich niedriger als die von GDDR7 auf leistungsstarken dedizierten GPUs.
Wie viele Tokens pro Sekunde liefert der GB10
Praktische Tests von LLM zeigen besser die Eigenschaften des GB10 als die Spitzenleistung in FP4. Auf dem NVIDIA DGX Spark mit Ollama 0.18.3 und CUDA 13.0 sinkt die Geschwindigkeit merklich mit wachsendem Modellumfang, aber die 128 GB Speicher ermöglichen es, Modelle zu verwenden, die auf den meisten Consumer-Grafikkarten nicht passen.
| Modell | Speicherbedarf | Generierung | Anfrageverarbeitung |
|---|---|---|---|
| Llama 3.1 8B | 4,9 GB | 42,86 Tok/s | 574,79 Tok/s |
| Qwen3 32B | 20 GB | 9,88 Tok/s | 141,91 Tok/s |
| Llama 3.1 70B | 42 GB | 4,76 Tok/s | 67,92 Tok/s |
| Mistral Large 123B | 73 GB | 2,28 Tok/s | 10,43 Tok/s |
Die Ergebnisse zeigen gut die Einschränkung von LPDDR5X. Llama 3.1 8B generiert etwa 43 Tokens pro Sekunde, während die Geschwindigkeit bei Llama 3.1 70B auf etwa 4,8 Tokens pro Sekunde sinkt. Mistral Large 123B arbeitet noch langsamer, aber die Möglichkeit, ein Modell dieser Größe im Speicher eines kompakten Systems unterzubringen, ist eines der Vorteile des GB10.
Die Architektur des Modells hat ebenfalls einen erheblichen Einfluss auf das Ergebnis. In einzelnen Tests erzielte Qwen3 30B mit der MoE-Architektur etwa 89 Tokens pro Sekunde, während das dichte Qwen3 32B nur etwa 11 Tokens pro Sekunde erreichte. Bei MoE werden bei der Generierung nur Teile der Parameter verwendet, weshalb ein solches Modell deutlich weniger von der Speicherbandbreite des GB10 abhängt.
Was kosten Computer mit GB10
Bis August 2026 wird der GB10 in mehreren serielle Systemen eingesetzt. Die Leistung des Chips variiert nur geringfügig, aber die Preise und Speicherkapazitäten hängen stark vom jeweiligen Modell ab.
| System | Speicher | Preis ab |
|---|---|---|
| ASUS Ascent GX10 | 1 TB | ca. €3 999 |
| Lenovo ThinkStation PGX | 1 TB | ca. €4 733 |
| HP ZGX Nano G1n | 2 TB | ca. €5 199 |
| GIGABYTE AI TOP ATOM | 4 TB | ca. €5 499 |
| NVIDIA DGX Spark Founders Edition | 4 TB | ca. €5 599 |
| Acer Veriton GN100 | 4 TB | ca. €5 999 |
Die Preise beziehen sich auf Angebote auf dem europäischen Markt und variieren je nach Konfiguration.
Im Verhältnis von Preis zu Leistung erscheint der ASUS Ascent GX10 vorteilhafter als die anderen. Er ist über €1 000 günstiger als einige Wettbewerber, während die Ergebnisse in NVFP4 nur um wenige Prozent abweichen.
Die Mehrkosten für teurere Modelle entfallen meist auf SSD, Port-Anzahl, Garantie und Support. Ein wesentlicher Leistungszuwachs durch den GB10 ergibt sich daraus nicht.
Wie sind Project DIGITS, DGX Spark und GB10 verbunden
Der GB10 hat mehrere verwandte Bezeichnungen, die in verschiedenen Entwicklungsphasen der Plattform entstanden sind. Im Januar 2025 stellte NVIDIA die Plattform unter dem Namen Project DIGITS vor. Später erhielt das eigene System von NVIDIA den Namen DGX Spark, und der GB10 begann, von ASUS, Lenovo, HP, GIGABYTE und anderen Herstellern verwendet zu werden.
| Bezeichnung | Was ist das |
|---|---|
| Project DIGITS | ursprüngliches Konzept eines kompakten KI-Computers |
| NVIDIA GB10 | Grace Blackwell Superchip |
| NVIDIA DGX Spark | eigenes Serienmodell von NVIDIA auf GB10 |
| ASUS GX10, Lenovo PGX, HP ZGX und andere | OEM-Systeme auf derselben Plattform |
ASUS GX10, Lenovo PGX und HP ZGX verwenden dieselbe Berechnungsplattform GB10. Die Unterschiede zwischen diesen Systemen betreffen vor allem Gehäuse, Speicher, Kühlung und Peripherie.
Der GB10 ist als spezialisiertes SoC für KI-Arbeitsstationen zu betrachten. Der grafische Teil nutzt die Blackwell-Architektur, während die Plattform CPU, GPU und gemeinsamen Speicher in einer Lösung vereint.
Fazit
Bei einem Preis von etwa €4.000 ist der GB10 auf einen engen Anwendungsbereich ausgerichtet. Wenn das benötigte Modell in den VRAM einer herkömmlichen RTX passt, bietet eine dedizierte Grafikkarte oft mehr Rechenleistung für dasselbe Geld.
Der Vorteil des GB10 zeigt sich in Aufgaben, in denen 24-32 GB VRAM nicht mehr ausreichen. Seine 128 GB gemeinsamen Speichers ermöglichen es, große KI-Modelle lokal ohne mehrere dedizierte GPUs und komplexe Gewichtsverteilung zwischen ihnen zu betreiben.
Echte Systeme bestätigen das angegebene Niveau von etwa 1 PFLOP FP4 bei einer Sparsamkeit von 2:4. Praktische LLM-Tests zeigen gleichzeitig die Begrenzung der LPDDR5X-Bandbreite: Große dichte Modelle passen in den Speicher, generieren jedoch vergleichsweise langsam Tokens. Die Stärke des GB10 liegt in der Kombination aus 128 GB gemeinsamem Speicher, CUDA und kompaktem Formfaktor.
Basic
Speicherspezifikationen
Anzeige und Medien
Theoretische Leistung
Verschiedenes
Benchmarks
Im Vergleich zu anderen GPUs
In sozialen Medien teilen
Oder verlinken Sie uns
<a href="https://cputronic.com/de/gpu/nvidia-gb10" target="_blank">NVIDIA GB10</a>