NVIDIA GB10

NVIDIA GB10
Test der NVIDIA GB10 Grafikkarte

NVIDIA GB10: 1 PFLOP und 128 GB Speicher für lokale KI

Der GB10 wurde für kompakte KI-Stationen wie die NVIDIA DGX Spark entwickelt und unterscheidet sich deutlich von herkömmlichen Blackwell-Grafikkarten. In einem Gehäuse vereint er einen 20-Kern-Arm-Prozessor, Blackwell-Grafik und 128 GB gemeinsamen LPDDR5X-Speicher. NVIDIA gibt eine Leistung von bis zu 1 PFLOP FP4 an, und reale Tests bestätigen dieses Niveau. Bei praktischen KI-Aufgaben wird die Bandbreite des Speichers zu einer wichtigen Einschränkung.

Was unterscheidet GB10 von GeForce

Der GB10 wurde erstmals im Januar 2025 im Rahmen des Project DIGITS vorgestellt. Später wurde dieses Konzept zur Grundlage der DGX Spark, und die Plattform begann, auch von anderen Herstellern genutzt zu werden. Auf dem GB10 basieren Systeme wie ASUS Ascent GX10, Lenovo ThinkStation PGX, HP ZGX Nano G1n, GIGABYTE AI TOP ATOM, Acer Veriton GN100 und weitere kompakte KI-Systeme.

Der Hauptvorteil des GB10 liegt in den 128 GB gemeinsamem Speicher für CPU und GPU.

Dank dieses Speichervolumens kann der GB10 lokal Modelle ausführen, die nicht in die 16-32 GB VRAM der meisten Consumer-Grafikkarten passen. Laut NVIDIA sind Systeme auf Basis des GB10 in der Lage, mit Modellen von bis zu 200 Milliarden Parametern bei geeigneter Quantisierung und Optimierungen zu arbeiten.

Tests bestätigen die angegebene Leistung von 1 PFLOP

Der Wert von 1 PFLOP bezieht sich auf Berechnungen in FP4 mit einer Sparsamkeit von 2:4. Anhand dieser Zahl kann man nicht direkt auf die gesamte Geschwindigkeit des grafischen Teils oder die Geschwindigkeit der Token-Generierung in LLM schließen.

Im Jahr 2026 wurden reproduzierbare Ergebnisse von nvfp4bench veröffentlicht, das die Tensor Cores des GB10 in NVFP4-Berechnungen testet. Die Serienmodelle zeigen etwa 486-504 TFLOPS in dichtem NVFP4 und rund 1 PFLOP bei einer Sparsamkeit von 2:4.

GB10 in bestimmten Geräten

Gerät NVFP4 Dense NVFP4 Sparse 2:4 Speicherbandbreite
HP ZGX Nano G1n 503,9 TFLOPS 1007,8 TFLOPS 207 GB/s
Lenovo ThinkStation PGX 498,4 TFLOPS 996,7 TFLOPS 213 GB/s
ASUS Ascent GX10 497,5 TFLOPS 994,8 TFLOPS 205 GB/s
GIGABYTE AI TOP ATOM 496,6 TFLOPS 993,4 TFLOPS 214 GB/s
NVIDIA DGX Spark 486,3 TFLOPS 973,2 TFLOPS 207 GB/s

Alle Ergebnisse wurden mit demselben Testtyp erzielt, daher sind sie direkt vergleichbar. Die Streuung zwischen den Systemen ist gering, und Unterschiede im Gehäuse, der Kühlung und den Einstellungen haben nur einen geringen Einfluss auf das Endergebnis.

Einschränkung der Speicherbandbreite

Die Tensor Cores bieten eine hohe Leistung bei niedriger Präzision, während die offizielle Bandbreite von 128 GB LPDDR5X bis zu 273 GB/s beträgt. In praktischen Tests zeigen Systeme in der Regel etwa 200-214 GB/s.

Für lokale Inferenz LLM ist dieser Wert besonders wichtig. Bei der sequenziellen Generierung von Tokens werden die Gewichte des Modells ständig aus dem Speicher gelesen, weshalb die Geschwindigkeit oft durch die Bandbreite begrenzt wird.

Daher lässt sich 1 PFLOP nicht direkt in die Arbeitsgeschwindigkeit eines bestimmten neuronalen Netzes umrechnen.

Bei langen Prefill, Batch-Verarbeitung und parallelen Anfragen werden die Tensor Cores effizienter geladen. Der GB10 kann in dem gemeinsamen Speicher Modelle unterbringen, die nicht in die VRAM einer herkömmlichen Desktop-Grafikkarte passen.

Das Speichervolumen ist groß, aber die Bandbreite ist deutlich niedriger als die von GDDR7 auf leistungsstarken dedizierten GPUs.

Wie viele Tokens pro Sekunde liefert der GB10

Praktische Tests von LLM zeigen besser die Eigenschaften des GB10 als die Spitzenleistung in FP4. Auf dem NVIDIA DGX Spark mit Ollama 0.18.3 und CUDA 13.0 sinkt die Geschwindigkeit merklich mit wachsendem Modellumfang, aber die 128 GB Speicher ermöglichen es, Modelle zu verwenden, die auf den meisten Consumer-Grafikkarten nicht passen.

Modell Speicherbedarf Generierung Anfrageverarbeitung
Llama 3.1 8B 4,9 GB 42,86 Tok/s 574,79 Tok/s
Qwen3 32B 20 GB 9,88 Tok/s 141,91 Tok/s
Llama 3.1 70B 42 GB 4,76 Tok/s 67,92 Tok/s
Mistral Large 123B 73 GB 2,28 Tok/s 10,43 Tok/s

Die Ergebnisse zeigen gut die Einschränkung von LPDDR5X. Llama 3.1 8B generiert etwa 43 Tokens pro Sekunde, während die Geschwindigkeit bei Llama 3.1 70B auf etwa 4,8 Tokens pro Sekunde sinkt. Mistral Large 123B arbeitet noch langsamer, aber die Möglichkeit, ein Modell dieser Größe im Speicher eines kompakten Systems unterzubringen, ist eines der Vorteile des GB10.

Die Architektur des Modells hat ebenfalls einen erheblichen Einfluss auf das Ergebnis. In einzelnen Tests erzielte Qwen3 30B mit der MoE-Architektur etwa 89 Tokens pro Sekunde, während das dichte Qwen3 32B nur etwa 11 Tokens pro Sekunde erreichte. Bei MoE werden bei der Generierung nur Teile der Parameter verwendet, weshalb ein solches Modell deutlich weniger von der Speicherbandbreite des GB10 abhängt.

Was kosten Computer mit GB10

Bis August 2026 wird der GB10 in mehreren serielle Systemen eingesetzt. Die Leistung des Chips variiert nur geringfügig, aber die Preise und Speicherkapazitäten hängen stark vom jeweiligen Modell ab.

System Speicher Preis ab
ASUS Ascent GX10 1 TB ca. €3 999
Lenovo ThinkStation PGX 1 TB ca. €4 733
HP ZGX Nano G1n 2 TB ca. €5 199
GIGABYTE AI TOP ATOM 4 TB ca. €5 499
NVIDIA DGX Spark Founders Edition 4 TB ca. €5 599
Acer Veriton GN100 4 TB ca. €5 999

Die Preise beziehen sich auf Angebote auf dem europäischen Markt und variieren je nach Konfiguration.

Im Verhältnis von Preis zu Leistung erscheint der ASUS Ascent GX10 vorteilhafter als die anderen. Er ist über €1 000 günstiger als einige Wettbewerber, während die Ergebnisse in NVFP4 nur um wenige Prozent abweichen.

Die Mehrkosten für teurere Modelle entfallen meist auf SSD, Port-Anzahl, Garantie und Support. Ein wesentlicher Leistungszuwachs durch den GB10 ergibt sich daraus nicht.

Wie sind Project DIGITS, DGX Spark und GB10 verbunden

Der GB10 hat mehrere verwandte Bezeichnungen, die in verschiedenen Entwicklungsphasen der Plattform entstanden sind. Im Januar 2025 stellte NVIDIA die Plattform unter dem Namen Project DIGITS vor. Später erhielt das eigene System von NVIDIA den Namen DGX Spark, und der GB10 begann, von ASUS, Lenovo, HP, GIGABYTE und anderen Herstellern verwendet zu werden.

Bezeichnung Was ist das
Project DIGITS ursprüngliches Konzept eines kompakten KI-Computers
NVIDIA GB10 Grace Blackwell Superchip
NVIDIA DGX Spark eigenes Serienmodell von NVIDIA auf GB10
ASUS GX10, Lenovo PGX, HP ZGX und andere OEM-Systeme auf derselben Plattform

ASUS GX10, Lenovo PGX und HP ZGX verwenden dieselbe Berechnungsplattform GB10. Die Unterschiede zwischen diesen Systemen betreffen vor allem Gehäuse, Speicher, Kühlung und Peripherie.

Der GB10 ist als spezialisiertes SoC für KI-Arbeitsstationen zu betrachten. Der grafische Teil nutzt die Blackwell-Architektur, während die Plattform CPU, GPU und gemeinsamen Speicher in einer Lösung vereint.

Fazit

Bei einem Preis von etwa €4.000 ist der GB10 auf einen engen Anwendungsbereich ausgerichtet. Wenn das benötigte Modell in den VRAM einer herkömmlichen RTX passt, bietet eine dedizierte Grafikkarte oft mehr Rechenleistung für dasselbe Geld.

Der Vorteil des GB10 zeigt sich in Aufgaben, in denen 24-32 GB VRAM nicht mehr ausreichen. Seine 128 GB gemeinsamen Speichers ermöglichen es, große KI-Modelle lokal ohne mehrere dedizierte GPUs und komplexe Gewichtsverteilung zwischen ihnen zu betreiben.

Echte Systeme bestätigen das angegebene Niveau von etwa 1 PFLOP FP4 bei einer Sparsamkeit von 2:4. Praktische LLM-Tests zeigen gleichzeitig die Begrenzung der LPDDR5X-Bandbreite: Große dichte Modelle passen in den Speicher, generieren jedoch vergleichsweise langsam Tokens. Die Stärke des GB10 liegt in der Kombination aus 128 GB gemeinsamem Speicher, CUDA und kompaktem Formfaktor.

Basic

Markenname
NVIDIA
Plattform
Desktop
Erscheinungsdatum
August 2025
Modellname
GB10
Generation
Server Blackwell
Basis-Takt
1665 MHz
Boost-Takt
2525 MHz
Bus-Schnittstelle
PCIe 5.0 x16
Transistoren
Unknown
RT-Kerne
48
Tensor-Kerne
?
Tensor-Kerne sind spezialisierte Verarbeitungseinheiten, die speziell für das Deep Learning entwickelt wurden und im Vergleich zum FP32-Training eine höhere Trainings- und Inferenzleistung bieten. Sie ermöglichen schnelle Berechnungen in Bereichen wie Computer Vision, Natural Language Processing, Spracherkennung, Text-zu-Sprache-Konvertierung und personalisierteEmpfehlungen. Die beiden bekanntesten Anwendungen von Tensor-Kernen sind DLSS (Deep Learning Super Sampling) und AI Denoiser zur Rauschreduzierung.
384
TMUs
?
Textur-Mapping-Einheiten (TMUs) sind Komponenten der GPU, die in der Lage sind, Binärbilder zu drehen, zu skalieren und zu verzerren und sie dann als Texturen auf jede Ebene eines gegebenen 3D-Modells zu platzieren. Dieser Prozess wird als Textur-Mapping bezeichnet.
384
Foundry
TSMC
Prozessgröße
3 nm
Architektur
Blackwell

Speicherspezifikationen

Speichergröße
128GB
Speichertyp
LPDDR5X
Speicherbus
?
Der Speicherbus bezieht sich auf die Anzahl der Bits, die das Videomemory innerhalb eines einzelnen Taktzyklus übertragen kann. Je größer die Busbreite, desto mehr Daten können gleichzeitig übertragen werden, was sie zu einem der entscheidenden Parameter des Videomemory macht. Die Speicherbandbreite wird wie folgt berechnet: Speicherbandbreite = Speicherfrequenz x Speicherbusbreite / 8. Wenn also die Speicherfrequenzen ähnlich sind, bestimmt die Speicherbusbreite die Größe der Speicherbandbreite.
256bit
Speichertakt
1067 MHz
Bandbreite
?
Die Speicherbandbreite bezieht sich auf die Datenübertragungsrate zwischen dem Grafikchip und dem Videomemory. Sie wird in Bytes pro Sekunde gemessen, und die Formel zur Berechnung lautet: Speicherbandbreite = Arbeitsfrequenz × Speicherbusbreite / 8 Bit.
273.2GB/s

Anzeige und Medien

Ausgänge
1x HDMI

Theoretische Leistung

Pixeltakt
?
Die Pixel-Füllrate bezieht sich auf die Anzahl der Pixel, die eine Grafikverarbeitungseinheit (GPU) pro Sekunde rendern kann, gemessen in MPixel/s (Millionen Pixel pro Sekunde) oder GPixel/s (Milliarden Pixel pro Sekunde). Es handelt sich dabei um die am häufigsten verwendete Kennzahl zur Bewertung der Pixelverarbeitungsleistung einer Grafikkarte.
121.2 GPixel/s
Texture-Takt
?
Die Textur-Füllrate bezieht sich auf die Anzahl der Textur-Map-Elemente (Texel), die eine GPU in einer Sekunde auf Pixel abbilden kann.
969.6 GTexel/s
FP16 (halbe Genauigkeit)
?
Eine wichtige Kennzahl zur Messung der GPU-Leistung ist die Gleitkomma-Rechenleistung. Halbgenaue Gleitkommazahlen (16 Bit) werden für Anwendungen wie maschinelles Lernen verwendet, bei denen eine geringere Genauigkeit akzeptabel ist. Einfach genaue Gleitkommazahlen (32 Bit) werden für übliche Multimedia- und Grafikverarbeitungsaufgaben verwendet, während doppelt genaue Gleitkommazahlen (64 Bit) für wissenschaftliches Rechnen erforderlich sind, das einen großen Zahlenbereich und hohe Genauigkeit erfordert.
124.1 TFLOPS
FP64 (Doppelte Gleitkommazahl)
?
Eine wichtige Kennzahl zur Messung der GPU-Leistung ist die Gleitkomma-Rechenleistung. Doppelt genaue Gleitkommazahlen (64 Bit) sind für wissenschaftliches Rechnen erforderlich, das einen großen Zahlenbereich und hohe Genauigkeit erfordert, während einfach genaue Gleitkommazahlen (32 Bit) für übliche Multimedia- und Grafikverarbeitungsaufgaben verwendet werden. Halbgenaue Gleitkommazahlen (16 Bit) werden für Anwendungen wie maschinelles Lernen verwendet, bei denen eine geringere Genauigkeit akzeptabel ist.
15.51 TFLOPS
FP32 (float)
?
Eine wichtige Kennzahl zur Messung der GPU-Leistung ist die Gleitkomma-Rechenfähigkeit. Gleitkommazahlen mit einfacher Genauigkeit (32 Bit) werden für allgemeine Multimedia- und Grafikverarbeitungsaufgaben verwendet, während Gleitkommazahlen mit doppelter Genauigkeit (64 Bit) für wissenschaftliche Berechnungen erforderlich sind, die einen großen Zahlenbereich und hohe Genauigkeit erfordern. Gleitkommazahlen mit halber Genauigkeit (16 Bit) werden für Anwendungen wie maschinelles Lernen verwendet, bei denen eine geringere Genauigkeit akzeptabel ist.
31.651 TFLOPS

Verschiedenes

SM-Anzahl
?
Mehrere Streaming-Prozessoren (SPs) bilden zusammen mit anderen Ressourcen einen Streaming-Multiprozessor (SM), der auch als Hauptkern einer GPU bezeichnet wird. Zu diesen zusätzlichen Ressourcen gehören Komponenten wie Warp-Scheduler, Register und gemeinsamer Speicher. Der SM kann als Herz der GPU betrachtet werden, ähnlich wie ein CPU-Kern, wobei Register und gemeinsamer Speicher knappe Ressourcen innerhalb des SM sind.
48
Shading-Einheiten
?
Die grundlegendste Verarbeitungseinheit ist der Streaming-Prozessor (SP), in dem spezifische Anweisungen und Aufgaben ausgeführt werden. GPUs führen paralleles Rechnen durch, was bedeutet, dass mehrere SPs gleichzeitig arbeiten, um Aufgaben zu verarbeiten.
6144
L1-Cache
256 KB (per SM)
L2-Cache
50 MB
TDP (Thermal Design Power)
Unknown
OpenCL-Version
3.0
CUDA
10.1
Stromanschlüsse
None
ROPs
?
Die Raster-Operations-Pipeline (ROPs) ist hauptsächlich für die Handhabung von Licht- und Reflexionsberechnungen in Spielen verantwortlich, sowie für die Verwaltung von Effekten wie Kantenglättung (AA), hoher Auflösung, Rauch und Feuer. Je anspruchsvoller die Kantenglättung und Lichteffekte in einem Spiel sind, desto höher sind die Leistungsanforderungen für die ROPs. Andernfalls kann es zu einem starken Einbruch der Bildrate kommen.
48
Empfohlene PSU (Stromversorgung)
200 W

Benchmarks

FP32 (float)
Punktzahl
31.651 TFLOPS
OpenCL
Punktzahl
143663

Im Vergleich zu anderen GPUs

FP32 (float) / TFLOPS
36.853 +16.4%
31.651
28.876 -8.8%
25.931 -18.1%
OpenCL
388405 +170.4%
186397 +29.7%
143663
90580 -36.9%
66428 -53.8%