NVIDIA GB10

NVIDIA GB10
NVIDIA GB10 グラフィックカードのレビュー

NVIDIA GB10: 1 PFLOP と 128 GB メモリを備えたローカル AI

GB10 は、NVIDIA DGX Spark のようなコンパクトな AI ステーション向けに設計されており、通常の Blackwell グラフィックスカードとは大きく異なります。この筐体に、20 コアの Arm プロセッサ、Blackwell グラフィックス、128 GB の LPDDR5X 共有メモリが統合されています。NVIDIA は最大 1 PFLOP FP4 の性能を謳っており、実際のテストでもこの水準が確認されています。実用的な AI タスクでは、メモリ帯域幅が重要な制約となります。

GB10 と GeForce の違い

GB10 は 2025 年 1 月にプロジェクト DIGITS の一環として初めて発表されました。後にこのコンセプトは DGX Spark の基盤となり、他のメーカーでもこのプラットフォームが利用されるようになりました。GB10 を基に設計されたシステムには、ASUS Ascent GX10、Lenovo ThinkStation PGX、HP ZGX Nano G1n、GIGABYTE AI TOP ATOM、Acer Veriton GN100 などがあります。

GB10 の主な利点は、CPU と GPU 用の 128 GB の共有メモリです。

このメモリ容量のおかげで、GB10 は通常の消費者向けグラフィックスカードの 16-32 GB VRAM に収まらないモデルをローカルで実行することができます。NVIDIA のデータによると、GB10 ベースのシステムは適切な量子化と最適化のもとで、200 億のパラメータを持つモデルに対応可能です。

テストで確認された 1 PFLOP

1 PFLOP の値は、スパース性 2:4 の FP4 計算に関連しています。この数値から、グラフィックス部分の全体的な速度や LLM におけるトークン生成速度を直接判断することはできません。

2026 年には、GB10 の Tensor Cores を NVFP4 計算でテストする nvfp4bench によって再現可能な結果が出現しました。実際のシステムは、密な NVFP4 で約 486-504 TFLOPS、スパース性 2:4 で約 1 PFLOP を示しました。

特定デバイスにおける GB10

デバイス NVFP4 Dense NVFP4 Sparse 2:4 メモリ帯域幅
HP ZGX Nano G1n 503.9 TFLOPS 1007.8 TFLOPS 207 GB/s
Lenovo ThinkStation PGX 498.4 TFLOPS 996.7 TFLOPS 213 GB/s
ASUS Ascent GX10 497.5 TFLOPS 994.8 TFLOPS 205 GB/s
GIGABYTE AI TOP ATOM 496.6 TFLOPS 993.4 TFLOPS 214 GB/s
NVIDIA DGX Spark 486.3 TFLOPS 973.2 TFLOPS 207 GB/s

すべての結果は同じタイプのテストで得られたため、直接比較が可能です。システム間のばらつきは少なく、ケース、冷却、設定の差異は最終結果にほとんど影響を与えません。

メモリ帯域幅の制限

Tensor Cores は低精度で高いパフォーマンスを提供しますが、128 GB LPDDR5X の公式帯域幅は最大 273 GB/s です。実用テストでは、システムは通常約 200-214 GB/s を示します。

ローカルインフェレンス LLM において、この数値は特に重要です。トークンを逐次生成する場合、モデルの重みは常にメモリから読み込まれるため、速度はよくメモリ帯域幅に制限されます。

そのため、1 PFLOP を特定のニューラルネットワークの動作速度に直接変換することはできません。

長いプリフェル、バッチ処理、および並列リクエストでは、Tensor Cores の利用がより効果的です。GB10 は、通常のデスクトップグラフィックスカードの VRAM に収まらないモデルを共有メモリに配置することが可能です。

メモリ容量は大きいですが、その帯域幅は強力なディスクリート GPU の GDDR7 よりも明らかに低いです。

GB10 が生成するトークン数

実用的な LLM テストは、ピーク性能 FP4 よりも GB10 の特性をより良く示します。NVIDIA DGX Spark で Ollama 0.18.3 と CUDA 13.0 を使用すると、密度の高いモデルが増すにつれて速度が顕著に低下しますが、128 GB のメモリにより、ほとんどの消費者向けグラフィックスカードに収まらないモデルを実行できます。

モデル メモリサイズ 生成速度 リクエスト処理速度
Llama 3.1 8B 4.9 GB 42.86 トークン/秒 574.79 トークン/秒
Qwen3 32B 20 GB 9.88 トークン/秒 141.91 トークン/秒
Llama 3.1 70B 42 GB 4.76 トークン/秒 67.92 トークン/秒
Mistral Large 123B 73 GB 2.28 トークン/秒 10.43 トークン/秒

結果は、LPDDR5X の制約を明確に示しています。Llama 3.1 8B は約 43 トークンを生成しますが、Llama 3.1 70B の速度は約 4.8 トークンに低下します。Mistral Large 123B はさらに遅くなりますが、そのサイズのモデルをコンパクトなシステムのメモリに配置する可能性こそが、GB10 の優位性の一つです。

モデルのアーキテクチャも結果に大きく影響します。個別のテストでは、モジュール式エンコーディング (MoE) のアーキテクチャを持つ Qwen3 30B が約 89 トークン/秒を示したのに対し、密な Qwen3 32B は約 11 トークン/秒に達しました。MoE では、生成に関与するのはパラメータの一部だけなので、そのモデルは GB10 のメモリ帯域幅にあまり依存しません。

GB10 を搭載したコンピュータの価格

2026 年 8 月までに、GB10 はいくつかのシリーズシステムで使用されています。チップの性能はわずかに異なりますが、価格とストレージのボリュームは特定のモデルによって大きく異なります。

システム ストレージ 価格は約
ASUS Ascent GX10 1 TB 約 €3,999
Lenovo ThinkStation PGX 1 TB 約 €4,733
HP ZGX Nano G1n 2 TB 約 €5,199
GIGABYTE AI TOP ATOM 4 TB 約 €5,499
NVIDIA DGX Spark Founders Edition 4 TB 約 €5,599
Acer Veriton GN100 4 TB 約 €5,999

価格は欧州市場のオファーに基づいており、特定の構成によって異なります。

価格対性能比において、ASUS Ascent GX10 は他の製品よりも魅力的です。彼は、いくつかの競合他社に対して €1,000 以上も安価であり、NVFP4 の結果はわずかに数パーセントの差異に留まります。

高価なモデルに対する追加費用は、通常は SSD、ポートのセット、保証およびサポートに関連しています。これにより、GB10 のパフォーマンスに顕著な向上はありません。

Project DIGITS、DGX Spark および GB10 の関連性

GB10 には、プラットフォームの異なる発展段階で登場したいくつかの関連名があります。2025 年 1 月に NVIDIA は Project DIGITS という名前のプラットフォームを発表しました。後に、NVIDIA 自身のシステムは DGX Spark という名前になり、GB10 は ASUS、Lenovo、HP、GIGABYTE および他のメーカーによって使用されるようになりました。

名称 それは何か
Project DIGITS コンパクトなAIコンピュータの初期コンセプト
NVIDIA GB10 Grace Blackwell Superchip
NVIDIA DGX Spark GB10 の NVIDIA の独自シリーズシステム
ASUS GX10、Lenovo PGX、HP ZGX など 同じプラットフォーム上の OEM システム

ASUS GX10、Lenovo PGX、および HP ZGX は同じ計算プラットフォーム GB10 を使用しています。これらのシステム間の違いは、主に筐体、ストレージ、冷却、周辺機器に関係しています。

GB10 は AI ワークステーション向けの専門的な SoC として考えるのが適切です。グラフィックス部分は Blackwell アーキテクチャを使用し、プラットフォームは CPU、GPU、および共有メモリを 1 つのソリューションに統合しています。

結論

約 €4,000 からの価格で、GB10 は特定のタスクに特化しています。必要なモデルが通常の RTX の VRAM に収まる場合、独立したグラフィックスカードは同じ価格でより多くの計算性能を提供することがよくあります。

GB10 の利点は、24-32 GB の VRAM がすでに不十分なタスクにおいて現れます。128 GB の共有メモリによって、複数のディスクリート GPU やそれらの間での重みの複雑な分配なしに、大規模な AI モデルをローカルで実行できるようになります。

実際のシステムは、スパース性 2:4 の下でおおよそ 1 PFLOP FP4 の性能を確認しています。実用的な LLM テストは同時に LPDDR5X の帯域幅の制約も示しております。大規模で密度の高いモデルはメモリに格納されますが、トークン生成は比較的遅くなります。GB10 の強みは、128 GB の共有メモリ、CUDA およびコンパクトなフォームファクターの組み合わせにあります。

基本

レーベル名
NVIDIA
プラットホーム
Desktop
発売日
August 2025
モデル名
GB10
世代
Server Blackwell
ベースクロック
1665 MHz
ブーストクロック
2525 MHz
バスインターフェース
PCIe 5.0 x16
トランジスタ
Unknown
RTコア
48
テンソルコア
?
テンソルコアは深層学習専用に設計された特化型プロセッサで、FP32トレーニングと比較して高いトレーニングと推論性能を提供します。コンピュータビジョン、自然言語処理、音声認識、テキストから音声への変換、個別の推奨などの領域で迅速な計算を可能にします。テンソルコアの最も注目すべき応用は、DLSS(Deep Learning Super Sampling)とAI Denoiserのノイズリダクションです。
384
TMU
?
テクスチャマッピングユニット(TMUs)は、二進画像を回転、スケーリング、歪曲して、それを3Dモデルの任意の平面にテクスチャとして配置することができるGPUのコンポーネントです。このプロセスはテクスチャマッピングと呼ばれます。
384
ファウンドリ
TSMC
プロセスサイズ
3 nm
アーキテクチャ
Blackwell

メモリ仕様

メモリサイズ
128GB
メモリタイプ
LPDDR5X
メモリバス
?
メモリバス幅とは、1クロックサイクル内にビデオメモリが転送できるデータのビット数を指します。バス幅が大きいほど、一度に転送できるデータ量が多くなります。メモリバンド幅の計算式は次の通りです:メモリバンド幅 = メモリ周波数 x メモリバス幅 / 8。
256bit
メモリクロック
1067 MHz
帯域幅
?
メモリバンド幅は、グラフィックチップとビデオメモリ間のデータ転送速度を指します。単位はバイト/秒で、計算式は次の通りです:メモリバンド幅 = 動作周波数 × メモリバス幅 / 8ビット。
273.2GB/s

ディスプレイとメディア

出力
1x HDMI

理論上の性能

ピクセルレート
?
ピクセル塗りつぶし率は、グラフィックスプロセッシングユニット(GPU)が1秒あたりにレンダリングできるピクセル数を指します。これは、MPixels/s(百万ピクセル/秒)またはGPixels/s(十億ピクセル/秒)で測定されます。これはグラフィックスカードのピクセル処理性能を評価するために最も一般的に使用される指標です。
121.2 GPixel/s
テクスチャレート
?
テクスチャ塗りつぶし率は、GPUが1秒間にピクセルにマッピングできるテクスチャマップ要素(テクセル)の数を指します。
969.6 GTexel/s
FP16 (半精度)
?
GPUパフォーマンスを測定する重要な指標は浮動小数点計算能力です。半精度浮動小数点数(16ビット)は、精度が低くても許容可能な機械学習のようなアプリケーションで使用されます。単精度浮動小数点数(32ビット)は、一般的なマルチメディアやグラフィックス処理のタスクで使用され、倍精度浮動小数点数(64ビット)は、広範で高精度が求められる科学計算に必要です。
124.1 TFLOPS
FP64 (倍精度)
?
GPUパフォーマンスを測定する重要な指標は浮動小数点計算能力です。倍精度浮動小数点数(64ビット)は、広範で高精度が求められる科学計算に必要です。単精度浮動小数点数(32ビット)は、一般的なマルチメディアやグラフィックス処理のタスクで使用されます。半精度浮動小数点数(16ビット)は、精度が低くても許容可能な機械学習のようなアプリケーションで使用されます。
15.51 TFLOPS
FP32 (浮動小数点)
?
GPU のパフォーマンスを測定するための重要な指標は、浮動小数点コンピューティング能力です。 単精度浮動小数点数 (32 ビット) は一般的なマルチメディアおよびグラフィックス処理タスクに使用されますが、倍精度浮動小数点数 (64 ビット) は広い数値範囲と高精度が要求される科学計算に必要です。 半精度浮動小数点数 (16 ビット) は、精度が低くても許容される機械学習などのアプリケーションに使用されます。
31.651 TFLOPS

その他

SM数
?
ストリーミングプロセッサ(SP)は他のリソースとともに、ストリーミングマルチプロセッサ(SM)を形成し、これはGPUの主要コアとも呼ばれます。これらの追加リソースには、ワープスケジューラ、レジスタ、共有メモリなどのコンポーネントが含まれます。SMは、レジスタや共有メモリが希少なリソースであるGPUの中心部と考えることができます。
48
シェーディングユニット
?
最も基本的な処理単位はストリーミングプロセッサ(SP)で、特定の指示とタスクが実行されます。GPUは並行計算を行い、複数のSPが同時にタスクを処理します。
6144
L1キャッシュ
256 KB (per SM)
L2キャッシュ
50 MB
TDP
Unknown
OpenCLのバージョン
3.0
CUDA
10.1
電源コネクタ
None
ROP
?
ラスタオペレーションパイプライン(ROPs)は、ゲーム内の照明や反射計算を主に取り扱い、アンチエイリアシング(AA)、高解像度、煙、火などの効果を管理します。ゲームのAAと照明効果が高いほど、ROPsの性能要求が高くなります。
48
推奨PSU
200 W

ベンチマーク

FP32 (浮動小数点)
スコア
31.651 TFLOPS
OpenCL
スコア
143663

他のGPUとの比較

FP32 (浮動小数点) / TFLOPS
36.853 +16.4%
31.651
28.876 -8.8%
25.931 -18.1%
OpenCL
388405 +170.4%
186397 +29.7%
143663
90580 -36.9%
66428 -53.8%