NVIDIA GB10
NVIDIA GB10: 1 PFLOP と 128 GB メモリを備えたローカル AI
GB10 は、NVIDIA DGX Spark のようなコンパクトな AI ステーション向けに設計されており、通常の Blackwell グラフィックスカードとは大きく異なります。この筐体に、20 コアの Arm プロセッサ、Blackwell グラフィックス、128 GB の LPDDR5X 共有メモリが統合されています。NVIDIA は最大 1 PFLOP FP4 の性能を謳っており、実際のテストでもこの水準が確認されています。実用的な AI タスクでは、メモリ帯域幅が重要な制約となります。
GB10 と GeForce の違い
GB10 は 2025 年 1 月にプロジェクト DIGITS の一環として初めて発表されました。後にこのコンセプトは DGX Spark の基盤となり、他のメーカーでもこのプラットフォームが利用されるようになりました。GB10 を基に設計されたシステムには、ASUS Ascent GX10、Lenovo ThinkStation PGX、HP ZGX Nano G1n、GIGABYTE AI TOP ATOM、Acer Veriton GN100 などがあります。
GB10 の主な利点は、CPU と GPU 用の 128 GB の共有メモリです。
このメモリ容量のおかげで、GB10 は通常の消費者向けグラフィックスカードの 16-32 GB VRAM に収まらないモデルをローカルで実行することができます。NVIDIA のデータによると、GB10 ベースのシステムは適切な量子化と最適化のもとで、200 億のパラメータを持つモデルに対応可能です。
テストで確認された 1 PFLOP
1 PFLOP の値は、スパース性 2:4 の FP4 計算に関連しています。この数値から、グラフィックス部分の全体的な速度や LLM におけるトークン生成速度を直接判断することはできません。
2026 年には、GB10 の Tensor Cores を NVFP4 計算でテストする nvfp4bench によって再現可能な結果が出現しました。実際のシステムは、密な NVFP4 で約 486-504 TFLOPS、スパース性 2:4 で約 1 PFLOP を示しました。
特定デバイスにおける GB10
| デバイス | NVFP4 Dense | NVFP4 Sparse 2:4 | メモリ帯域幅 |
|---|---|---|---|
| HP ZGX Nano G1n | 503.9 TFLOPS | 1007.8 TFLOPS | 207 GB/s |
| Lenovo ThinkStation PGX | 498.4 TFLOPS | 996.7 TFLOPS | 213 GB/s |
| ASUS Ascent GX10 | 497.5 TFLOPS | 994.8 TFLOPS | 205 GB/s |
| GIGABYTE AI TOP ATOM | 496.6 TFLOPS | 993.4 TFLOPS | 214 GB/s |
| NVIDIA DGX Spark | 486.3 TFLOPS | 973.2 TFLOPS | 207 GB/s |
すべての結果は同じタイプのテストで得られたため、直接比較が可能です。システム間のばらつきは少なく、ケース、冷却、設定の差異は最終結果にほとんど影響を与えません。
メモリ帯域幅の制限
Tensor Cores は低精度で高いパフォーマンスを提供しますが、128 GB LPDDR5X の公式帯域幅は最大 273 GB/s です。実用テストでは、システムは通常約 200-214 GB/s を示します。
ローカルインフェレンス LLM において、この数値は特に重要です。トークンを逐次生成する場合、モデルの重みは常にメモリから読み込まれるため、速度はよくメモリ帯域幅に制限されます。
そのため、1 PFLOP を特定のニューラルネットワークの動作速度に直接変換することはできません。
長いプリフェル、バッチ処理、および並列リクエストでは、Tensor Cores の利用がより効果的です。GB10 は、通常のデスクトップグラフィックスカードの VRAM に収まらないモデルを共有メモリに配置することが可能です。
メモリ容量は大きいですが、その帯域幅は強力なディスクリート GPU の GDDR7 よりも明らかに低いです。
GB10 が生成するトークン数
実用的な LLM テストは、ピーク性能 FP4 よりも GB10 の特性をより良く示します。NVIDIA DGX Spark で Ollama 0.18.3 と CUDA 13.0 を使用すると、密度の高いモデルが増すにつれて速度が顕著に低下しますが、128 GB のメモリにより、ほとんどの消費者向けグラフィックスカードに収まらないモデルを実行できます。
| モデル | メモリサイズ | 生成速度 | リクエスト処理速度 |
|---|---|---|---|
| Llama 3.1 8B | 4.9 GB | 42.86 トークン/秒 | 574.79 トークン/秒 |
| Qwen3 32B | 20 GB | 9.88 トークン/秒 | 141.91 トークン/秒 |
| Llama 3.1 70B | 42 GB | 4.76 トークン/秒 | 67.92 トークン/秒 |
| Mistral Large 123B | 73 GB | 2.28 トークン/秒 | 10.43 トークン/秒 |
結果は、LPDDR5X の制約を明確に示しています。Llama 3.1 8B は約 43 トークンを生成しますが、Llama 3.1 70B の速度は約 4.8 トークンに低下します。Mistral Large 123B はさらに遅くなりますが、そのサイズのモデルをコンパクトなシステムのメモリに配置する可能性こそが、GB10 の優位性の一つです。
モデルのアーキテクチャも結果に大きく影響します。個別のテストでは、モジュール式エンコーディング (MoE) のアーキテクチャを持つ Qwen3 30B が約 89 トークン/秒を示したのに対し、密な Qwen3 32B は約 11 トークン/秒に達しました。MoE では、生成に関与するのはパラメータの一部だけなので、そのモデルは GB10 のメモリ帯域幅にあまり依存しません。
GB10 を搭載したコンピュータの価格
2026 年 8 月までに、GB10 はいくつかのシリーズシステムで使用されています。チップの性能はわずかに異なりますが、価格とストレージのボリュームは特定のモデルによって大きく異なります。
| システム | ストレージ | 価格は約 |
|---|---|---|
| ASUS Ascent GX10 | 1 TB | 約 €3,999 |
| Lenovo ThinkStation PGX | 1 TB | 約 €4,733 |
| HP ZGX Nano G1n | 2 TB | 約 €5,199 |
| GIGABYTE AI TOP ATOM | 4 TB | 約 €5,499 |
| NVIDIA DGX Spark Founders Edition | 4 TB | 約 €5,599 |
| Acer Veriton GN100 | 4 TB | 約 €5,999 |
価格は欧州市場のオファーに基づいており、特定の構成によって異なります。
価格対性能比において、ASUS Ascent GX10 は他の製品よりも魅力的です。彼は、いくつかの競合他社に対して €1,000 以上も安価であり、NVFP4 の結果はわずかに数パーセントの差異に留まります。
高価なモデルに対する追加費用は、通常は SSD、ポートのセット、保証およびサポートに関連しています。これにより、GB10 のパフォーマンスに顕著な向上はありません。
Project DIGITS、DGX Spark および GB10 の関連性
GB10 には、プラットフォームの異なる発展段階で登場したいくつかの関連名があります。2025 年 1 月に NVIDIA は Project DIGITS という名前のプラットフォームを発表しました。後に、NVIDIA 自身のシステムは DGX Spark という名前になり、GB10 は ASUS、Lenovo、HP、GIGABYTE および他のメーカーによって使用されるようになりました。
| 名称 | それは何か |
|---|---|
| Project DIGITS | コンパクトなAIコンピュータの初期コンセプト |
| NVIDIA GB10 | Grace Blackwell Superchip |
| NVIDIA DGX Spark | GB10 の NVIDIA の独自シリーズシステム |
| ASUS GX10、Lenovo PGX、HP ZGX など | 同じプラットフォーム上の OEM システム |
ASUS GX10、Lenovo PGX、および HP ZGX は同じ計算プラットフォーム GB10 を使用しています。これらのシステム間の違いは、主に筐体、ストレージ、冷却、周辺機器に関係しています。
GB10 は AI ワークステーション向けの専門的な SoC として考えるのが適切です。グラフィックス部分は Blackwell アーキテクチャを使用し、プラットフォームは CPU、GPU、および共有メモリを 1 つのソリューションに統合しています。
結論
約 €4,000 からの価格で、GB10 は特定のタスクに特化しています。必要なモデルが通常の RTX の VRAM に収まる場合、独立したグラフィックスカードは同じ価格でより多くの計算性能を提供することがよくあります。
GB10 の利点は、24-32 GB の VRAM がすでに不十分なタスクにおいて現れます。128 GB の共有メモリによって、複数のディスクリート GPU やそれらの間での重みの複雑な分配なしに、大規模な AI モデルをローカルで実行できるようになります。
実際のシステムは、スパース性 2:4 の下でおおよそ 1 PFLOP FP4 の性能を確認しています。実用的な LLM テストは同時に LPDDR5X の帯域幅の制約も示しております。大規模で密度の高いモデルはメモリに格納されますが、トークン生成は比較的遅くなります。GB10 の強みは、128 GB の共有メモリ、CUDA およびコンパクトなフォームファクターの組み合わせにあります。
基本
メモリ仕様
ディスプレイとメディア
理論上の性能
その他
ベンチマーク
他のGPUとの比較
ソーシャルメディアで共有する
または当サイトへのリンクを追加
<a href="https://cputronic.com/ja/gpu/nvidia-gb10" target="_blank">NVIDIA GB10</a>