digital base
プロダクトドキュメントお知らせ会社概要

お問い合わせ

ご質問やご相談など、お気軽にお問い合わせください。

会社名必須
お名前必須
部署・役職任意
メールアドレス必須
電話番号任意
お問い合わせ内容必須

デジタルベース株式会社

〒106-0047
東京都港区南麻布3-20-1 5階

サイトメニュー

  • トップページ
  • プロダクト
  • セミナー・ウェビナー
  • 資料ダウンロード
  • ドキュメント
  • 最新ニュース
  • 記事一覧
  • 会社情報

お問い合わせ

  • info@digital-base.co.jp

NVIDIA Inception Program / Intel Partner ISV /
NTTPC Innovation LAB

© デジタルベース株式会社. All rights reserved.
記事一覧に戻る
2026.05.01ハードウェア

ASUS Ascent GX10(NVIDIA GB10 / DGX Spark)実機検証|小型筐体で動かすローカルLLMの実用性

NVIDIA GB10搭載のASUS Ascent GX10を実機検証。273GB/sのメモリ帯域がスループットに与える制約と、MoEモデルによる多接続・高精度の両立、OllamaとvLLMの使い分けを、業務AI基盤の観点から解説します。

デジタルベース株式会社

ASUS Ascent GX10(NVIDIA GB10 / DGX Spark)実機検証|小型筐体で動かすローカルLLMの実用性

概要

NVIDIA GB10(Blackwellアーキテクチャ)を搭載する小型AIワークステーション「ASUS Ascent GX10」(DGX Spark系列)について、DigitalBaseで実機検証を実施しました。70Bクラスのモデルを小型筐体で運用できる利点と、メモリ帯域 273GB/s がスループットに与える制約、そして MoE(Mixture of Experts)モデル によって多接続と高精度を両立する手法を、業務AI基盤の構築という観点から整理します。


ハードウェア概要

項目仕様
GPUNVIDIA GB10(Blackwell)
統合メモリ128GB LPDDR5X(CPU/GPU共有)
メモリ帯域約273 GB/s
FP4性能1 PFLOPS級
OSUbuntu 24.04 LTS(aarch64)
形状小型デスクトップ筐体

主な特徴は 128GB の統合メモリ と aarch64 アーキテクチャ です。GPUとCPUが同一メモリを共有するため、PCIe経由のVRAMコピーが発生せず、大規模モデルのロードや切り替えを高速に行えます。


セットアップ上の注意点

aarch64 のバイナリ問題

公開されているDocker imageの多くは linux/amd64 のみの提供です。CUDA系のツールでも --platform=linux/arm64 ビルドが用意されていないものは、ソースからの自前ビルドが必要になります。

GB10 の CUDA 要件

GB10 は CUDA 12.8 以降 を要求します。NVIDIA公式の Ubuntu 24.04 / aarch64 用ドライバでは nvidia-driver-580 系を導入します。


モデルの動作検証

70Bクラスのロード

70Bクラスの量子化モデル(Q4_K_M, 約40GB)の Ollama でのロードは、1〜2分で完了しました。統合メモリの恩恵により、モデル切り替え(72B → 32B → 7B)が PCIe 経由のコピーと比べて大幅に高速です。

推論速度の実測

モデル量子化速度(tok/s)備考
Qwen2.5 7BQ460〜70軽快
Qwen2.5 32BQ422〜28実用域
Qwen2.5 72BQ48〜12単発は可、多接続は厳しい
Qwen3 30B-A3B(MoE)Q450〜60MoEの優位性が顕著

メモリ帯域 273GB/s というボトルネック

LLM推論は基本的に メモリ帯域律速 です。1トークンを生成するたびに、モデルの全パラメータをメモリから読み出す必要があります。

理論上限 (tok/s) ≈ メモリ帯域 (GB/s) / モデルサイズ (GB)

72B Q4(約40GB)の場合は以下のとおりです。

273 / 40 ≈ 6.8 tok/s(理論上限)

この帯域では、大規模な密モデルを多人数で同時利用する構成は現実的ではありません。データセンター向けの H100 SXM は約 3,350GB/s であり、帯域は1桁上です。


MoEモデルによる多接続の実現

密モデル vs MoE

項目密モデル(72B)MoE(30B-A3B)
総パラメータ72B30B
推論時アクティブ72B約3B
1トークンあたりの帯域消費大小
同時接続のさばきやすさ△◎
単発の品質◎○
メモリ占有40GB18GB

5〜10名の同時利用を想定する場合、密モデルの72Bよりも MoE 30Bクラスを採用したほうが、体感速度の面で大きく有利です。

実用構成例

  • ベースモデル:Qwen3 30B-A3B(MoE)
  • 同時接続:5〜8セッション
  • vLLM の --enable-prefix-caching でプロンプトの共通部分をキャッシュ
  • ベクトル検索(pgvector / HNSW)はCPU側で並列化

この構成では、1セッションあたり 30〜40 tok/s を維持し、5〜8名の同時利用での応答性能を確認しました。


Ollama と vLLM の使い分け

OllamavLLM
長所セットアップが容易、GGUF量子化が豊富PagedAttentionによる多接続・高スループット
短所マルチセッション性能が弱いaarch64ビルドの整備が必要
適性単独利用、検証・デモ、量子化モデルの切り替え検証本番運用、社内マルチユーザー、API統合

検証フェーズは Ollama、運用フェーズは vLLM という段階的な構成が現実的です。


業務AI基盤としての位置づけ

適しているケース

  • 部署・小規模チーム(5〜10名)の社内AIアシスタント
  • 機密データを完全オフラインで処理したい用途
  • 設計図面・契約書など機密性の高いドキュメントのRAG
  • 複数モデルを切り替えながら評価する開発機

適していないケース

  • 全社100名超の同時利用(複数台構成またはデータセンターGPUを推奨)
  • リアルタイム性が極めて高い対話用途(H100クラスが必要)
  • フルパラメータのファインチューニング(QLoRA程度であれば対応可能)

まとめ

ASUS Ascent GX10 は、128GBの統合メモリとBlackwellにより、小型筐体でローカルLLMを運用できる製品です。業務AI基盤として利用する際は、273GB/s のメモリ帯域がボトルネックになりやすい点を踏まえ、モデルと推論サーバーを選定する必要があります。検証段階では Ollama、社内の複数ユーザーによる運用では vLLM を使う段階的な構成が考えられます。

下記のお悩みなら、ご相談ください

PoC から商用化に進むには、次の 3 点が必要になります。統合型 AI エージェント基盤「DigitalBase」は、 これらを 1 つの製品で提供しています。お気軽にご相談ください。