digital base
プロダクトドキュメントお知らせ会社概要

お問い合わせ

ご質問やご相談など、お気軽にお問い合わせください。

デジタルベース株式会社

〒106-0047
東京都港区南麻布3-20-1 5階

サイトメニュー

  • トップページ
  • プロダクト
  • ドキュメント
  • 最新ニュース
  • 記事一覧
  • 会社情報

お問い合わせ

  • info@digital-base.co.jp

NVIDIA Inception Program / Intel Partner ISV /
NTTPC Innovation LAB

© デジタルベース株式会社. All rights reserved.
記事一覧に戻る
2025.08.05ハードウェア

Ollama実行環境のハードウェア比較と選定指針|VRAM容量・コスト効率・実測スループット

社内AI基盤でOllamaを運用するためのハードウェア要件を、VRAM容量を軸に整理します。GPUとCPUの推論性能、メモリ・ストレージ要件、クラウドGPUとのコスト比較を通じて、企業の環境選定に必要な判断材料を示します。

デジタルベース株式会社

Ollama実行環境のハードウェア比較と選定指針|VRAM容量・コスト効率・実測スループット

概要

社内AI基盤で Ollama を運用する際は、用途に応じたハードウェアの選定が必要です。DigitalBaseでは社内AI基盤の構築支援にあたり、複数のGPU構成で動作検証を重ねてきました。性能を左右する GPUのVRAM容量 を軸に、ハードウェア要件と実測スループットを整理します。

クラウド型LLM(ChatGPT、Claude、Geminiなど)が普及する一方で、機密情報を外部に送信せずAIを活用したいという要望から、ローカルLLMの導入を検討する企業は増えています。Ollamaは Llama、Qwen、Gemma、Phi など主要なオープンソースモデルを ollama run <model> のようなシンプルなコマンドで実行できるため、PoCから本番運用までの入り口として有力な選択肢です。


ハードウェア要件の基本:VRAM容量が動作可否を決める

OllamaでLLMを実行する際、最も重要な指標は GPUのVRAM容量 です。LLM推論はモデルの全パラメータをメモリ上に展開する必要があり、VRAMが不足するとモデルが起動できない、あるいは一部をCPU側にオフロードして極端に低速化します。

モデルサイズとVRAM要件の目安

モデル規模代表例必要VRAM(推奨)主な用途
7B〜8BLlama 3.1 8B、Qwen2.5 7B、Mistral 7B8GB以上チャット、文章生成、コード補完
13B〜14BQwen2.5 14B 等12GB以上高品質な文章生成、複雑な質問応答
30B〜34BQwen2.5 32B、CodeLlama 34B24GB以上プロ向けコード生成、高度な推論
70B級Llama 3.x 70B、Qwen2.5 72B40GB以上(4bit量子化でも24GB×2目安)最高品質の推論、研究開発

量子化技術(4bit / 8bit)を用いることで必要VRAMを大幅に削減できます。例えば70Bモデルを4bit量子化すると必要VRAMは40GB前後となり、24GBクラスのGPU 2枚構成で動作させられます。ただし量子化に伴う精度低下が許容できるかは、用途ごとに評価が必要です。


予算別の推奨ハードウェア構成

価格は2026年6月時点の国内相場を目安としています。GPU市場は変動が大きいため、導入時には最新の実勢価格をご確認ください。

エンタープライズ構成(予算100万円以上)

推奨GPU:NVIDIA A100 40GB/80GB または H100

  • VRAM:40GB / 80GB
  • 対応モデル:70B級の大規模モデルを快適に動作
  • 特長:最高水準の性能、マルチGPU構成に最適
  • 制約:高価で、データセンター相当の運用環境が望ましい

全社規模の本番運用や研究用途にはデータセンターグレードGPUが適します。初期投資が大きいため、後述するクラウドGPUとの併用も検討対象です。


CPU動作は現実的か

OllamaはCPUのみでも動作しますが、GPUと比較して推論速度が大幅に低下します。検証では概ね以下の傾向が確認できました。

GPU(RTX 4060 Ti)での推論速度

  • Llama 3 8B:約30〜50 tokens/秒
  • Mistral 7B:約40〜60 tokens/秒

CPU(Core i7-14700K)での推論速度

  • Llama 3 8B:約2〜5 tokens/秒
  • Mistral 7B:約3〜6 tokens/秒

CPU動作はテスト目的や予算制約下の暫定手段としては有効ですが、リアルタイム性が求められるチャット用途など実用レベルでは、GPU環境が事実上必須です。


メモリ(RAM)とストレージの要件

メモリ(RAM)

  • 最低:16GB(7Bモデル)
  • 推奨:32GB以上(13B以上)
  • 理想:64GB以上(複数モデルの同時実行、大規模データ処理)

Ollamaは主にVRAMを使用しますが、システム全体の安定性やモデルのロード速度には十分なRAMが寄与します。

ストレージ

  • 最低:256GB SSD
  • 推奨:1TB以上 NVMe SSD
  • 理想:2TB以上(複数モデルを保存する場合)

LLMモデルは1つあたり数GB〜数十GBのサイズがあるため、複数モデルを検証する場合は余裕を持った容量を確保してください。


実測スループット比較

Ollamaで各モデルを動作させた際のスループットを以下に整理します(値は検証時の実測の目安です)。

Llama 3 8B

GPUスループット(tokens/秒)
RTX 4090約60
RTX 4070 Ti約45
RTX 4060 Ti 16GB約35
RTX 3060 12GB約28
CPU(i7-14700K)約4

Mistral 7B

GPUスループット(tokens/秒)
RTX 4090約65
RTX 4070 Ti約50
RTX 4060 Ti 16GB約40
RTX 3060 12GB約32

CodeLlama 34B(4bit量子化)

GPUスループット(tokens/秒)
RTX 4090約18
RTX 4070 TiVRAM不足のため動作不可
RTX 4060 Ti 16GBVRAM不足のため動作不可

これらの結果は、動作可否とスループットを評価する際に、用途に見合ったVRAM容量を確認する必要があることを示しています。


クラウドGPUとの比較と選定の考え方

ローカル環境の構築には初期投資が必要ですが、継続利用ではクラウドよりコストを抑えられる場合があります。

ローカル環境の利点

  • 初期投資後のランニングコストは電気代が中心
  • データをローカルに保持でき、プライバシーとセキュリティを確保しやすい
  • インターネット接続なしで動作
  • ファインチューニングやカスタマイズの自由度が高い

クラウドGPUの利点

  • 初期投資が不要で従量課金
  • 最新ハードウェアを即時利用可能
  • スケーラビリティが高い
  • メンテナンス負荷が低い

コスト比較例(1年間の運用)

ローカル環境(RTX 4060 Ti構成)

  • 初期投資:15万円
  • 電気代(1日8時間稼働、1kWh=30円):約2.6万円/年
  • 合計:約17.6万円

クラウドGPU(AWS g5.xlarge相当)

  • 時間単価:約150円/時間
  • 1日8時間 × 365日:約43.8万円/年

1年以上の継続利用を前提とする場合、ローカル環境の方がコスト効率に優れる傾向があります。一方、短期プロジェクトやスパイク的な負荷にはクラウドが適しており、両者を組み合わせたハイブリッド運用も選択肢です。


選定の要点

Ollamaのハードウェア選定では、対象モデルと用途に応じてVRAM容量を確認し、推論速度、RAM・ストレージ容量、運用コストを比較することが要点です。

全社規模の本番運用では、A100/H100などのデータセンターGPUやクラウドGPUを用途に応じて検討します。継続利用か短期利用か、負荷の変動があるかを踏まえ、社内環境とクラウドの構成を選定してください。

下記のお悩みなら、ご相談ください

PoC から商用化に進むには、次の 3 点が必要になります。統合型 AI エージェント基盤「DigitalBase」は、 これらを 1 つの製品で提供しています。お気軽にご相談ください。