概要
社内AI基盤で Ollama を運用する際は、用途に応じたハードウェアの選定が必要です。DigitalBaseでは社内AI基盤の構築支援にあたり、複数のGPU構成で動作検証を重ねてきました。性能を左右する GPUのVRAM容量 を軸に、ハードウェア要件と実測スループットを整理します。
クラウド型LLM(ChatGPT、Claude、Geminiなど)が普及する一方で、機密情報を外部に送信せずAIを活用したいという要望から、ローカルLLMの導入を検討する企業は増えています。Ollamaは Llama、Qwen、Gemma、Phi など主要なオープンソースモデルを ollama run <model> のようなシンプルなコマンドで実行できるため、PoCから本番運用までの入り口として有力な選択肢です。
ハードウェア要件の基本:VRAM容量が動作可否を決める
OllamaでLLMを実行する際、最も重要な指標は GPUのVRAM容量 です。LLM推論はモデルの全パラメータをメモリ上に展開する必要があり、VRAMが不足するとモデルが起動できない、あるいは一部をCPU側にオフロードして極端に低速化します。
モデルサイズとVRAM要件の目安
| モデル規模 | 代表例 | 必要VRAM(推奨) | 主な用途 |
|---|---|---|---|
| 7B〜8B | Llama 3.1 8B、Qwen2.5 7B、Mistral 7B | 8GB以上 | チャット、文章生成、コード補完 |
| 13B〜14B | Qwen2.5 14B 等 | 12GB以上 | 高品質な文章生成、複雑な質問応答 |
| 30B〜34B | Qwen2.5 32B、CodeLlama 34B | 24GB以上 | プロ向けコード生成、高度な推論 |
| 70B級 | Llama 3.x 70B、Qwen2.5 72B | 40GB以上(4bit量子化でも24GB×2目安) | 最高品質の推論、研究開発 |
量子化技術(4bit / 8bit)を用いることで必要VRAMを大幅に削減できます。例えば70Bモデルを4bit量子化すると必要VRAMは40GB前後となり、24GBクラスのGPU 2枚構成で動作させられます。ただし量子化に伴う精度低下が許容できるかは、用途ごとに評価が必要です。
予算別の推奨ハードウェア構成
価格は2026年6月時点の国内相場を目安としています。GPU市場は変動が大きいため、導入時には最新の実勢価格をご確認ください。
エンタープライズ構成(予算100万円以上)
推奨GPU:NVIDIA A100 40GB/80GB または H100
- VRAM:40GB / 80GB
- 対応モデル:70B級の大規模モデルを快適に動作
- 特長:最高水準の性能、マルチGPU構成に最適
- 制約:高価で、データセンター相当の運用環境が望ましい
全社規模の本番運用や研究用途にはデータセンターグレードGPUが適します。初期投資が大きいため、後述するクラウドGPUとの併用も検討対象です。
CPU動作は現実的か
OllamaはCPUのみでも動作しますが、GPUと比較して推論速度が大幅に低下します。検証では概ね以下の傾向が確認できました。
GPU(RTX 4060 Ti)での推論速度
- Llama 3 8B:約30〜50 tokens/秒
- Mistral 7B:約40〜60 tokens/秒
CPU(Core i7-14700K)での推論速度
- Llama 3 8B:約2〜5 tokens/秒
- Mistral 7B:約3〜6 tokens/秒
CPU動作はテスト目的や予算制約下の暫定手段としては有効ですが、リアルタイム性が求められるチャット用途など実用レベルでは、GPU環境が事実上必須です。
メモリ(RAM)とストレージの要件
メモリ(RAM)
- 最低:16GB(7Bモデル)
- 推奨:32GB以上(13B以上)
- 理想:64GB以上(複数モデルの同時実行、大規模データ処理)
Ollamaは主にVRAMを使用しますが、システム全体の安定性やモデルのロード速度には十分なRAMが寄与します。
ストレージ
- 最低:256GB SSD
- 推奨:1TB以上 NVMe SSD
- 理想:2TB以上(複数モデルを保存する場合)
LLMモデルは1つあたり数GB〜数十GBのサイズがあるため、複数モデルを検証する場合は余裕を持った容量を確保してください。
実測スループット比較
Ollamaで各モデルを動作させた際のスループットを以下に整理します(値は検証時の実測の目安です)。
Llama 3 8B
| GPU | スループット(tokens/秒) |
|---|---|
| RTX 4090 | 約60 |
| RTX 4070 Ti | 約45 |
| RTX 4060 Ti 16GB | 約35 |
| RTX 3060 12GB | 約28 |
| CPU(i7-14700K) | 約4 |
Mistral 7B
| GPU | スループット(tokens/秒) |
|---|---|
| RTX 4090 | 約65 |
| RTX 4070 Ti | 約50 |
| RTX 4060 Ti 16GB | 約40 |
| RTX 3060 12GB | 約32 |
CodeLlama 34B(4bit量子化)
| GPU | スループット(tokens/秒) |
|---|---|
| RTX 4090 | 約18 |
| RTX 4070 Ti | VRAM不足のため動作不可 |
| RTX 4060 Ti 16GB | VRAM不足のため動作不可 |
これらの結果は、動作可否とスループットを評価する際に、用途に見合ったVRAM容量を確認する必要があることを示しています。
クラウドGPUとの比較と選定の考え方
ローカル環境の構築には初期投資が必要ですが、継続利用ではクラウドよりコストを抑えられる場合があります。
ローカル環境の利点
- 初期投資後のランニングコストは電気代が中心
- データをローカルに保持でき、プライバシーとセキュリティを確保しやすい
- インターネット接続なしで動作
- ファインチューニングやカスタマイズの自由度が高い
クラウドGPUの利点
- 初期投資が不要で従量課金
- 最新ハードウェアを即時利用可能
- スケーラビリティが高い
- メンテナンス負荷が低い
コスト比較例(1年間の運用)
ローカル環境(RTX 4060 Ti構成)
- 初期投資:15万円
- 電気代(1日8時間稼働、1kWh=30円):約2.6万円/年
- 合計:約17.6万円
クラウドGPU(AWS g5.xlarge相当)
- 時間単価:約150円/時間
- 1日8時間 × 365日:約43.8万円/年
1年以上の継続利用を前提とする場合、ローカル環境の方がコスト効率に優れる傾向があります。一方、短期プロジェクトやスパイク的な負荷にはクラウドが適しており、両者を組み合わせたハイブリッド運用も選択肢です。
選定の要点
Ollamaのハードウェア選定では、対象モデルと用途に応じてVRAM容量を確認し、推論速度、RAM・ストレージ容量、運用コストを比較することが要点です。
全社規模の本番運用では、A100/H100などのデータセンターGPUやクラウドGPUを用途に応じて検討します。継続利用か短期利用か、負荷の変動があるかを踏まえ、社内環境とクラウドの構成を選定してください。
