LLM(Large Language Model)とは ChatGPT や Claude のような AI です。通常はクラウド(インターネット上のサーバー)で動作し、質問を送るとインターネット越しに回答が返ってきます。
ローカルLLM は、同じ AI モデルを自分のパソコン・サーバー上で直接動かす仕組みです。クラウドに情報を送らないため、機密情報を安全に扱えます。またインターネット不要・従量課金なしで、繰り返し使い放題です。
メリット: データが外部に出ない / 月額費用がかからない / オフライン動作可
デメリット: GPT-4 / Claude Opus には精度で劣る場合がある / GPU 搭載 PC が必要
Google が 2025年に公開したオープンソースモデルです。12B(120億)パラメータながら、日本語対応・コード生成・文書要約など幅広い用途に使えます。
| 項目 | 内容 |
|---|---|
| 正式名称 | Gemma 4 12B(Google DeepMind) |
| パラメータ数 | 120 億(12B) |
| ライセンス | Gemma Terms of Use(商用利用可、再配布に制限あり) |
| 対応言語 | 日本語・英語を含む多言語 |
| 得意な用途 | 文書要約 Q&A コード生成 メール文案 社内チャットbot |
| 精度の目安 | ChatGPT-3.5 に近い水準。クラウド GPT-4 / Claude 3 Opus より劣るが、社内 FAQ・文書処理なら十分実用的 |
Gemma 4 12B をローカルで動かすには、GPU 搭載の PC またはサーバーが必要です。CPU だけでも起動はできますが、応答が非常に遅くなります(実用困難)。
| 環境 | 推奨 GPU / チップ | 価格帯の目安 | 評価 |
|---|---|---|---|
| Windows / Linux PC | NVIDIA RTX 3080(10GB VRAM)以上 RTX 4080 / 4090 なら余裕 |
GPU 単体 ¥80,000〜 | 推奨 |
| Mac(Apple Silicon) | M2 Pro / M3 Pro 以上(統合メモリ 32GB 以上) M2 Max / M3 Max ならより快適 |
MacBook Pro ¥250,000〜 | 推奨 |
| CPU のみ(非推奨) | なし(GPU なし) | — | 実用困難 |
補足: VRAM 10 GB の RTX 3080 でも「量子化版(Q4)」モデルを使えばギリギリ動作します。ただし 16 GB VRAM(RTX 3080 Ti / 3090 など)があれば余裕をもって動かせます。
ローカルLLM のセットアップには 2 つの主要ツールがあります。どちらも無料です。
コマンドラインで動かすツール。Windows / macOS / Linux 対応。API サーバーとして立ち上げて他のアプリから呼び出す使い方に向いています。
ollama.com からインストーラをダウンロード・実行ollama pull gemma4:12b を実行(モデルをダウンロード)ollama run gemma4:12b で起動 → チャット開始参考: https://ollama.com
グラフィカルなアプリ。ボタン操作でモデルのダウンロード・起動・チャットが完結します。技術知識が少ない場合はこちらが簡単です。
lmstudio.ai からインストーラをダウンロード・実行参考: https://lmstudio.ai
現在 keyaki の VM は GCE e2-standard-2(vCPU 2 / RAM 8 GB)を使用しており、GPU は搭載していません。
| 項目 | 現在の GCE 構成 | Gemma 4 12B の要件 | 可否 |
|---|---|---|---|
| GPU(VRAM) | なし | 16 GB 以上 | ✗ 不足 |
| RAM | 8 GB | 32 GB 以上 | ✗ 不足 |
| CPU | vCPU 2 | i7 相当 | △ 低速 |
現状の GCE インスタンスではローカルLLM の実用運用は困難です。
CPU のみでも起動は可能ですが、1 トークンあたり数秒かかる速度になります(会話が非常に遅い)。
GCE で実用的に使うには GPU インスタンスへの変更が必要です。
| インスタンス例 | GPU | VRAM | 月額目安 | 評価 |
|---|---|---|---|---|
| g2-standard-4 | NVIDIA L4 | 24 GB | ~$300/月 | 推奨 |
| a2-highgpu-1g | NVIDIA A100 | 40 GB | ~$2,000/月 | 高価 |
結論: 佐藤さん用ローカルLLMは GCE ではなく自社ローカルマシン(GPU 搭載 PC)で動かすのが現実的な選択です。GPU なし PC でも動くことは動きますが、応答速度が遅く実用に耐えません。スペック調査の際は「VRAM 16GB 以上の GPU」を最優先にご確認ください。