The full upstream README, mirrored here for reference. Install config, tool schemas, adoption signals, and an original overview live on the Claude Token Saver MCP listing page.
English | 日本語
Beta — 個人利用向け。736 テスト / カバレッジ 97%。
Claude Code の「それ、ローカルでよくない?」を自動化する MCP サーバー。
ボイラープレート生成、テスト作成、テキスト要約 — Cloud API に投げるまでもない定型タスクを、手元の Ollama でさばきます。セキュリティ対策込み。
Claude Code の API 利用を分析してみたら、リクエストの約 40% は定型的なコード生成やテキスト処理でした。この手のタスクは 7B クラスのローカルモデルでも実用的な品質が出ます。「推論は Cloud、作業は Local」— この振り分けを MCP で自動化したのがこのツールです。
ローカル LLM の進化は速いです。2024 年の Llama 3 から 2025 年の Qwen3 まで、わずか 1 年でコード生成ベンチマーク (HumanEval) のスコアは 60% → 85% に跳ね上がりました。
この調子なら、Agent ワークフローにローカル LLM が当たり前に組み込まれる日もそう遠くないでしょう。claude-token-saver-mcp は Cloud と Local を使い分けるための土台を提供します。
MCP (Model Context Protocol) は Claude Code が外部ツールを呼び出すための標準プロトコルです。このサーバーを登録すると、Claude Code がタスクの内容を見て、定型的な処理を自動的にローカル LLM へ回します。
Ollama が落ちていたり応答が遅い場合は Cloud API にフォールバック可能です。
前提: Node.js 20+ と Ollama がインストール済みであること。
0. Ollama を起動
1. プロジェクトルートに .mcp.json を作成
2. Claude Code を起動して、こう頼む
RAM に応じた最適モデルが推奨 → ダウンロード(約 4GB)→ プリロードまで自動で走ります。
3. 動作確認
「ローカルLLM(qwen2.5-coder:…)で生成しました」のようにローカルモデル名が表示されれば OK。
出ない場合は ollama list でモデルを確認し、トラブルシューティング を参照してください。
プロジェクトルートの .mcp.json に追加:
auto_setup)ローカル 7B モデルの出力は Claude に及びません。それは前提です。ただ、定型タスクに限れば十分実用的です。
| タスク | ローカル品質 | 向き不向き |
|---|---|---|
| ボイラープレート生成 | ★★★★☆ | ✅ 得意 |
| ユニットテスト作成 | ★★★★☆ | ✅ 得意 |
| テキスト要約 | ★★★★☆ | ✅ 得意 |
| 単純なリファクタリング | ★★★☆☆ | ✅ 実用的 |
| アーキテクチャ設計 | ★★☆☆☆ | ❌ Cloud に任せるべき |
| 複雑なデバッグ | ★★☆☆☆ | ❌ Cloud に任せるべき |
Claude Code がタスクの複雑さを判断して自動で振り分けます。ローカルの品質が足りなければ Cloud で処理されます。
| RAM | Tier | モデル | DL サイズ |
|---|---|---|---|
| < 16 GB | Light | phi4:latest | ~2.5 GB |
| 16–48 GB | Standard | qwen2.5-coder:7b | ~4.7 GB |
| > 48 GB | Ultra | qwen2.5-coder:32b | ~18 GB |
| ツール | 説明 |
|---|---|
offload_work | コード生成・リファクタリングをローカルで実行 |
compress_context | 長大なテキストをローカルで要約 |
auto_setup | 最適モデルの推奨 → DL → プリロードをワンステップで |
batch_offload | 複数タスクを一括投入(順次 / 並列) |
cost_dashboard | 累計節約額・モデル使用統計 |
| ツール | 説明 |
|---|---|
get_metrics | サーバーメトリクス(JSON / Prometheus) |
recommend_model | タスクカテゴリ別の最適モデル推奨 |
pull_model | Ollama モデルのダウンロード |
preload_model | VRAM へのプリロード |
list_loaded_models | ロード中モデルの一覧 |
configure_model_selector | モデルセレクターのランタイム設定 |
ローカル LLM への入出力を自動で保護します。
[REDACTED] に置換| クイックスタート | 5 分で始める |
| ユースケース集 | 具体的な活用例 |
| 設定リファレンス | 全設定項目 |
| FAQ | よくある質問 |
| トラブルシューティング | エラー対応 |
対応プラットフォーム: macOS / Linux / Windows(Ollama が動く環境)
コントリビューション歓迎です → CONTRIBUTING.md