MCP server that offloads routine coding tasks to local LLM (Ollama) to save Claude API tokens
Copy the AI prompt to install this server into Claude Code, Cursor, or another agent — or use 1-click editor setup below.
💡 Paste into ~/Library/Application Support/Claude/claude_desktop_config.json (macOS) or %APPDATA%\Claude\claude_desktop_config.json (Windows)
English | 日本語
Beta — 個人利用向け。736 テスト / カバレッジ 97%。
Claude Code の「それ、ローカルでよくない?」を自動化する MCP サーバー。
ボイラープレート生成、テスト作成、テキスト要約 — Cloud API に投げるまでもない定型タスクを、手元の Ollama でさばきます。セキュリティ対策込み。
Claude Code の API 利用を分析してみたら、リクエストの約 40% は定型的なコード生成やテキスト処理でした。この手のタスクは 7B クラスのローカルモデルでも実用的な品質が出ます。「推論は Cloud、作業は Local」— この振り分けを MCP で自動化したのがこのツールです。
ローカル LLM の進化は速いです。2024 年の Llama 3 から 2025 年の Qwen3 まで、わずか 1 年でコード生成ベンチマーク (HumanEval) のスコアは 60% → 85% に跳ね上がりました。
この調子なら、Agent ワークフローにローカル LLM が当たり前に組み込まれる日もそう遠くないでしょう。claude-token-saver-mcp は Cloud と Local を使い分けるための土台を提供します。
MCP (Model Context Protocol) は Claude Code が外部ツールを呼び出すための標準プロトコルです。このサーバーを登録すると、Claude Code がタスクの内容を見て、定型的な処理を自動的にローカル LLM へ回します。
Ollama が落ちていたり応答が遅い場合は Cloud API にフォールバック可能です。
前提: Node.js 20+ と Ollama がインストール済みであること。
0. Ollama を起動
1. プロジェクトルートに .mcp.json を作成
2. Claude Code を起動して、こう頼む
RAM に応じた最適モデルが推奨 → ダウンロード(約 4GB)→ プリロードまで自動で走ります。
3. 動作確認
「ローカルLLM(qwen2.5-coder:…)で生成しました」のようにローカルモデル名が表示されれば OK。
出ない場合は ollama list でモデルを確認し、トラブルシューティング を参照してください。
プロジェクトルートの .mcp.json に追加:
auto_setup)ローカル 7B モデルの出力は Claude に及びません。それは前提です。ただ、定型タスクに限れば十分実用的です。
| タスク | ローカル品質 | 向き不向き |
|---|---|---|
| ボイラープレート生成 | ★★★★☆ | ✅ 得意 |
| ユニットテスト作成 | ★★★★☆ | ✅ 得意 |
| テキスト要約 | ★★★★☆ | ✅ 得意 |
| 単純なリファクタリング | ★★★☆☆ | ✅ 実用的 |
| アーキテクチャ設計 | ★★☆☆☆ | ❌ Cloud に任せるべき |
| 複雑なデバッグ | ★★☆☆☆ | ❌ Cloud に任せるべき |
Claude Code がタスクの複雑さを判断して自動で振り分けます。ローカルの品質が足りなければ Cloud で処理されます。
| RAM | Tier | モデル | DL サイズ |
|---|---|---|---|
| < 16 GB | Light | phi4:latest | ~2.5 GB |
| 16–48 GB | Standard | qwen2.5-coder:7b | ~4.7 GB |
| > 48 GB | Ultra | qwen2.5-coder:32b | ~18 GB |
| ツール | 説明 |
|---|---|
offload_work | コード生成・リファクタリングをローカルで実行 |
compress_context | 長大なテキストをローカルで要約 |
auto_setup | 最適モデルの推奨 → DL → プリロードをワンステップで |
batch_offload | 複数タスクを一括投入(順次 / 並列) |
cost_dashboard | 累計節約額・モデル使用統計 |
| ツール | 説明 |
|---|---|
get_metrics | サーバーメトリクス(JSON / Prometheus) |
recommend_model | タスクカテゴリ別の最適モデル推奨 |
pull_model | Ollama モデルのダウンロード |
preload_model | VRAM へのプリロード |
list_loaded_models | ロード中モデルの一覧 |
configure_model_selector | モデルセレクターのランタイム設定 |
ローカル LLM への入出力を自動で保護します。
[REDACTED] に置換| クイックスタート | 5 分で始める |
| ユースケース集 | 具体的な活用例 |
| 設定リファレンス | 全設定項目 |
| FAQ | よくある質問 |
| トラブルシューティング | エラー対応 |
対応プラットフォーム: macOS / Linux / Windows(Ollama が動く環境)
コントリビューション歓迎です → CONTRIBUTING.md
Showcase your server listing on GitHub or your project documentation. Embed this dynamic SVG badge to highlight official listing status and live engagement.
[](https://allmcps.com/mcp/claude-token-saver-mcp)<a href="https://allmcps.com/mcp/claude-token-saver-mcp"><img src="https://allmcps.com/api/badge/claude-token-saver-mcp?style=directory" alt="Claude Token Saver Mcp on AllMCPs" /></a>