AIシステム:セルフホスト型アシスタント、RAG、ローカルインフラ
ほとんどのローカルAI設定は、モデルとランタイムから始まります。
量子化されたモデルをダウンロードし、Ollamaやその他のランタイムを通じて起動して、プロンプトを打ち始める。実験的にはこれで十分です。しかし、好奇心を超えて動き始めると、メモリ、検索品質、ルーティングの判断、コスト意識を気にし始めると、そのシンプルさには限界が現れてきます。
このクラスターでは、異なるアプローチを探ります。AIアシスタントを単一のモデル呼び出しとしてではなく、調整されたシステムとして捉えるアプローチです。
この区別は一見控えめに見えるかもしれませんが、ローカルAIに対する考え方を根本から変えます。

AIシステムとは何か
AIシステムは単なるモデルではありません。推論、検索、メモリ、実行を接続し、一貫性のあるアシスタントのように動作するものを作るためのオーケストレーションレイヤーです。
モデルをローカルで実行することはインフラストラクチャ作業です。そのモデルを中心にアシスタントを設計することはシステム作業です。
以下の幅広いガイドをご覧になった方は:
- LLM Hosting in 2026: Local, Self-Hosted & Cloud Infrastructure Compared
- LLM Architecture: System Design for Production AI — ルーティング、コスト最適化、ガードレール、マルチモデルのオーケストレーション
- Retrieval-Augmented Generation (RAG) Tutorial: Architecture, Implementation, and Production Guide
- Second brain explained for engineers and knowledge workers
- LLM Performance in 2026: Benchmarks, Bottlenecks & Optimization
- Observability for AI Systems
推論はスタックの単なる1つのレイヤーにすぎないことをすでに知っているはずです。
AIシステムクラスターは、それらのレイヤーの上に位置しています。それらを置き換えるのではなく、組み合わせるのです。
プロダクションのアシスタントにおいて、それらのレイヤーがどう組み合わされるかの横断的なマップについては — LLM、メモリ、ツール、ルーティング、オブザーバビリティ、OpenClawとHermesを参照システムとして — AI Assistant Architecture: LLM, Memory, Tools, Routing, Observability を参照してください。
アシスタントアーキテクチャが確立されたら、次のステップは能動的にするです。Polling Agents in AI Assistants: 11 Implementation Patterns は、バックグラウンドのポーリングワーカー、キューベースの実行、永続ワークフロー、意味的LLM評価者が、反応的なアシスタントを監視し、判断し、自ら行動するものに変える方法を扱います。
単一のアシスタントでは不十分で、複数のエージェントが連携する必要が生じた場合、連携パターンの選択がすべてを決定します: レイテンシ、障害耐性、コスト、デバッグしやすさ。Multi-Agent Orchestration Patterns: A Practical Guide は、6つの正規パターン — オーケストレーター-ワーカー、シーケンスパイプライン、ファンアウト、階層型、スウォーム、メッシュ — を具体的な失敗モードと適切なアーキテクチャを選ぶための意思決定フレームワークとともに扱います。
OpenClaw: セルフホステッドAIアシスタントシステム
OpenClawは、オープンソースでセルフホステッドのAIアシスタントであり、ローカルインフラストラクチャ上で動作しながらメッセージングプラットフォーム全体で運用されるよう設計されています。
実用的なレベルでは、OpenClawは以下をします:
- OllamaやvLLMなどのローカルLLMランタイムを使用
- インデックス化されたドキュメントからの検索を統合
- 単一のセッションを超えたメモリを維持
- ツールと自動化タスクを実行
- 計装と観測が可能
- ハードウェア制約内で動作
単なるモデルのラッパーではありません。推論、検索、メモリ、実行を接続し、一貫性のあるアシスタントのように動作するものを作るためのオーケストレーションレイヤーです。
入門とアーキテクチャ:
- OpenClaw quickstart guide — ローカルOllamaモデルまたはクラウドベースのClaude設定を使用するDockerベースのインストール
- OpenClaw system overview — 単純なローカルセットアップとOpenClawの違いに関するアーキテクチャの探索
- NemoClaw guide for secure OpenClaw operations — OpenShellサンドボクシング、ポリシー階層、ルーティング推論、2日目以降の運用を含むセキュリティファーストのOpenClawパス
コンテキストと分析:
- OpenClaw rise and fall timeline — バイラルな急増の背後にある経済学、2026年4月のサブスクリプションカットオフ、および崩壊がAIヒプーサイクルについて示すこと
- OpenClaw vs Hermes Agent — stars, downloads, and usage data — OpenRouterトークンランキング、パッケージダウンロード数、コミュニティヘルス指標、検索トレンド分析を備えた20のフレームワークのライブリーダーボード
OpenClawの拡張と設定:
プラグインはOpenClawランタイムを拡張します — メモリアンダー、モデルプロバイダー、コミュニケーションチャネル、Webツール、オブザーバビリティを追加します。スキルはエージェントの動作を拡張します — エージェントがそれらの能力をいつ、どのように使うかを定義します。プロダクション設定とは、それらを組み合わせ、実際にシステムを使っている人を軸に整えることです。
- OpenClaw Plugins — Ecosystem Guide and Practical Picks — ネイティブプラグインタイプ、CLIライフサイクル、セーフティレール、メモリ、チャネル、ツール、オブザーバビリティのための具体的なピック
- OpenClaw Skills Ecosystem and Practical Production Picks — ClawHubの発見、インストールと削除フロー、役割別スタック、2026年に維持すべきスキル
- OpenClaw Production Setup Patterns with Plugins and Skills — ユーザータイプ別(開発者、自動化、研究、サポート、成長)の完全なプラグインとスキル設定 — 各々に統合インストールスクリプト付き
Hermes: スキルとツールサンドボクシングを備えた永続エージェント
Hermes Agentはセルフホステッドでモデル非依存のアシスタントであり、永続動作に焦点を当てています: 長期生存プロセスとして動作し、設定可能なバックエンドを介してツールを実行し、メモリと再利用可能なスキルを通じて時間とともにワークフローを改善できます。
実用的なレベルでは、以下を望む場合にHermesは有用です:
- メッセージングアプリにブリッジングできるターミナルファーストのアシスタント
- OpenAI互換エンドポイントとモデル切り替えによるプロバイダーの柔軟性
- ローカルおよびサンドボックス化されたバックエンドによるツール実行の境界
- 診断、ログ、設定衛生による2日目以降の運用
Hermesプロファイルは完全に隔離された環境です — 各プロファイルは自身の設定、シークレット、メモリ、セッション、スキル、状態を持っています。プロファイルが実際のプロダクション所有の単位であり、個々のスキルではないことを意味します。
- Hermes AI Assistant - Install, Setup, Workflow, and Troubleshooting — インストール、プロバイダー設定、ワークフローパターン、トラブルシューティング
- Hermes Agent CLI cheat sheet — commands, flags, and slash shortcuts -
hermesサブコマンド、グローバルフラグ、ゲートウェイとプロファイルツール、一般的なスラッシュショートカットの表形式インデックス - Hermes Agent Headless Server and Remote Desktop Setup - LANとVPN経由のリモートデスクトップアクセスのためのヘッドレスデプロイメントトポロジー
- Hermes Voice Control from Your Phone — TelegramとDiscordのためのモバイルファースト音声ワークフロー、STTとTTSプロバイダーチューニング、トラブルシューティング付き
- Hermes Agent Memory System: How Persistent AI Memory Actually Works — 2ファイルのコアメモリ、フリーズスナップショットパターン、8つの外部プロバイダーすべて、有界メモリの哲学への詳細な技術ガイド
- Hermes AI Assistant Skills for Real Production Setups — エンジニア、研究者、オペレーター、経営層ワークフローのためのプロファイルファーストスキルアーキテクチャ
- Hermes Agent Skill Authoring — SKILL.md Structure and Best Practices — 実用的な
SKILL.mdレイアウト、メタデータ、条件付きアクティベーション、スキルがインデックスから消えた場合のトラブルシューティング - Kanban in Hermes Agent for Self Hosted LLM Workflows — セルフホステッドゲートウェイでのディスパッチャー並列性、依存チェーン、cronベースのバッチングのための実用的な制御パターン
- How to Migrate from OpenClaw to Hermes Agent Safely —
hermes claw migrateドライラン、コンフリクトポリシー、シークレット処理、メッセージング引継ぎ、ロールバックをカバーする段階的カットオーバーランブック
永続知識とメモリ
いくつかの問題は、より大きなコンテキストウィンドウだけでは解決しません — 永続知識(グラフ、インジェストパイプライン)とエージェントメモリのプラグイン(Honcho、Mem0、Hindsight、および類似のバックエンド)をHermesやOpenClawなどのアシスタントに接続する必要があります。
- AI Systems Memory hub — メモリサブクラスターのスコープ、およびCogneeガイドとスタックコンテキストへのリンク
- Memory Systems in AI Assistants That Actually Help — ワーキング状態、構造化事実、検索レイヤーのためのクロスフレームワークメモリ設計
- Agent memory providers compared — Honcho、OpenViking、Mem0、Hindsight、Holographic、RetainDB、ByteRover、SupermemoryのHermes風統合のための完全な比較
MCP: Model Context Protocol Servers
Model Context Protocol (MCP) は、Anthropicが導入した、AI言語モデルを外部データソース、ツール、システムに接続するためのオープンスタンダードです。MCPは、AIアプリケーションのUSB-Cポートと考えることで、N×M統合問題を解決します。MCPサーバーを構築することで、ファイル、データベース、API、呼び出し可能なツールに対するカスタム統合でAIアシスタントを拡張でき、stdioまたはHTTP üzerinden のシンプルでJSON-RPCベースのプロトコルを使用します。
- Agent Skills vs MCP Servers: Decision Framework — スキルを使う時期、MCPサーバーを構築する時期、薄サーバーパターンが両方をどう組み合わせるかの実用的な意思決定フレームワーク
- MCP Server in Go — プロトコルアーキテクチャ、JSON-RPCメッセージ構造、能力交渉、公式Go SDK、GoでのMCPサーバー構築のステップバイステップチュートリアル
- Building MCP Servers in Python — Web検索とスクレイピングMCPサーバー、stdioとSSEトランスポート、Claude Desktop統合をカバーする実用的なPython実装ガイド
A2A: Agent-to-Agent Protocol
Agent2Agent Protocol (A2A) は、独立してデプロイされたAIエージェントシステム間の通信のためのオープンスタンダードです。MCPがエージェントをツールに接続するのに対し、A2Aはエージェントを他のエージェントに接続します — 互いをAgent Cardsで発見し、タスクとメッセージを交換し、進捗をストリーミングし、型付きアーティファクトを返します。A2Aは、エージェントが異なるチームに所有され、異なるフレームワークで構築され、または相互運用が必要な個別サービスとしてデプロイされるシステムのために設計されています。
- What Is the A2A Protocol? Agent Cards and Tasks Explained — A2Aコンセプトの詳細解説: Agent Cards、タスクライフサイクル、メッセージ、パーツ、アーティファクト、ストリーミング、セキュリティ、オーケストレーター+エキスパートパターン
- A2A Streaming and Async Tasks for Long-Running Agent Workflows — SSEストリーミング、プッシュWebhook、入力要求の人間インタラクションフロー、障害処理、単一のHTTPリクエストを超えて存続するタスクのオブザーバビリティの実用的なガイド
- A2A vs MCP: Do AI Agents Really Need Both Protocols? — 2つのプロトコルの実用的な比較: MCPだけで十分な場合、A2Aが本物の価値を付ける場合、“A2Aは外側、MCPは内側"パターンがスケールでどう機能するか
- Google A2A Protocol in 2026: Adoption, Hype, and Reality — 2026年にA2Aが実際にプロダクショントラクションを持っている場所、ヒープが何を誤っているか、いつ使うかの実用的な意思決定フレームワークの冷静な視点
AIシステムを異ならせるもの
いくつかの特徴が、AIシステムにより密に見る価値を持たせています。
モデルルーティングはデザイン選択として
ほとんどのローカルセットアップは1つのモデルをデフォルトにします。AIシステムは、モデルを意図的に選択することをサポートします。
これにより以下の問いが生じます:
- 小さなリクエストはより小さなモデルを使うべきか?
- いつ推論がより大きなコンテキストウィンドウを正当化するのか?
- 1,000トークンあたりのコスト差はどれくらいか?
これらの問いは、LLM性能ガイド で議論される性能のトレードオフと、LLMホスティングガイド に概説されるインフラストラクチャ決定に直接結びついています。
AIシステムは、それらの決定を隠すのではなく、表面化させます。
検索は進化するコンポーネントとして扱われる
AIシステムはドキュメント検索を統合しますが、単純な「埋め込みと検索」ステップとしてではありません。
彼らは以下を認めます:
- チャンクサイズはリコールとコストに影響を与える
- ハイブリッド検索 (BM25 + ベクトル) は純粋な密集検索を上回る可能性がある
- リランキングはレイテンシのコストで関連性を高める
- インデックス戦略はメモリ消費量に影響を与える
これらのテーマは、RAGチュートリアル で議論されるより深いアーキテクチャ考慮事項と一致しています。
違いは、AIシステムが検索を孤立したデモとして提示するのではなく、生きたアシスタントに埋め込むことです。
メモリとしてのインフラストラクチャ
ステートレスLLMはセッション間ですべてを忘れます。
AIシステムは永続メモリレイヤーを導入します。それにより、すぐにデザイン問いが提起されます:
- 何を長期保存すべきか?
- いつコンテキストを要約すべきか?
- トークン爆発を防ぐには?
- メモリを効率的にインデックスするには?
これらの問いは、データインフラストラクチャガイド のデータレイヤー考慮事項と直接交差します。Hermes Agentについては特に — 有界な2ファイルメモリ、プレフィックスキャッシング、外部プラグイン — Hermes Agent Memory System とクロスフレームワーク比較 Agent memory providers compared から始めてください。 AI Systems Memory hub は関連するCogneeと知識レイヤーガイドを列挙しています。
メモリは機能ではなく、ストレージ問題になります。
オブザーバビリティは任意ではない
ほとんどのローカルAI実験は「反応する」で止まります。
AIシステムは以下を観測できるようにします:
- トークン使用量
- レイテンシ
- ハードウェア利用状況
- スループットパターン
これは、オブザーバビリティガイド で説明される監視原則と自然に結びつきます。
AIがハードウェア上で動くなら、他のワークロードと同様に測定可能であるべきです。
使ってみる感覚
外から見たら、AIシステムは依然としてチャットインターフェースのように見えるかもしれません。
表面の下では、もっと多くのことが起きています。
ローカルに保存された技術レポートを要約するよう頼んだ場合:
- 関連するドキュメントセグメントを検索します。
- 適切なモデルを選択します。
- 応答を生成します。
- トークン使用量とレイテンシを記録します。
- 必要に応じて永続メモリを更新します。
目に見える対話はシンプルのままです。システム動作は層になっています。
その層になった動作が、システムとデモを区別するものです。
AIシステムはスタックのどこに位置するか
AIシステムクラスターは、いくつかのインフラストラクチャレイヤーの交差点に位置しています:
- LLM Hosting: モデルが実行されるランタイムレイヤー (Ollama, vLLM, llama.cpp)
- RAG: コンテキストとグラウンディングを提供する検索レイヤー
- Performance: レイテンシとスループットを追跡する測定レイヤー
- Observability: メトリクスとコストトラッキングを提供する監視レイヤー
- Data Infrastructure: メモリとインデックスを扱うストレージレイヤー
その区別を理解することは有用です。自分で実行すると、違いがより明らかになります。
OpenClawでの最小ローカルインストールについては、OpenClaw quickstart guide を参照してください。これは、ローカルOllamaモデルまたはクラウドベースのClaude設定を使用するDockerベースのセットアップを案内します。
セットアップがClaudeに依存している場合、このエージェントツールへのポリシー変更 は、サードパーティのOpenClawワークフローでAPI課金が現在必要になる理由を明確にします。
関連リソース
A2A: Agent-to-Agent Protocol:
- What Is the A2A Protocol? Agent Cards and Tasks Explained
- A2A vs MCP: Do AI Agents Really Need Both Protocols?
- Google A2A Protocol in 2026: Adoption, Hype, and Reality
MCP servers:
AI assistant guides:
- AI Assistant Architecture: LLM, Memory, Tools, Routing, Observability
- Multi-Agent Orchestration Patterns: A Practical Guide
- Polling Agents in AI Assistants: 11 Implementation Patterns
- OpenClaw system overview
- OpenClaw rise and fall timeline
- OpenClaw quickstart guide
- OpenClaw Plugins — Ecosystem Guide and Practical Picks
- OpenClaw Skills Ecosystem and Practical Production Picks
- OpenClaw Production Setup Patterns with Plugins and Skills
- Hermes AI Assistant - Install, Setup, Workflow, and Troubleshooting
- Hermes Agent Memory System: How Persistent AI Memory Actually Works
- AI Systems Memory hub
- Agent memory providers compared
- Hermes AI Assistant Skills for Real Production Setups
- Hermes Agent Skill Authoring — SKILL.md Structure and Best Practices
Infrastructure layers:
- LLM Hosting in 2026: Local, Self-Hosted & Cloud Infrastructure Compared
- Retrieval-Augmented Generation (RAG) Tutorial: Architecture, Implementation, and Production Guide
- LLM Performance in 2026: Benchmarks, Bottlenecks & Optimization
- Agentic LLM inference parameters for Qwen and Gemma
- Observability for AI Systems
- Data Infrastructure for AI Systems