AIシステム:セルフホスト型アシスタント、RAG、ローカルインフラ

目次

ほとんどのローカルAI設定は、モデルとランタイムから始まります。

量子化されたモデルをダウンロードし、Ollamaやその他のランタイムを通じて起動して、プロンプトを打ち始める。実験的にはこれで十分です。しかし、好奇心を超えて動き始めると、メモリ、検索品質、ルーティングの判断、コスト意識を気にし始めると、そのシンプルさには限界が現れてきます。

このクラスターでは、異なるアプローチを探ります。AIアシスタントを単一のモデル呼び出しとしてではなく、調整されたシステムとして捉えるアプローチです。

この区別は一見控えめに見えるかもしれませんが、ローカルAIに対する考え方を根本から変えます。

AI systems orchestration with local LLMs, RAG, and memory layers


AIシステムとは何か

AIシステムは単なるモデルではありません。推論、検索、メモリ、実行を接続し、一貫性のあるアシスタントのように動作するものを作るためのオーケストレーションレイヤーです。

モデルをローカルで実行することはインフラストラクチャ作業です。そのモデルを中心にアシスタントを設計することはシステム作業です。

以下の幅広いガイドをご覧になった方は:

推論はスタックの単なる1つのレイヤーにすぎないことをすでに知っているはずです。

AIシステムクラスターは、それらのレイヤーの上に位置しています。それらを置き換えるのではなく、組み合わせるのです。

プロダクションのアシスタントにおいて、それらのレイヤーがどう組み合わされるかの横断的なマップについては — LLM、メモリ、ツール、ルーティング、オブザーバビリティ、OpenClawとHermesを参照システムとして — AI Assistant Architecture: LLM, Memory, Tools, Routing, Observability を参照してください。

アシスタントアーキテクチャが確立されたら、次のステップは能動的にするです。Polling Agents in AI Assistants: 11 Implementation Patterns は、バックグラウンドのポーリングワーカー、キューベースの実行、永続ワークフロー、意味的LLM評価者が、反応的なアシスタントを監視し、判断し、自ら行動するものに変える方法を扱います。

単一のアシスタントでは不十分で、複数のエージェントが連携する必要が生じた場合、連携パターンの選択がすべてを決定します: レイテンシ、障害耐性、コスト、デバッグしやすさ。Multi-Agent Orchestration Patterns: A Practical Guide は、6つの正規パターン — オーケストレーター-ワーカー、シーケンスパイプライン、ファンアウト、階層型、スウォーム、メッシュ — を具体的な失敗モードと適切なアーキテクチャを選ぶための意思決定フレームワークとともに扱います。


OpenClaw: セルフホステッドAIアシスタントシステム

OpenClawは、オープンソースでセルフホステッドのAIアシスタントであり、ローカルインフラストラクチャ上で動作しながらメッセージングプラットフォーム全体で運用されるよう設計されています。

実用的なレベルでは、OpenClawは以下をします:

  • OllamaやvLLMなどのローカルLLMランタイムを使用
  • インデックス化されたドキュメントからの検索を統合
  • 単一のセッションを超えたメモリを維持
  • ツールと自動化タスクを実行
  • 計装と観測が可能
  • ハードウェア制約内で動作

単なるモデルのラッパーではありません。推論、検索、メモリ、実行を接続し、一貫性のあるアシスタントのように動作するものを作るためのオーケストレーションレイヤーです。

入門とアーキテクチャ:

  • OpenClaw quickstart guide — ローカルOllamaモデルまたはクラウドベースのClaude設定を使用するDockerベースのインストール
  • OpenClaw system overview — 単純なローカルセットアップとOpenClawの違いに関するアーキテクチャの探索
  • NemoClaw guide for secure OpenClaw operations — OpenShellサンドボクシング、ポリシー階層、ルーティング推論、2日目以降の運用を含むセキュリティファーストのOpenClawパス

コンテキストと分析:

  • OpenClaw rise and fall timeline — バイラルな急増の背後にある経済学、2026年4月のサブスクリプションカットオフ、および崩壊がAIヒプーサイクルについて示すこと
  • OpenClaw vs Hermes Agent — stars, downloads, and usage data — OpenRouterトークンランキング、パッケージダウンロード数、コミュニティヘルス指標、検索トレンド分析を備えた20のフレームワークのライブリーダーボード

OpenClawの拡張と設定:

プラグインはOpenClawランタイムを拡張します — メモリアンダー、モデルプロバイダー、コミュニケーションチャネル、Webツール、オブザーバビリティを追加します。スキルはエージェントの動作を拡張します — エージェントがそれらの能力をいつ、どのように使うかを定義します。プロダクション設定とは、それらを組み合わせ、実際にシステムを使っている人を軸に整えることです。


Hermes: スキルとツールサンドボクシングを備えた永続エージェント

Hermes Agentはセルフホステッドでモデル非依存のアシスタントであり、永続動作に焦点を当てています: 長期生存プロセスとして動作し、設定可能なバックエンドを介してツールを実行し、メモリと再利用可能なスキルを通じて時間とともにワークフローを改善できます。

実用的なレベルでは、以下を望む場合にHermesは有用です:

  • メッセージングアプリにブリッジングできるターミナルファーストのアシスタント
  • OpenAI互換エンドポイントとモデル切り替えによるプロバイダーの柔軟性
  • ローカルおよびサンドボックス化されたバックエンドによるツール実行の境界
  • 診断、ログ、設定衛生による2日目以降の運用

Hermesプロファイルは完全に隔離された環境です — 各プロファイルは自身の設定、シークレット、メモリ、セッション、スキル、状態を持っています。プロファイルが実際のプロダクション所有の単位であり、個々のスキルではないことを意味します。


永続知識とメモリ

いくつかの問題は、より大きなコンテキストウィンドウだけでは解決しません — 永続知識(グラフ、インジェストパイプライン)とエージェントメモリのプラグイン(Honcho、Mem0、Hindsight、および類似のバックエンド)をHermesやOpenClawなどのアシスタントに接続する必要があります。


MCP: Model Context Protocol Servers

Model Context Protocol (MCP) は、Anthropicが導入した、AI言語モデルを外部データソース、ツール、システムに接続するためのオープンスタンダードです。MCPは、AIアプリケーションのUSB-Cポートと考えることで、N×M統合問題を解決します。MCPサーバーを構築することで、ファイル、データベース、API、呼び出し可能なツールに対するカスタム統合でAIアシスタントを拡張でき、stdioまたはHTTP üzerinden のシンプルでJSON-RPCベースのプロトコルを使用します。

  • Agent Skills vs MCP Servers: Decision Framework — スキルを使う時期、MCPサーバーを構築する時期、薄サーバーパターンが両方をどう組み合わせるかの実用的な意思決定フレームワーク
  • MCP Server in Go — プロトコルアーキテクチャ、JSON-RPCメッセージ構造、能力交渉、公式Go SDK、GoでのMCPサーバー構築のステップバイステップチュートリアル
  • Building MCP Servers in Python — Web検索とスクレイピングMCPサーバー、stdioとSSEトランスポート、Claude Desktop統合をカバーする実用的なPython実装ガイド

A2A: Agent-to-Agent Protocol

Agent2Agent Protocol (A2A) は、独立してデプロイされたAIエージェントシステム間の通信のためのオープンスタンダードです。MCPがエージェントをツールに接続するのに対し、A2Aはエージェントを他のエージェントに接続します — 互いをAgent Cardsで発見し、タスクとメッセージを交換し、進捗をストリーミングし、型付きアーティファクトを返します。A2Aは、エージェントが異なるチームに所有され、異なるフレームワークで構築され、または相互運用が必要な個別サービスとしてデプロイされるシステムのために設計されています。

  • What Is the A2A Protocol? Agent Cards and Tasks Explained — A2Aコンセプトの詳細解説: Agent Cards、タスクライフサイクル、メッセージ、パーツ、アーティファクト、ストリーミング、セキュリティ、オーケストレーター+エキスパートパターン
  • A2A Streaming and Async Tasks for Long-Running Agent Workflows — SSEストリーミング、プッシュWebhook、入力要求の人間インタラクションフロー、障害処理、単一のHTTPリクエストを超えて存続するタスクのオブザーバビリティの実用的なガイド
  • A2A vs MCP: Do AI Agents Really Need Both Protocols? — 2つのプロトコルの実用的な比較: MCPだけで十分な場合、A2Aが本物の価値を付ける場合、“A2Aは外側、MCPは内側"パターンがスケールでどう機能するか
  • Google A2A Protocol in 2026: Adoption, Hype, and Reality — 2026年にA2Aが実際にプロダクショントラクションを持っている場所、ヒープが何を誤っているか、いつ使うかの実用的な意思決定フレームワークの冷静な視点

AIシステムを異ならせるもの

いくつかの特徴が、AIシステムにより密に見る価値を持たせています。

モデルルーティングはデザイン選択として

ほとんどのローカルセットアップは1つのモデルをデフォルトにします。AIシステムは、モデルを意図的に選択することをサポートします。

これにより以下の問いが生じます:

  • 小さなリクエストはより小さなモデルを使うべきか?
  • いつ推論がより大きなコンテキストウィンドウを正当化するのか?
  • 1,000トークンあたりのコスト差はどれくらいか?

これらの問いは、LLM性能ガイド で議論される性能のトレードオフと、LLMホスティングガイド に概説されるインフラストラクチャ決定に直接結びついています。

AIシステムは、それらの決定を隠すのではなく、表面化させます。

検索は進化するコンポーネントとして扱われる

AIシステムはドキュメント検索を統合しますが、単純な「埋め込みと検索」ステップとしてではありません。

彼らは以下を認めます:

  • チャンクサイズはリコールとコストに影響を与える
  • ハイブリッド検索 (BM25 + ベクトル) は純粋な密集検索を上回る可能性がある
  • リランキングはレイテンシのコストで関連性を高める
  • インデックス戦略はメモリ消費量に影響を与える

これらのテーマは、RAGチュートリアル で議論されるより深いアーキテクチャ考慮事項と一致しています。

違いは、AIシステムが検索を孤立したデモとして提示するのではなく、生きたアシスタントに埋め込むことです。

メモリとしてのインフラストラクチャ

ステートレスLLMはセッション間ですべてを忘れます。

AIシステムは永続メモリレイヤーを導入します。それにより、すぐにデザイン問いが提起されます:

  • 何を長期保存すべきか?
  • いつコンテキストを要約すべきか?
  • トークン爆発を防ぐには?
  • メモリを効率的にインデックスするには?

これらの問いは、データインフラストラクチャガイド のデータレイヤー考慮事項と直接交差します。Hermes Agentについては特に — 有界な2ファイルメモリ、プレフィックスキャッシング、外部プラグイン — Hermes Agent Memory System とクロスフレームワーク比較 Agent memory providers compared から始めてください。 AI Systems Memory hub は関連するCogneeと知識レイヤーガイドを列挙しています。

メモリは機能ではなく、ストレージ問題になります。

オブザーバビリティは任意ではない

ほとんどのローカルAI実験は「反応する」で止まります。

AIシステムは以下を観測できるようにします:

  • トークン使用量
  • レイテンシ
  • ハードウェア利用状況
  • スループットパターン

これは、オブザーバビリティガイド で説明される監視原則と自然に結びつきます。

AIがハードウェア上で動くなら、他のワークロードと同様に測定可能であるべきです。


使ってみる感覚

外から見たら、AIシステムは依然としてチャットインターフェースのように見えるかもしれません。

表面の下では、もっと多くのことが起きています。

ローカルに保存された技術レポートを要約するよう頼んだ場合:

  1. 関連するドキュメントセグメントを検索します。
  2. 適切なモデルを選択します。
  3. 応答を生成します。
  4. トークン使用量とレイテンシを記録します。
  5. 必要に応じて永続メモリを更新します。

目に見える対話はシンプルのままです。システム動作は層になっています。

その層になった動作が、システムとデモを区別するものです。


AIシステムはスタックのどこに位置するか

AIシステムクラスターは、いくつかのインフラストラクチャレイヤーの交差点に位置しています:

  • LLM Hosting: モデルが実行されるランタイムレイヤー (Ollama, vLLM, llama.cpp)
  • RAG: コンテキストとグラウンディングを提供する検索レイヤー
  • Performance: レイテンシとスループットを追跡する測定レイヤー
  • Observability: メトリクスとコストトラッキングを提供する監視レイヤー
  • Data Infrastructure: メモリとインデックスを扱うストレージレイヤー

その区別を理解することは有用です。自分で実行すると、違いがより明らかになります。

OpenClawでの最小ローカルインストールについては、OpenClaw quickstart guide を参照してください。これは、ローカルOllamaモデルまたはクラウドベースのClaude設定を使用するDockerベースのセットアップを案内します。

セットアップがClaudeに依存している場合、このエージェントツールへのポリシー変更 は、サードパーティのOpenClawワークフローでAPI課金が現在必要になる理由を明確にします。


関連リソース

A2A: Agent-to-Agent Protocol:

MCP servers:

AI assistant guides:

Infrastructure layers:

購読する

システム、インフラ、AIエンジニアリングの新記事をお届けします。