Системы ИИ: самостоятельно размещаемые ассистенты, RAG и локальная инфраструктура
Большинство локальных настроек ИИ начинаются с модели и среды выполнения.
Вы скачиваете квантованную модель, запускаете её через Ollama или другую среду выполнения и начинаете генерировать промпты. Для экспериментов этого более чем достаточно. Но как только вы переходите от простого любопытства к практическому применению — когда вам важны потребление памяти, качество поиска информации, решения по маршрутизации запросов или осведомленность о затратах — простота такого подхода начинает демонстрировать свои ограничения.
Этот кластер статей исследует другой подход: отношение к ИИ-ассистенту не как к единому вызову модели, а как к скоординированной системе.
Это различие может показаться незначительным на первый взгляд, но оно полностью меняет ваше восприятие локального ИИ.

Что такое система ИИ?
Система ИИ — это нечто большее, чем просто модель. Это слой оркестрации, который связывает вывод (инференс), поиск информации, память и исполнение в нечто, что ведет себя как связный ассистент.
Запуск модели локально — это работа с инфраструктурой. Проектирование ассистента вокруг этой модели — это работа с системами.
Если вы уже изучали наши более широкие руководства по следующим темам:
- Хостинг LLM в 2026 году: Сравнение локальной, самохостинговой и облачной инфраструктуры
- Архитектура LLM: Системный дизайн для ИИ в продакшене — маршрутизация, оптимизация затрат, защитные механизмы и оркестрация множества моделей
- Руководство по генерации с усилением извлечения (RAG): Архитектура, реализация и практическое руководство
- Второй мозг: объяснение для инженеров и работников интеллектуального труда
- Производительность LLM в 2026 году: Бенчмарки, узкие места и оптимизация
- Наблюдаемость для систем ИИ
то вы уже знаете, что инференс — это лишь один из слоев стека.
Кластер «Системы ИИ» находится поверх этих слоев. Он не заменяет их — он объединяет их.
Для получения общей картины того, как эти слои объединяются в производственных ассистентах — LLM, память, инструменты, маршрутизация и наблюдаемость, с использованием OpenClaw и Hermes в качестве референсных систем — см. Архитектура ассистентов ИИ: LLM, память, инструменты, маршрутизация, наблюдаемость.
Как только архитектура ассистента станет надежной, следующим шагом станет сделать её проактивной. Статья Агенты опроса в ассистентах ИИ: 11 паттернов реализации охватывает то, как фоновые рабочие процессы опроса, выполнение на основе очередей, надежные рабочие процессы и семантические оценщики LLM превращают реактивный ассистент в систему, которая наблюдает, принимает решения и действует самостоятельно.
Когда одного ассистента недостаточно и нескольким агентам нужно координировать свои действия, выбор паттерна координации определяет всё: задержку, отказоустойчивость, стоимость и возможность отладки. Паттерны оркестрации мультиагентных систем: Практическое руководство охватывает шесть канонических паттернов — оркестратор-работник, последовательный конвейер, веерный выход, иерархический, рой и сетка — с конкретными режимами отказа и фреймворком для выбора правильной архитектуры.
OpenClaw: Самохостинговая система ИИ-ассистента
OpenClaw — это система ИИ-ассистента с открытым исходным кодом, предназначенная для работы на собственных серверах и функционирующая через платформы обмена сообщениями, используя локальную инфраструктуру.
На практическом уровне она:
- Использует локальные среды выполнения LLM, такие как Ollama или vLLM
- Интегрирует поиск по проиндексированным документам
- Поддерживает память за пределами одной сессии
- Выполняет инструменты и задачи автоматизации
- Может быть настроена для инструментации и наблюдения
- Работает в рамках ограничений аппаратного обеспечения
Это не просто оболочка вокруг модели. Это слой оркестрации, связывающий инференс, поиск, память и исполнение в нечто, что ведет себя как связный ассистент.
Начало работы и архитектура:
- Быстрый старт OpenClaw — установка на базе Docker с использованием либо локальной модели Ollama, либо облачной конфигурации Claude
- Обзор системы OpenClaw — архитектурное исследование того, чем OpenClaw отличается от более простых локальных настроек
- Руководство по NemoClaw для безопасной работы OpenClaw — путь к безопасности OpenClaw с использованием песочницы OpenShell, уровней политик, маршрутизируемого инференса и операций второго дня
Контекст и анализ:
- Хронология взлета и падения OpenClaw — экономика за вирусным всплеском, отключение подписки в апреле 2026 года и то, что крах раскрывает о циклах хайпа в ИИ
- OpenClaw против Hermes Agent — звезды, загрузки и данные об использовании — живой лидерборд из 20 фреймворков с рейтингами токенов OpenRouter, количеством загрузок пакетов, метриками здоровья сообщества и анализом поисковых трендов
Расширение и конфигурирование OpenClaw:
Плагины расширяют среду выполнения OpenClaw — добавляя бэкенды памяти, провайдеры моделей, каналы связи, веб-инструменты и наблюдаемость. Навыки (Skills) расширяют поведение агента — определяя, как и когда агент использует эти возможности. Производственная конфигурация означает объединение обоих подходов, адаптированное под реальных пользователей системы.
- Плагины OpenClaw — Руководство по экосистеме и практический выбор — типы нативных плагинов, цикл жизни CLI, защитные механизмы и конкретные выборы для памяти, каналов, инструментов и наблюдаемости
- Экосистема навыков OpenClaw и практический выбор для продакшена — открытие через ClawHub, потоки установки и удаления, стеки по ролям и навыки, которые стоит сохранять в 2026 году
- Паттерны производственной настройки OpenClaw с плагином и навыками — полные конфигурации плагинов и навыков по типу пользователей: разработчик, автоматизация, исследования, поддержка и рост — каждый с объединенными скриптами установки
Hermes: Персистентный агент с навыками и песочницей для инструментов
Hermes Agent — это самохостинговый, независимый от модели ассистент, ориентированный на постоянную работу: он может работать как долгоживущий процесс, выполнять инструменты через настраиваемые бэкенды и улучшать рабочие процессы со временем благодаря памяти и повторно используемым навыкам.
На практическом уровне Hermes полезен, когда вам нужно:
- Ассистент, ориентированный на терминал, который также может интегрироваться с приложениями для обмена сообщениями
- Гибкость провайдеров через конечные точки, совместимые с OpenAI, и переключение моделей
- Границы выполнения инструментов через локальные и изолированные (песочные) бэкенды
- Операции второго дня с диагностикой, журналами и гигиеной конфигурации
Профили Hermes — это полностью изолированные среды — каждый со своей конфигурацией, секретами, памятью, сессиями, навыками и состоянием, что делает профили реальной единицей производственного владения, а не индивидуальный навык.
- ИИ-ассистент Hermes - Установка, настройка, рабочий процесс и устранение неполадок — установка, настройка провайдера, паттерны рабочего процесса и устранение неполадок
- Шпаргалка по CLI агента Hermes — команды, флаги и слэш-сокращения — табличный индекс подкоманд
hermes, глобальных флагов, инструментов шлюза и профиля, а также распространенных слэш-сокращений - Голосовое управление Hermes с вашего телефона — мобильный первый голосовой рабочий процесс для Telegram и Discord, с настройкой провайдеров STT и TTS, а также устранением неполадок
- Система памяти агента Hermes: Как на самом деле работает персистентная память ИИ — глубокое техническое руководство по ядровой памяти из двух файлов, паттерну замороженного снимка, всем 8 внешним провайдерам и философии ограниченной памяти
- Навыки ИИ-ассистента Hermes для реальных производственных настроек — архитектура навыков, ориентированная на профили, для инженеров, исследователей, операторов и исполнительных рабочих процессов
- Создание навыков для агента Hermes — Структура SKILL.md и лучшие практики — практическая структура
SKILL.md, метаданные, условная активация и устранение неполадок, когда навыки исчезают из индекса - Kanban в агенте Hermes для рабочих процессов самохостинговых LLM — практические паттерны управления для конкурентности диспетчера, цепочек зависимостей и пакетной обработки на основе cron на самохостинговых шлюзах
Персистентные знания и память
Некоторые проблемы не решаются только увеличением окна контекста — им нужны персистентные знания (графы, конвейеры ingestion) и плагины памяти агентов (Honcho, Mem0, Hindsight и подобные бэкенды), подключенные к ассистентам, таким как Hermes или OpenClaw.
- Центр памяти систем ИИ — охват подкластера памяти, а также ссылки на руководства по Cognee и контексту стека
- Системы памяти в ассистентах ИИ, которые действительно помогают — дизайн памяти кросс-фреймворков для рабочего состояния, структурированных фактов и слоев извлечения
- Сравнение провайдеров памяти агентов — полное сравнение Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover и Supermemory для интеграций в стиле Hermes
MCP: Серверы протокола контекста модели
Протокол контекста модели (Model Context Protocol, MCP) — это открытый стандарт, представленный Anthropic для подключения языковых моделей ИИ к внешним источникам данных, инструментам и системам. Он решает проблему интеграции N×M, предоставляя универсальный интерфейс — представьте себе порт USB-C для приложений ИИ. Создание серверов MCP позволяет расширять возможности ассистентов ИИ пользовательскими интеграциями для файлов, баз данных, API и вызываемых инструментов, используя простой протокол на основе JSON-RPC через stdio или HTTP.
- Сервер MCP на Go — архитектура протокола, структура сообщений JSON-RPC, согласование возможностей, официальный SDK для Go и пошаговое руководство по созданию серверов MCP на Go
- Создание серверов MCP на Python — практическое руководство по реализации на Python, охватывающее серверы MCP для веб-поиска и скрапинга, транспорты stdio и SSE, а также интеграцию с Claude Desktop
A2A: Протокол взаимодействия агентов
Протокол Agent2Agent (A2A) — это открытый стандарт для связи между независимо развернутыми системами ИИ-агентов. Если MCP подключает агента к инструментам, то A2A подключает агентов к другим агентам — позволяя им обнаруживать друг друга через Agent Cards, обмениваться задачами и сообщениями, транслировать прогресс и возвращать типизированные артефакты. A2A предназначен для систем, где агентами владеют разные команды, они построены на разных фреймворках или развернуты как отдельные сервисы, которым требуется взаимодействие.
- Что такое протокол A2A? Объяснение Agent Cards и задач — глубокое погружение в концепции A2A: Agent Cards, жизненный цикл задач, сообщения, части, артефакты, потоковая передача, безопасность и паттерн оркестратор-плюс-специалисты
- Потоковая передача и асинхронные задачи A2A для длительных рабочих процессов агентов — операционное руководство по потоковой передаче SSE, push-вебхукам, потокам input_required с участием человека (HITL), обработке отказов и наблюдаемости для задач, которые переживают один HTTP-запрос
- A2A против MCP: Действительно ли агентам ИИ нужны оба протокола? — практическое сравнение двух протоколов: когда достаточно только MCP, когда A2A добавляет реальную ценность и как паттерн «A2A снаружи, MCP внутри» работает в масштабе
- Протокол A2A от Google в 2026 году: Принятие, хайп и реальность — взвешенный взгляд на то, где A2A действительно имеет производственную тракцию в 2026 году, что неправильно в хайпе и практический фреймворк для принятия решений, когда его использовать
Что делает системы ИИ особенными
Несколько характеристик делают системы ИИ достойными более пристального внимания.
Маршрутизация моделей как дизайнерский выбор
Большинство локальных настроек по умолчанию используют одну модель. Системы ИИ поддерживают осознанный выбор моделей.
Это влечет за собой вопросы:
- Должны ли небольшие запросы использовать меньшие модели?
- Когда рассуждения оправдывают использование большего окна контекста?
- Какова разница в стоимости на 1000 токенов?
Эти вопросы напрямую связаны с компромиссами производительности, обсуждаемыми в руководстве по производительности LLM, и решениями по инфраструктуре, изложенными в руководстве по хостингу LLM.
Системы ИИ выносят эти решения на поверхность, вместо того чтобы скрывать их.
Поиск рассматривается как эволюционирующий компонент
Системы ИИ интегрируют поиск документов, но не как упрощенный шаг «встроить и поискать».
Они признают:
- Размер чанков влияет на качество поиска и стоимость
- Гибридный поиск (BM25 + векторный) может превзойти чистый плотный поиск
- Переоценка (reranking) улучшает релевантность ценой задержки
- Стратегия индексирования влияет на потребление памяти
Эти темы согласуются с более глубокими архитектурными соображениями, обсуждаемыми в руководстве по RAG.
Разница в том, что системы ИИ встраивают поиск в живой ассистент, а не представляют его как изолированную демонстрацию.
Память как инфраструктура
Бессостоятельные LLM забывают всё между сессиями.
Системы ИИ вводят персистентные слои памяти. Это сразу же порождает дизайнерские вопросы:
- Что должно храниться в долгосрочной перспективе?
- Когда контекст должен быть обобщен?
- Как предотвратить взрыв токенов?
- Как эффективно индексировать память?
Эти вопросы напрямую пересекаются с соображениями уровня данных из руководства по инфраструктуре данных. Для агента Hermes, в частности — ограниченная память из двух файлов, кэширование префиксов, внешние плагины — начните с Системы памяти агента Hermes и кросс-фреймворкового сравнения Сравнение провайдеров памяти агентов. В Центре памяти систем ИИ перечислены связанные руководства по Cognee и слоям знаний.
Память перестает быть функцией и становится проблемой хранения.
Наблюдаемость не является опциональной
Большинство локальных экспериментов с ИИ止步вают на том, что «он отвечает».
Системы ИИ позволяют наблюдать за:
- Использованием токенов
- Задержкой
- Использованием аппаратных ресурсов
- Паттернами пропускной способности
Это естественно связано с принципами мониторинга, описанными в руководстве по наблюдаемости.
Если ИИ работает на оборудовании, он должен быть измеримым, как любая другая нагрузка.
Как это ощущается при использовании
Со стороны система ИИ может по-прежнему выглядеть как интерфейс чата.
Под поверхностью происходит больше процессов.
Если вы попросите его обобщить технический отчет, хранящийся локально:
- Он извлекает соответствующие сегменты документа.
- Он выбирает подходящую модель.
- Он генерирует ответ.
- Он фиксирует использование токенов и задержку.
- Он обновляет персистентную память, если необходимо.
Видимое взаимодействие остается простым. Поведение системы многоуровневое.
Именно это многоуровневое поведение отличает систему от демонстрации.
Где системы ИИ занимают место в стеке
Кластер «Системы ИИ» находится на пересечении нескольких слоев инфраструктуры:
- Хостинг LLM: Слой среды выполнения, где выполняются модели (Ollama, vLLM, llama.cpp)
- RAG: Слой поиска, который предоставляет контекст и обоснование
- Производительность: Слой измерения, отслеживающий задержку и пропускную способность
- Наблюдаемость: Слой мониторинга, предоставляющий метрики и отслеживание затрат
- Инфраструктура данных: Слой хранения, обрабатывающий память и индексацию
Понимание этого различия полезно. Самостоятельный запуск делает это различие еще более очевидным.
Для минимальной локальной установки с OpenClaw см. руководство по быстрому старту OpenClaw, которое проходит через настройку на базе Docker с использованием либо локальной модели Ollama, либо облачной конфигурации Claude.
Если ваша настройка зависит от Claude, это изменение политики для инструментов агентов поясняет, почему теперь требуется биллинг через API для сторонних рабочих процессов OpenClaw.
Связанные ресурсы
A2A: Протокол взаимодействия агентов:
- Что такое протокол A2A? Объяснение Agent Cards и задач
- A2A против MCP: Действительно ли агентам ИИ нужны оба протокола?
- Протокол A2A от Google в 2026 году: Принятие, хайп и реальность
Серверы MCP:
Руководства по ассистентам ИИ:
- Архитектура ассистентов ИИ: LLM, память, инструменты, маршрутизация, наблюдаемость
- Паттерны оркестрации мультиагентных систем: Практическое руководство
- Агенты опроса в ассистентах ИИ: 11 паттернов реализации
- Обзор системы OpenClaw
- Хронология взлета и падения OpenClaw
- Быстрый старт OpenClaw
- Плагины OpenClaw — Руководство по экосистеме и практический выбор
- Экосистема навыков OpenClaw и практический выбор для продакшена
- Паттерны производственной настройки OpenClaw с плагином и навыками
- ИИ-ассистент Hermes - Установка, настройка, рабочий процесс и устранение неполадок
- Система памяти агента Hermes: Как на самом деле работает персистентная память ИИ
- Центр памяти систем ИИ
- Сравнение провайдеров памяти агентов
- Навыки ИИ-ассистента Hermes для реальных производственных настроек
- Создание навыков для агента Hermes — Структура SKILL.md и лучшие практики
Слои инфраструктуры:
- Хостинг LLM в 2026 году: Сравнение локальной, самохостинговой и облачной инфраструктуры
- Руководство по генерации с усилением извлечения (RAG): Архитектура, реализация и практическое руководство
- Производительность LLM в 2026 году: Бенчмарки, узкие места и оптимизация
- Параметры агентного инференса LLM для Qwen и Gemma
- Наблюдаемость для систем ИИ
- Инфраструктура данных для систем ИИ