Self-Hosting

Кэш KV на GPU 16 ГБ: как реально уместить длинный контекст

Кэш KV на GPU 16 ГБ: как реально уместить длинный контекст

Почему 128K контекста не работают на 16 ГБ

Модель может заявлять о поддержке контекстного окна 128K и всё равно сбоить на 40K токенов на GPU с 16 ГБ видеопамяти. Пределы архитектуры никогда не гарантировали, что веса, KV-кэш, вычислительные буферы и композитор рабочего стола будут одновременно помещаться на вашей видеокарте.

Гравитация данных: реальная цена API-first подходов в ИИ

Гравитация данных: реальная цена API-first подходов в ИИ

Почему ваш стек ИИ становится всё более «липким» каждый месяц.

Каждый вызов API кажется простой транзакцией — пока их количество не накопится настолько, что ваши данные для тонкой настройки, системы оценки и схемы инструментов не окажутся привязаны к одному вендору, и переключение перестанет быть просто изменением маршрутизации.

Ollama против vLLM: когда стоит мигрировать локальный сервер LLM

Ollama против vLLM: когда стоит мигрировать локальный сервер LLM

Когда переходить с Ollama на vLLM

Ollama — один из простейших способов запускать локальную языковую модель, однако удобство может скрыть тот момент, когда локальный эксперимент превращается в разделяемый сервис вывода, требующий более продвинутого планирования и наблюдаемости.

Podman Quadlet и Docker Compose для Linux-сервисов

Podman Quadlet и Docker Compose для Linux-сервисов

Выберите правильный контейнерный рабочий процесс.

Docker Compose и Podman Quadlet решают пересекающиеся задачи, но исходят из разных принципов проектирования, и выбор между ними зависит от того, думаете ли вы в терминах стеков приложений или системных сервисов Linux.

Запуск Docker Compose как службы Linux с помощью systemd

Запуск Docker Compose как службы Linux с помощью systemd

Запуск Docker Compose при загрузке, управляемый через systemd.

Docker Compose на Linux-сервере должен запускаться при загрузке, корректно останавливаться при выключении и переживать перезагрузки без ручного вмешательства.

Установка Docker на Ubuntu: APT, Snap, Rootless — полное руководство 2026

Установка Docker на Ubuntu: APT, Snap, Rootless — полное руководство 2026

Выберите правильный путь установки Docker в Ubuntu.

Установка Docker на Ubuntu должна быть простой, но на практике несколько вариантов установки Docker конкурируют за одно и то же имя команды, каждый из которых имеет различную упаковку, поведение при обновлении и последствия для безопасности.

Устранение неполадок APT в Ubuntu: исправление сломанных пакетов, блокировок и ошибок GPG

Устранение неполадок APT в Ubuntu: исправление сломанных пакетов, блокировок и ошибок GPG

Исправьте APT в Ubuntu без гаданий.

Неудачи с APT — обычное явление на машинах с Ubuntu, которые используются длительное время. Они обычно возникают после обновления версии, изменения стороннего репозитория, удаления PPA, ручной установки пакета .deb или прерванного процесса установки пакетов.

Выгрузка всех моделей маршрутизатора llama.cpp без перезапуска

Выгрузка всех моделей маршрутизатора llama.cpp без перезапуска

Свободная VRAM без остановки llama-server

Режим маршрутизации llama.cpp — одно из самых полезных изменений в llama-server за последние годы. Наконец-то локальным операторам LLM предоставляется опыт управления моделями, близкий к тому, к которому пользователи привыкли в Ollama, при этом сохраняются высокая производительность и низкоуровневый контроль, которые делают llama.cpp стоящими того, чтобы использовать их в первую очередь.

Справочник по параметрам агентного вывода LLM для Qwen и Gemma

Справочник по параметрам агентного вывода LLM для Qwen и Gemma

Справочное руководство по настройке агентов LLM

Эта страница представляет собой практическое руководство по настройке агентов на базе LLM (температура, top_p, top_k, штрафы и их взаимодействие в многоступенчатых рабочих процессах с интенсивным использованием инструментов).

Голосовое управление Hermes с вашего телефона

Голосовое управление Hermes с вашего телефона

Общайтесь с Hermes со своего телефона

Вы уже общаетесь с агентом Hermes через телефон, используя текстовые сообщения. Теперь вы хотите говорить с ним напрямую и получать ответы голосом. Как правило, это правильное решение, особенно если вы уже используете Hermes как постоянно работающего автономного ассистента. Ввод длинных подсказок на маленьком экране медленный и подвержен ошибкам.

Практическое руководство NemoClaw по безопасным операциям с OpenClaw в 2026 году

Практическое руководство NemoClaw по безопасным операциям с OpenClaw в 2026 году

Запускайте OpenClaw безопасно с помощью NemoClaw

Большинство стеков ИИ-агентов по-прежнему рассматривают безопасность как проблему, которую нужно решать после демонстрации. NemoClaw исходит из противоположного предположения и делает изоляцию, политики и маршрутизацию настройками по умолчанию с первого дня.

Управление знаниями в 2026 году: инструменты PKM, самохостинговые вики и цифровые системы

Управление знаниями в 2026 году: инструменты PKM, самохостинговые вики и цифровые системы

Сравнение инструментов, методов и самохостинговых вики для персонального управления знаниями

Управление персональными знаниями охватывает Obsidian, Logseq, DokuWiki, Zettelkasten и PARA — правильный выбор зависит от того, хотите ли вы локальный граф заметок, собственный вики-движок или рабочий процесс, основанный на аутлайнерах.

Быстрый старт с Vane (Perplexica 2.0), Ollama и llama.cpp

Быстрый старт с Vane (Perplexica 2.0), Ollama и llama.cpp

Самохостинг AI-поиска с локальными LLM

Vane — это один из наиболее прагматичных проектов в пространстве «поиска с использованием ИИ и цитированием»: самохостинговое средство ответов, которое сочетает в себе живой поиск в вебе с локальными или облачными LLM, сохраняя при этом полный контроль над всем стеком технологий.

TGI — Text Generation Inference: установка, настройка и устранение неполадок

TGI — Text Generation Inference: установка, настройка и устранение неполадок

Установите TGI, развертывайте быстро, отлаживайте ещё быстрее.

Text Generation Inference (TGI) обладает очень специфической энергетикой. Это не самый новый проект на улице инференса, но это тот, который уже научился, как происходит работа в продакшене, —