Кэш KV на GPU 16 ГБ: как реально уместить длинный контекст

Кэш KV на GPU 16 ГБ: как реально уместить длинный контекст

Почему 128K контекста не работают на 16 ГБ

Модель может заявлять о поддержке контекстного окна 128K и всё равно сбоить на 40K токенов на GPU с 16 ГБ видеопамяти. Пределы архитектуры никогда не гарантировали, что веса, KV-кэш, вычислительные буферы и композитор рабочего стола будут одновременно помещаться на вашей видеокарте.

Что после LLM? Mamba, диффузия и модели мира

Что после LLM? Mamba, диффузия и модели мира

Что последует после LLM? Эпоха посттрансформеров.

Хайп вокруг ИИ следует определённому ритму: примерно раз в три года архитектура, на которую все делают ставку, уступает место чему-то более новому. Следующий сдвиг уже формируется в исследовательских лабораториях.

Навыки агентов против серверов MCP: рамки для принятия решений

Навыки агентов против серверов MCP: рамки для принятия решений

Навык, MCP-сервер или оба?

Навыки агентов и MCP-серверы часто представляют как конкурирующие способы расширения ИИ-агента. Это неверный подход: навык учит агента работать, а MCP-сервер предоставляет ему контролируемый доступ к живым возможностям.

OpenCode CLI на практике: рабочие процессы, автоматизация и подводные камни

OpenCode CLI на практике: рабочие процессы, автоматизация и подводные камни

«OpenCode из командной строки: на практике»

Командная строка OpenCode разработана для скриптов, CI-конвейеров и автономного запуска агентов. Эта статья представляет собой практическое руководство по её использованию в повседневной работе.

Быстрый старт с Superpowers: установка, рабочий процесс и тестирование

Быстрый старт с Superpowers: установка, рабочий процесс и тестирование

Навыки SDD, применяемые принудительно, устанавливаются одной командой.

Superpowers представляет собой пакет, который упаковывает полную методологию, управляемую спецификациями, в устанавливаемые навыки Claude, принуждая к мозговым штурмам, планированию, реализации с помощью субагентов и строгому TDD, вместо того чтобы оставлять эту структуру на ваше усмотрение.

Обзор агента Pi Coding: минималистичный CLI для AI-кодинга с возможностью кастомизации

Обзор агента Pi Coding: минималистичный CLI для AI-кодинга с возможностью кастомизации

«Небольшой агент для программирования, который требует, чтобы вы его настраивали».

Pi Coding Agent — это минималистичный, открытый терминальный каркас для программирования, который поставляется с четырьмя инструментами по умолчанию и оставляет большую часть поведения на усмотрение расширений, навыков и вашего собственного рабочего процесса.

GFM, CommonMark и Pandoc Markdown: сравнение синтаксиса

GFM, CommonMark и Pandoc Markdown: сравнение синтаксиса

Узнайте, какие функции Markdown поддерживаются надёжно

Markdown выглядит как один язык, пока один и тот же файл не начинает отображаться по-разному в GitHub, Hugo, Obsidian или Pandoc. И проблема заключается не в том, что Markdown ненадежен.

Гравитация данных: реальная цена API-first подходов в ИИ

Гравитация данных: реальная цена API-first подходов в ИИ

Почему ваш стек ИИ становится всё более «липким» каждый месяц.

Каждый вызов API кажется простой транзакцией — пока их количество не накопится настолько, что ваши данные для тонкой настройки, системы оценки и схемы инструментов не окажутся привязаны к одному вендору, и переключение перестанет быть просто изменением маршрутизации.

Subагенты Claude Code: настройка, конфигурация и сценарии использования

Subагенты Claude Code: настройка, конфигурация и сценарии использования

Делегируйте шумные задачи, сохраняйте контекст чистым.

Большинство сессий Claude Code становятся медленными и загроможденными по одной и той же причине: каждый исследовательский grep, каждый дамп логов и каждое «подождите, я проверю еще один файл» навсегда остаются в основном разговоре.

Ollama против vLLM: когда стоит мигрировать локальный сервер LLM

Ollama против vLLM: когда стоит мигрировать локальный сервер LLM

Когда переходить с Ollama на vLLM

Ollama — один из простейших способов запускать локальную языковую модель, однако удобство может скрыть тот момент, когда локальный эксперимент превращается в разделяемый сервис вывода, требующий более продвинутого планирования и наблюдаемости.

Синхронизация спецификаций, тестов и кода в разработке ИИ

Синхронизация спецификаций, тестов и кода в разработке ИИ

Не позволяйте AI-агентам отклоняться от спецификаций, тестов и кода.

Агенты ИИ для написания кода быстро выпускают функции, но спецификации, тесты и код незаметно расходятся. Этот гид описывает модель прослеживаемости, маппинг спецификаций на тесты и код, а также проверки CI, которые выявляют расхождения перед слиянием.

Очереди мертвых писем: обработка «отравленных» сообщений в распределенных системах

Очереди мертвых писем: обработка «отравленных» сообщений в распределенных системах

Предотвращение блокировки очередей из-за отравляющих сообщений

Очередь мёртвых писем (Dead-Letter Queue, DLQ) — это страховочная сеть, которая перехватывает сообщения, не поддающиеся обработке потребителями, чтобы одно неисправное сообщение не блокировало очередь и не приводило к тихой потере всех последующих сообщений.

Обслуживание LLM Wiki: дрейф, противоречия и рецензирование

Обслуживание LLM Wiki: дрейф, противоречия и рецензирование

Обеспечьте достоверность скомпилированных знаний

Неудача в использовании LLM Wiki наступает тогда, когда старые факты остаются правдоподобными, противоречия становятся гладкими, а сгенерированные резюме отдаляются от своих источников.

Syncthing для синхронизации файлов в системах самостоятельного хостинга знаний

Syncthing для синхронизации файлов в системах самостоятельного хостинга знаний

Частная синхронизация для локальных знаний.

Syncthing синхронизирует файлы между устройствами, которыми вы управляете, что делает его одним из самых практичных инструментов для создания собственной инфраструктуры знаний, позволяющей избежать привязки к облачным сервисам.

Паттерн Circuit Breaker в Go: предотвращение каскадных сбоев

Паттерн Circuit Breaker в Go: предотвращение каскадных сбоев

Предотвращайте каскадные сбои в микросервисах на Go.

Тайлбрейкер (circuit breaker) предотвращает «бомбардировку» ваших Go-сервисов отказывающей зависимостью, защищая от каскадных сбоев, которые истощают горутины, сокет-соединения и память, пока вся система не рухнет.

Podman Quadlet и Docker Compose для Linux-сервисов

Podman Quadlet и Docker Compose для Linux-сервисов

Выберите правильный контейнерный рабочий процесс.

Docker Compose и Podman Quadlet решают пересекающиеся задачи, но исходят из разных принципов проектирования, и выбор между ними зависит от того, думаете ли вы в терминах стеков приложений или системных сервисов Linux.

Подписаться

Получайте новые материалы про системы, инфраструктуру и AI engineering.