LLM Performance

Кэш KV на GPU 16 ГБ: как реально уместить длинный контекст

Кэш KV на GPU 16 ГБ: как реально уместить длинный контекст

Почему 128K контекста не работают на 16 ГБ

Модель может заявлять о поддержке контекстного окна 128K и всё равно сбоить на 40K токенов на GPU с 16 ГБ видеопамяти. Пределы архитектуры никогда не гарантировали, что веса, KV-кэш, вычислительные буферы и композитор рабочего стола будут одновременно помещаться на вашей видеокарте.

Спекулятивное декодирование: ускорение инференса LLM на 20–50%

Спекулятивное декодирование: ускорение инференса LLM на 20–50%

Более быстрый инференс LLM без потери качества — практическое руководство

Модель 70B генерирует один токен за один прямой проход (forward pass), и каждый проход перезагружает веса из видеопамяти (VRAM), вычисляет внимание (attention) для всего контекста и синхронизирует память. Между токенами GPU простаивает, ожидая разрешения последовательных зависимостей.

Qwen 3.6 27B и 35B MTP по сравнению со стандартными моделями на GPU с 16 ГБ видеопамяти

Qwen 3.6 27B и 35B MTP по сравнению со стандартными моделями на GPU с 16 ГБ видеопамяти

MTP и стандартное декодирование на RTX 4080 — реальные бенчмарки

Я протестировал производительность спекулятивного декодирования (Multi-Token Prediction, MTP) в моделях Qwen 3.6 27B и 35B на видеокарте RTX 4080 с 16 ГБ видеопамяти (VRAM).

Валидация структурированного вывода LLM на Python, которая работает надёжно

Валидация структурированного вывода LLM на Python, которая работает надёжно

Перестаньте полагаться на интуицию. Валидируйте контракты.

Большинство руководств по «структурированному выводу» (structured output) для больших языковых моделей (LLM) не обладают должной серьезностью. Они учат вас вежливо просить модель выдавать JSON и затем надеяться, что она поступит правильно. Это не валидация. Это оптимизм, обернутый в фигурные скобки.

Справочник по параметрам агентного вывода LLM для Qwen и Gemma

Справочник по параметрам агентного вывода LLM для Qwen и Gemma

Справочное руководство по настройке агентов LLM

Эта страница представляет собой практическое руководство по настройке агентов на базе LLM (температура, top_p, top_k, штрафы и их взаимодействие в многоступенчатых рабочих процессах с интенсивным использованием инструментов).

Сравнение производительности LLM в Ollama на GPU с 16 ГБ VRAM

Сравнение производительности LLM в Ollama на GPU с 16 ГБ VRAM

Тест скорости LLM на RTX 4080 с 16 ГБ ОЗУ

Локальный запуск больших языковых моделей обеспечивает конфиденциальность, возможность работы без интернета и нулевые затраты на API. Этот бенчмарк точно показывает, чего можно ожидать от 14 популярных LLM в Ollama на RTX 4080.

BAML против Instructor: структурированные выходные данные LLM

BAML против Instructor: структурированные выходные данные LLM

Type-safe LLM outputs with BAML and Instructor

При работе с большими языковыми моделями (LLM) в производственной среде получение структурированных и типобезопасных выходных данных имеет критическое значение. Два популярных фреймворка — BAML и Instructor — предлагают разные подходы к решению этой задачи.

Сравнение производительности Ollama: NVIDIA DGX Spark против Mac Studio против RTX-4080

Сравнение производительности Ollama: NVIDIA DGX Spark против Mac Studio против RTX-4080

Бенчмарки GPT-OSS 120b на трёх платформах ИИ

Я выкопал некоторые интересные тесты производительности GPT-OSS 120b, работающего на Ollama на трех разных платформах: NVIDIA DGX Spark, Mac Studio и RTX 4080. Модель GPT-OSS 120b из библиотеки Ollama весит 65ГБ, что означает, что она не помещается в 16ГБ видеопамяти RTX 4080 (или более новой RTX 5080).

Специализированные ИС для LLM и чипы для инференса (почему они важны)

Специализированные ИС для LLM и чипы для инференса (почему они важны)

Специализированные интегральные схемы (ASIC) и кастомные кремниевые чипы повышают скорость и эффективность вывода LLM.

Будущее ИИ заключается не только в более умных моделях. Оно также связано с кремнием, который соответствует тому, как эти модели фактически обслуживаются. Специализированное оборудование для инференса LLM следует пути, напоминающему переход майнинга биткоинов с графических процессоров на созданные для этой цели АСП, хотя и с более жесткими ограничениями, поскольку модели и схемы точности продолжают эволюционировать.

Сравнение: Qwen3:30b и GPT-OSS:20b

Сравнение: Qwen3:30b и GPT-OSS:20b

Сравнение скорости, параметров и производительности этих двух моделей

Ниже приведено сравнение Qwen3:30b и GPT-OSS:20b с акцентом на следовании инструкциям и параметрах производительности, спецификациях и скорости.

Проблемы структурированного вывода в Ollama GPT-OSS

Проблемы структурированного вывода в Ollama GPT-OSS

Не очень приятно.

Модели GPT-OSS от Ollama (https://www.glukhov.org/ru/llm-performance/ollama/ollama-gpt-oss-structured-output-issues/ “Ollama GPT-OSS”) постоянно сталкиваются с проблемами при работе со структурированным выводом, особенно при использовании с фреймворками вроде LangChain, OpenAI SDK, vllm и другими.

Сравнение структурированного вывода у популярных провайдеров LLM: OpenAI, Gemini, Anthropic, Mistral и AWS Bedrock

Сравнение структурированного вывода у популярных провайдеров LLM: OpenAI, Gemini, Anthropic, Mistral и AWS Bedrock

Для работы с несколько отличающимися API требуется особый подход.

Вот сравнительная таблица поддержки структурированного вывода (получение надежного JSON) у популярных провайдеров LLM, а также минимальные примеры на Python