SelfHosting

SGLang QuickStart: Instale, Configure e Execute LLMs via API OpenAI

SGLang QuickStart: Instale, Configure e Execute LLMs via API OpenAI

Execute modelos abertos com rapidez usando o SGLang.

O SGLang é um framework de serviço de alto desempenho para grandes modelos de linguagem e modelos multimodais, construído para fornecer inferência de baixa latência e alto throughput, desde uma única GPU até clusters distribuídos.

llama.cpp: Guia Rápido com CLI e Servidor

llama.cpp: Guia Rápido com CLI e Servidor

Como instalar, configurar e usar o OpenCode

Eu continuo voltando a llama.cpp para inferência local — ela oferece um controle que o Ollama e outros abstraem, e simplesmente funciona. É fácil executar modelos GGUF interativamente com llama-cli ou expor uma API HTTP compatível com OpenAI com llama-server.

Frontends de LLM

Frontends de LLM

Não há tantas opções para escolher, mas ainda assim....

Quando comecei a experimentar com LLMs, as interfaces gráficas (UIs) para eles estavam em desenvolvimento ativo e agora algumas delas são realmente boas.