Docker

Ollama zu vLLM: Wann Sie Ihren lokalen LLM-Server migrieren sollten

Ollama zu vLLM: Wann Sie Ihren lokalen LLM-Server migrieren sollten

Wann von Ollama auf vLLM wechseln

Ollama ist einer der einfachsten Wege, ein lokales Sprachmodell auszuführen, aber die Bequemlichkeit kann den Moment verbergen, in dem ein lokales Experiment zu einem gemeinsamen Inferenzdienst wird, der eine bessere Planung und Beobachtbarkeit benötigt.

Podman Quadlet vs. Docker Compose für Linux-Dienste

Podman Quadlet vs. Docker Compose für Linux-Dienste

Wählen Sie den richtigen Container-Workflow.

Docker Compose und Podman Quadlet lösen überlappende Probleme, stammen jedoch aus unterschiedlichen Designzentren. Die Wahl zwischen ihnen hängt davon ab, ob Sie in Anwendungsstacks oder in Linux-Dienste denken.

Docker Compose als Linux-Dienst mit systemd ausführen

Docker Compose als Linux-Dienst mit systemd ausführen

Docker Compose beim Systemstart, verwaltet durch systemd.

Ein Docker Compose-Projekt auf einem Linux-Server sollte beim Booten starten, beim Herunterfahren sauber gestoppt werden und Neustarts ohne manuelle Eingriffe überstehen.

Vane (Perplexica 2.0) Schnellstart mit Ollama und llama.cpp

Vane (Perplexica 2.0) Schnellstart mit Ollama und llama.cpp

Selbst gehostete KI-Suche mit lokalen LLMs

Vane ist einer der pragmatischeren Einträge im Bereich „KI-Suche mit Quellenangaben": eine selbst gehostete Antwortmaschine, die live abrufbare Websuche mit lokalen oder Cloud-LLMs kombiniert, während der gesamte Stack unter Ihrer Kontrolle bleibt.

Hermes-KI-Assistent – Installation, Einrichtung, Arbeitsablauf und Fehlerbehebung

Hermes-KI-Assistent – Installation, Einrichtung, Arbeitsablauf und Fehlerbehebung

Hermes Agent: Installation und Quickstart für Entwickler

Hermes Agent ist ein selbst gehosteter, modellunabhängiger KI-Assistent, der auf einem lokalen Rechner oder einem kostengünstigen VPS läuft, über Terminal- und Messaging-Schnittstellen arbeitet und sich im Laufe der Zeit verbessert, indem er wiederkehrende Aufgaben in wiederverwendbare Fähigkeiten umwandelt.

Ollama in Docker Compose mit GPU und persistenter Modell-Speicherung

Ollama in Docker Compose mit GPU und persistenter Modell-Speicherung

Compose-first Ollama-Server mit GPU und Persistenz.

Ollama funktioniert hervorragend auf Bare Metal. Es wird noch interessanter, wenn man es wie einen Service behandelt: ein stabiler Endpunkt, fixierte Versionen, persistente Speicherung und eine GPU, die entweder verfügbar ist oder eben nicht.

llama.swap Modellwechsler: Schnellstart für OpenAI-kompatible lokale LLMs

llama.swap Modellwechsler: Schnellstart für OpenAI-kompatible lokale LLMs

Lokale LLMs ohne Änderung der Clients austauschen.

Bald jonglieren Sie mit vLLM, llama.cpp und mehr – jeder Stack auf einem eigenen Port. Alles nachgeschaltete System erwartet dennoch eine einzige /v1-Basis-URL; andernfalls sortieren Sie ständig Ports, Profile und Einmal-Skripte neu. llama-swap ist der /v1-Proxy vor diesen Stacks.

Developer Tools: Der vollständige Leitfaden für moderne Entwicklungs-Workflows

Developer Tools: Der vollständige Leitfaden für moderne Entwicklungs-Workflows

Die Softwareentwicklung umfasst Git für die Versionskontrolle, Docker für die Containerisierung, Bash für die Automatisierung, PostgreSQL für Datenbanken und VS Code für die Editorarbeit – zusammen mit unzähligen anderen Tools, die Ihre Produktivität entweder fördern oder behindern können. Diese Seite fasst die wichtigsten Cheat Sheets, Workflows und Vergleiche zusammen, die Sie benötigen, um effizient über den gesamten Entwicklungsstack hinweg zu arbeiten.

LocalAI QuickStart: OpenAI-kompatible LLMs lokal ausführen

LocalAI QuickStart: OpenAI-kompatible LLMs lokal ausführen

Bereitstellen von OpenAI-kompatiblen APIs mit LocalAI in wenigen Minuten auf dem eigenen Server.

LocalAI ist ein selbstgehosteter, lokal-first Inferenzserver, der sich wie eine Drop-in OpenAI API verhält, um KI-Arbeitslasten auf Ihrer eigenen Hardware (Laptop, Workstation oder lokaler Server) auszuführen.