<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>Llamacpp on Rost Glukhov | KI-Systeme und Infrastruktur</title>
		<link>https://www.glukhov.org/de/tags/llamacpp/</link>
		<description>Recent content in Llamacpp on Rost Glukhov | KI-Systeme und Infrastruktur</description>
		<generator>Hugo</generator>
		<language>de</language>
		
		
		
		
			<lastBuildDate>Fri, 11 Sep 2026 18:08:21 +1000</lastBuildDate>
		
			<atom:link href="https://www.glukhov.org/de/tags/llamacpp/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>llama.cpp vs. Ollama 2026: Welche Runtime sollten Sie verwenden?</title>
				<link>https://www.glukhov.org/de/llm-hosting/comparisons/llama-cpp-vs-ollama/</link>
				<pubDate>Fri, 11 Sep 2026 00:00:00 +0000</pubDate>
				<guid>https://www.glukhov.org/de/llm-hosting/comparisons/llama-cpp-vs-ollama/</guid>
				<description>&lt;p&gt;Ollama und llama.cpp werden oft so verglichen, als wären sie konkurrierende Inferenz-Engines. Die eigentliche Wahl besteht zwischen einem verwalteten Modell-Service und einem Toolkit, das Sie direkt betreiben.&lt;/p&gt;</description>
			</item>
			<item>
				<title>ROCm vs. Vulkan für das lokale Betreiben von LLMs auf AMD-Hardware: 2026er Leitfaden</title>
				<link>https://www.glukhov.org/de/llm-hosting/comparisons/amd-rocm-vs-vulkan-llm-hosting/</link>
				<pubDate>Wed, 09 Sep 2026 00:00:00 +0000</pubDate>
				<guid>https://www.glukhov.org/de/llm-hosting/comparisons/amd-rocm-vs-vulkan-llm-hosting/</guid>
				<description>&lt;p&gt;Sowohl ROCm als auch Vulkan beschleunigen AMD-GPUs für den lokalen Betrieb von LLMs, aber sie sind nicht austauschbar. Die richtige Wahl hängt von der Engine, der GPU und der Arbeitslast ab.&lt;/p&gt;</description>
			</item>
			<item>
				<title>KV-Cache auf 16-GB-GPUs: Lange Kontexte wirklich unterbringen</title>
				<link>https://www.glukhov.org/de/llm-performance/optimization/kv-cache-16gb-long-context/</link>
				<pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate>
				<guid>https://www.glukhov.org/de/llm-performance/optimization/kv-cache-16gb-long-context/</guid>
				<description>&lt;p&gt;Ein Modell kann einen 128K-Kontextfenster bewerben und trotzdem bei 40K Tokens auf einer 16-GB-GPU scheitern. Die architektonische Obergrenze hat nie versprochen, dass Modellgewichte, KV-Cache, Rechenspeicher und der Desktop-Compositor gleichzeitig auf Ihrer Grafikkarte Platz finden würden.&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
