Ollama

16 GB GPU上のKVキャッシュ:長文脈を実際に収容する

16 GB GPU上のKVキャッシュ:長文脈を実際に収容する

16GBでは128Kコンテキストが死ににくい理由

モデルが128Kのコンテキストウィンドウを宣伝していても、16 GBのGPUでは40Kトークンで失敗する可能性があります。アーキテクチャ上の上限は、重み、KVキャッシュ、計算バッファ、そしてデスクトップコンポジターが同時にあなたのGPUに収まることを約束したことはありませんでした。

データグラビティ:APIファーストAIの真のコスト

データグラビティ:APIファーストAIの真のコスト

「なぜあなたのAIスタックは月々強固になっていくのか」

すべての API 呼び出しは、単なる取引のように感じられます。しかし、それらが十分に蓄積されると、ファインチューニングデータ、評価ハネス、ツールスキーマがすべて特定のベンダー围绕して形作られ、切り替えが単なるルーティングの変更では済みなくなるのです。

Vane(Perplexica 2.0)Ollama と llama.cpp を使用したクイックスタート

Vane(Perplexica 2.0)Ollama と llama.cpp を使用したクイックスタート

ローカル LLM を活用したセルフホスティング AI 検索

Vane は、「出典付き AI 検索」領域において、より実用的な選択肢の一つです。これは、リアルタイムのウェブ取得とローカルまたはクラウド上の LLM(大規模言語モデル)を組み合わせた、セルフホスティング可能な回答エンジンであり、スタック全体をユーザーの管理下に置くことができます。

GPU および永続的なモデルストレージを使用する Docker Compose での Ollama

GPU および永続的なモデルストレージを使用する Docker Compose での Ollama

GPU および永続性を備えた Compose ファーストの Ollama サーバー。

Ollama は、メタル(物理マシン)上で非常に良好に動作します。それをサービスとして扱うと、さらに興味深くなります。安定したエンドポイント、固定されたバージョン、永続的なストレージ、そして GPU が利用可能か不可かの明確な状態が確保されます。

RAG と検索向けのテキスト埋め込み - Python、Ollama、OpenAI 互換 API

RAG と検索向けのテキスト埋め込み - Python、Ollama、OpenAI 互換 API

RAG エンベッディング - Python、Ollama、OpenAI API。

検索拡張生成 (RAG) を実装されている方に向けて、このセクションではテキスト埋め込み(text embeddings)について平易な言葉で解説します。埋め込みとは何か、検索や検索(リトリバル)にどのように組み込まれるか、そしてOllamallama.cppベースのサーバーが提供するOpenAI 互換の HTTP API を使用して、Pythonから 2 つの一般的なローカル環境を呼び出す方法を説明します。

LLMのセルフホスティングとAI主権

LLMのセルフホスティングとAI主権

セルフホスト型LLMでデータとモデルを制御

LLM(大規模言語モデル)のセルフホスティングは、データ、モデル、推論をあなたの管理下に保つものであり、チーム、企業、国家にとって AI主権 を実現するための実用的な手段です。

16GB VRAM搭載GPU上でOllamaのLLM性能を比較

16GB VRAM搭載GPU上でOllamaのLLM性能を比較

RTX 4080(VRAM 16GB)でのLLMスピードテスト

ローカルで大型言語モデル(LLM)を動作させることで、プライバシー、オフライン対応、そしてAPIコストのゼロ化が実現できます。 このベンチマークでは、RTX 4080上でOllamaを利用した14の人気 LLMs on Ollama on an RTX 4080 の性能を正確に示しています。