LLM Performance

16 GB GPU上のKVキャッシュ:長文脈を実際に収容する

16 GB GPU上のKVキャッシュ:長文脈を実際に収容する

16GBでは128Kコンテキストが死ににくい理由

モデルが128Kのコンテキストウィンドウを宣伝していても、16 GBのGPUでは40Kトークンで失敗する可能性があります。アーキテクチャ上の上限は、重み、KVキャッシュ、計算バッファ、そしてデスクトップコンポジターが同時にあなたのGPUに収まることを約束したことはありませんでした。

投機的デコーディング:LLM推論を20〜50%高速化

投機的デコーディング:LLM推論を20〜50%高速化

品質を落とさずにLLM推論を高速化する実践ガイド

70Bモデルは1回のフォワードパスで1トークンを生成し、各パスでVRAMから重みを読み込み、コンテキスト全体のAttentionを計算し、メモリを同期します。トークンの間では、GPUはシーケンシャルな依存関係が解決するのを待っている間にアイドル状態になります。

Pythonで堅牢なLLM構造化出力の検証

Pythonで堅牢なLLM構造化出力の検証

「雰囲気」に頼る解析をやめ、契約を検証せよ。

ほとんどのLLM「構造化出力」チュートリアルは、本気度にかけるものです。 それらは、JSONを丁寧な口調でリクエストし、モデルが適切に動作することを祈る方法を教えます。 それでは検証ではありません。 それは単に括弧で囲まれた楽観主義にすぎません。

QwenおよびGemmaにおけるエージェンティックLLM推論パラメータの参照

QwenおよびGemmaにおけるエージェンティックLLM推論パラメータの参照

エージェント型LLMのチューニングに関する参照資料

このページは、エージェント型LLM推論チューニングの実用的なリファレンス(temperature、top_p、top_k、ペナルティ、およびマルチステップやツール多用なワークフローにおけるそれらの相互作用)です。

より広範なLLMパフォーマンスエンジニアリングハブと併せて参照し、明確なLLMホスティングとサービングの概要と組み合わせることで、モデルがリソース不足に陥った際にはスループットとスケジューリングが依然として支配的ですが、不安定なサンプリングはGPUが処理を終える前にリトライと出力トークンを消費してしまうことがわかります。

このページでは以下をまとめます:

  • ベンダー推奨パラメータ
  • GGUFおよびAPIに組み込まれたデフォルト値
  • 実世界のコミュニティの知見
  • エージェント型ワークフローの最適化

現在、以下に焦点を当てています:

16GB VRAM搭載GPU上でOllamaのLLM性能を比較

16GB VRAM搭載GPU上でOllamaのLLM性能を比較

RTX 4080(VRAM 16GB)でのLLMスピードテスト

ローカルで大型言語モデル(LLM)を動作させることで、プライバシー、オフライン対応、そしてAPIコストのゼロ化が実現できます。 このベンチマークでは、RTX 4080上でOllamaを利用した14の人気 LLMs on Ollama on an RTX 4080 の性能を正確に示しています。

BAML vs Instructor:構造化されたLLM出力

BAML vs Instructor:構造化されたLLM出力

BAMLとInstructorによる型安全なLLM出力

プロダクション環境で大規模言語モデル(LLM)を扱う際、構造化され、型安全性のある出力を得ることが極めて重要です。 この問題の解決策として、2つの人気フレームワーク—BAMLとInstructor—がそれぞれ異なるアプローチを採用しています。

LLM ASICと専用推論チップ(その重要性)

LLM ASICと専用推論チップ(その重要性)

ASICやカスタムシリコンにより、LLM推論の速度と効率が向上する

AIの未来は、より賢いモデルについてだけの話ではありません。それらのモデルが実際にどう提供(サービング)されるかに合わせて動くシリコン(半導体)についてもです。LLM推論のための特殊なハードウェアは、BitcoinマイニングがGPUから目的特化型ASIC(ASIC)へと移行した経路に似た道を進んでいますが、モデルや精度レシピ(量子化方法など)が絶えず進化しているため、制約はより厳しきものとなっています。

比較:Qwen3:30bとGPT-OSS:20b

比較:Qwen3:30bとGPT-OSS:20b

これらの2つのモデルの速度、パラメータ数、およびパフォーマンスを比較する

以下は、Qwen3:30b と GPT-OSS:20b の比較です。 指示の遵循度(Instruction Following)とパフォーマンスパラメータ、仕様、速度に焦点を当てています。