Vllm

Le KV Cache sur des GPU de 16 Go : faire tenir réellement les longs contextes

Le KV Cache sur des GPU de 16 Go : faire tenir réellement les longs contextes

Pourquoi un contexte de 128 Ko échoue sur 16 Go

Un modèle peut afficher une fenêtre de contexte de 128K et échouer tout de même à 40K jetons sur une carte graphique de 16 Go. La limite architecturale ne garantissait jamais que les poids, le cache KV, les tampons de calcul et le compositeur de bureau tiendraient sur votre carte en même temps.

De Ollama à vLLM : quand migrer votre serveur LLM local

De Ollama à vLLM : quand migrer votre serveur LLM local

Quand passer d’Ollama à vLLM

Ollama est l’une des méthodes les plus simples pour exécuter un modèle de langage local, mais la praticité peut masquer l’instant où une expérience locale se transforme en service d’inférence partagé nécessitant une planification et une observabilité plus rigoureuses.