LLM Performance

Le KV Cache sur des GPU de 16 Go : faire tenir réellement les longs contextes

Le KV Cache sur des GPU de 16 Go : faire tenir réellement les longs contextes

Pourquoi un contexte de 128 Ko échoue sur 16 Go

Un modèle peut afficher une fenêtre de contexte de 128K et échouer tout de même à 40K jetons sur une carte graphique de 16 Go. La limite architecturale ne garantissait jamais que les poids, le cache KV, les tampons de calcul et le compositeur de bureau tiendraient sur votre carte en même temps.

Décodage spéculatif : inférence LLM 20 à 50 % plus rapide

Décodage spéculatif : inférence LLM 20 à 50 % plus rapide

Inférence LLM plus rapide sans perte de qualité : un guide pratique

Un modèle de 70B génère un jeton par passe avant, et chaque passe recharge les poids depuis la VRAM, calcule l’attention sur l’ensemble du contexte et synchronise la mémoire. Entre les jetons, le GPU reste inactif pendant qu’il attend la résolution des dépendances séquentielles.

Validation des sorties structurées des LLM en Python qui tient la route

Validation des sorties structurées des LLM en Python qui tient la route

Arrêtez d’interpréter des vibes. Validez les contrats.

La plupart des tutoriels sur les « sorties structurées » des LLM manquent de sérieux. Ils vous apprennent à demander du JSON poliment, puis à espérer que le modèle se comporte correctement. Ce n’est pas de la validation. C’est de l’optimisme entre accolades.

BAML vs Instructor : Sorties structurées des LLM

BAML vs Instructor : Sorties structurées des LLM

Sorties de LLM typées avec BAML et Instructor

Lors du travail avec des modèles de langage de grande taille (LLM) en production, obtenir des outputs structurés et sûrs de type est critique. Deux frameworks populaires - BAML et Instructor - adoptent des approches différentes pour résoudre ce problème.

NVIDIA DGX Spark vs Mac Studio vs RTX-4080 : Comparaison des performances d'Ollama

NVIDIA DGX Spark vs Mac Studio vs RTX-4080 : Comparaison des performances d'Ollama

Benchmarks GPT-OSS 120b sur trois plateformes d'IA

J’ai découvert des tests de performance intéressants sur l’exécution du modèle GPT-OSS 120b avec Ollama sur trois plateformes différentes : NVIDIA DGX Spark, Mac Studio, et RTX 4080. Le modèle GPT-OSS 120b de la bibliothèque Ollama pèse 65 Go, ce qui signifie qu’il ne peut pas s’exécuter dans les 16 Go de VRAM d’un RTX 4080 (ou sur le plus récent RTX 5080).

Les ASIC pour LLM et les puces d’inférence spécialisées (pourquoi ils sont importants)

Les ASIC pour LLM et les puces d’inférence spécialisées (pourquoi ils sont importants)

Les ASIC et les puces sur mesure améliorent la vitesse et l’efficacité de l’inférence des LLM

L’avenir de l’IA ne concerne pas seulement des modèles plus intelligents. Il s’agit également de la silice capable de s’adapter à la manière dont ces modèles sont réellement servis. Le matériel spécialisé pour l’inférence LLM suit une voie rappelant le passage des GPU aux ASIC conçus sur mesure pour le minage de Bitcoin, mais avec des contraintes plus strictes car les modèles et les recettes de précision évoluent constamment.