LLM Performance

KV Cache su GPU da 16 GB: far convivere davvero i contesti lunghi

KV Cache su GPU da 16 GB: far convivere davvero i contesti lunghi

Perché il contesto da 128K va in crash su 16 GB

Un modello può pubblicizzare una finestra di contesto da 128K e comunque fallire a 40K token su una GPU da 16 GB. Il limite architetturale non ha mai garantito che i pesi, la cache KV, i buffer di calcolo e il compositore del desktop potessero stare sulla tua scheda contemporaneamente.

Speculative Decoding: inferenza degli LLM dal 20% al 50% più veloce

Speculative Decoding: inferenza degli LLM dal 20% al 50% più veloce

Inferenza LLM più veloce senza perdita di qualità: una guida pratica

Un modello da 70B genera un token per passaggio avanti e ogni passaggio ricarica i pesi dalla VRAM, calcola l’attenzione su tutto il contesto e sincronizza la memoria. Tra un token e l’altro, la GPU resta inattiva in attesa che si risolvano le dipendenze sequenziali.

Validazione dell'output strutturato degli LLM in Python che regge

Validazione dell'output strutturato degli LLM in Python che regge

Smetti di interpretare le vibrazioni. Convalida i contratti.

La maggior parte dei tutorial sull’output strutturato degli LLM è superficiale. Ti insegnano a chiedere JSON gentilmente e poi sperare che il modello si comporti correttamente. Quello non è convalida. È ottimismo con le parentesi graffe.

ASIC LLM e chip dedicati all'inferenza (e il perché siano importanti)

ASIC LLM e chip dedicati all'inferenza (e il perché siano importanti)

Gli ASIC e i chip su misura aumentano la velocità e l'efficienza dell'inferenza dei LLM

Il futuro dell’AI non riguarda solo modelli più intelligenti. Riguarda anche un silicio che si adegua al modo in cui tali modelli vengono effettivamente serviti. L’hardware specializzato per l’inferenza LLM segue un percorso che richiama il passaggio del mining di Bitcoin dalle GPU agli ASIC dedicati, ma con vincoli più rigidi poiché i modelli e le tecniche di precisione continuano a evolversi.