LLM

KV Cache su GPU da 16 GB: far convivere davvero i contesti lunghi

KV Cache su GPU da 16 GB: far convivere davvero i contesti lunghi

Perché il contesto da 128K va in crash su 16 GB

Un modello può pubblicizzare una finestra di contesto da 128K e comunque fallire a 40K token su una GPU da 16 GB. Il limite architetturale non ha mai garantito che i pesi, la cache KV, i buffer di calcolo e il compositore del desktop potessero stare sulla tua scheda contemporaneamente.

Cosa arriva dopo gli LLM? Mamba, Diffusione e World Models

Cosa arriva dopo gli LLM? Mamba, Diffusione e World Models

Cosa arriva dopo gli LLM? L'era post-transformer.

L’hype sull’IA segue un ritmo: all’incirca ogni tre anni, l’architettura su cui tutti scommettono viene sostituita da qualcosa di più recente. Il prossimo cambiamento è già in fase di formazione nei laboratori di ricerca.

Superpowers Quickstart: installazione, workflow e prova

Superpowers Quickstart: installazione, workflow e prova

Competenze SDD obbligatorie, installate con un solo comando.

Superpowers imballa un’intera metodologia guidata da specifiche in Skills di Claude installabili, imponendo brainstorming, pianificazione, implementazione guidata da subagenti e un rigoroso TDD, invece di lasciare che tu strutturi tutto da solo.

Gravità dei Dati: il vero costo dell’AI API-First

Gravità dei Dati: il vero costo dell’AI API-First

Perché il tuo stack di AI diventa più ‘appiccicoso’ ogni mese.

Ogni chiamata API sembra una semplice transazione: finché non se ne accumulano abbastanza da plasmare i tuoi dati di fine-tuning, i tuoi sistemi di valutazione e i tuoi schemi degli strumenti attorno a un unico fornitore, momento in cui il passaggio a un altro smette di essere un semplice cambio di instradamento.

Ollama a vLLM: quando migrare il proprio server LLM locale

Ollama a vLLM: quando migrare il proprio server LLM locale

Quando passare da Ollama a vLLM

Ollama è uno dei modi più semplici per eseguire un modello linguistico locale, ma la comodità può nascondere il momento in cui un esperimento locale diventa un servizio di inferenza condiviso che richiede una migliore pianificazione e osservabilità.

Mantenere allineati specifiche, test e codice nello sviluppo di AI

Mantenere allineati specifiche, test e codice nello sviluppo di AI

Impedisci agli agenti AI di allontanarsi dalle specifiche, dai test e dal codice.

Gli agenti di coding AI rilasciano funzionalità rapidamente, ma specifiche, test e codice tendono a divergere silenziosamente. Questa guida illustra un modello di tracciabilità, il mapping da specifiche a test e da specifiche a codice, e i controlli CI che individuano queste divergenze prima del merge.

GPU per l'IA nel 2026: NVIDIA, AMD e Intel confrontate

GPU per l'IA nel 2026: NVIDIA, AMD e Intel confrontate

Confronto delle GPU AI tra tre fornitori

Il panorama dell’hardware per l’IA è cambiato significativamente nel 2026, con NVIDIA, AMD e Intel che competono per gli sviluppatori che necessitano di GPU in grado di eseguire localmente modelli linguistici di grandi dimensioni (LLM) e carichi di lavoro di inferenza IA.

Sicurezza degli agenti A2A e MCP: identità, delega e audit trail

Sicurezza degli agenti A2A e MCP: identità, delega e audit trail

La sicurezza del protocollo riguarda chi può agire, non il modello.

L’iniezione di prompt riceve la maggior parte dell’attenzione in termini di sicurezza nei sistemi LLM e merita attenzione, ma non è l’unico problema una volta che gli agenti iniziano a chiamare strumenti e a delegare il lavoro ad altri agenti.

Speculative Decoding: inferenza degli LLM dal 20% al 50% più veloce

Speculative Decoding: inferenza degli LLM dal 20% al 50% più veloce

Inferenza LLM più veloce senza perdita di qualità: una guida pratica

Un modello da 70B genera un token per passaggio avanti e ogni passaggio ricarica i pesi dalla VRAM, calcola l’attenzione su tutto il contesto e sincronizza la memoria. Tra un token e l’altro, la GPU resta inattiva in attesa che si risolvano le dipendenze sequenziali.