Sistemi AI: Assistenti Self-Hosted, RAG e Infrastruttura Locale
La maggior parte delle configurazioni locali di AI inizia con un modello e un runtime.
Si scarica un modello quantizzato, lo si avvia tramite Ollama o un altro runtime e si inizia a inviare prompt. Per l’esperimentazione, questo è più che sufficiente. Ma una volta che si va oltre la semplice curiosità — quando ci si preoccupa di memoria, qualità del recupero, decisioni di instradamento o consapevolezza dei costi — la semplicità inizia a mostrare i suoi limiti.
Questo cluster esplora un approccio diverso: considerare l’assistente AI non come una singola invocazione di modello, ma come un sistema coordinato.
Questa distinzione può sembrare sottile all’inizio, ma cambia completamente il modo in cui si pensa all’AI locale.

Cos’è un Sistema AI?
Un sistema AI è più di un semplice modello. È un livello di orchestrazione che collega inferenza, recupero, memoria ed esecuzione in qualcosa che si comporta come un assistente coerente.
Eseguire un modello localmente è un lavoro infrastrutturale. Progettare un assistente attorno a quel modello è un lavoro di sistema.
Se hai esplorato le nostre guide più ampie su:
- Hosting LLM nel 2026: Confronto tra Infrastruttura Locale, Self-Hosted e Cloud
- Architettura LLM: Progettazione del Sistema per l’AI in Produzione — instradamento, ottimizzazione dei costi, guardrail e orchestrazione multi-modello
- Tutorial sulla Generazione Aumentata dal Recupero (RAG): Architettura, Implementazione e Guida alla Produzione
- Secondo cervello spiegato per ingegneri e knowledge worker
- Prestazioni LLM nel 2026: Benchmark, Colli di Bottiglia e Ottimizzazione
- Osservabilità per Sistemi AI
già sai che l’inferenza è solo uno degli strati dello stack.
Il cluster Sistemi AI si posiziona sopra questi livelli. Non li sostituisce — li combina.
Per una mappa trasversale di come questi livelli si integrano negli assistenti in produzione — LLM, memoria, strumentazione, instradamento e osservabilità, con OpenClaw e Hermes come sistemi di riferimento — vedi Architettura dell’Assistente AI: LLM, Memoria, Strumenti, Instradamento, Osservabilità.
Una volta che l’architettura dell’assistente è solida, il passo successivo è renderla proattiva. Agenti di Polling negli Assistenti AI: 11 Pattern di Implementazione copre come i worker di polling in background, l’esecuzione basata su code, i flussi di lavoro durevoli e gli valutatori semantici LLM trasformano un assistente reattivo in uno che osserva, decide e agisce autonomamente.
Quando un singolo assistente non è sufficiente e più agenti devono coordinarsi, la scelta del pattern di coordinazione determina tutto: latenza, tolleranza ai guasti, costi e debuggabilità. Pattern di Orchestrazione Multi-Agente: Una Guida Pratica copre i sei pattern canonici — orchestratore-worker, pipeline sequenziale, fan-out, gerarchico, swarm e mesh — con specifiche modalità di fallimento e un framework decisionale per scegliere l’architettura giusta.
OpenClaw: Un Sistema di Assistente AI Self-Hosted
OpenClaw è un assistente AI open-source, self-hosted, progettato per operare attraverso piattaforme di messaggistica mentre gira su infrastruttura locale.
Su un piano pratico, esso:
- Utilizza runtime LLM locali come Ollama o vLLM
- Integra il recupero su documenti indicizzati
- Mantiene la memoria oltre una singola sessione
- Esegue strumenti e task di automazione
- Può essere strumentato e osservato
- Opera entro i vincoli dell’hardware
Non è solo un wrapper attorno a un modello. È un livello di orchestrazione che collega inferenza, recupero, memoria ed esecuzione in qualcosa che si comporta come un assistente coerente.
Inizio rapido e architettura:
- Guida rapida all’avvio di OpenClaw — installazione basata su Docker utilizzando un modello Ollama locale o una configurazione Claude basata su cloud
- Panoramica del sistema OpenClaw — esplorazione architetturale di come OpenClaw differisce dalle configurazioni locali più semplici
- Guida NemoClaw per operazioni OpenClaw sicure — percorso OpenClaw con priorità alla sicurezza con sandboxing OpenShell, livelli di policy, inferenza instradata e operazioni del secondo giorno
Contesto e analisi:
- Timeline di ascesa e caduta di OpenClaw — l’economia dietro il picco virale, il taglio delle sottoscrizioni di aprile 2026 e cosa il crollo rivela sui cicli di hype dell’AI
- OpenClaw vs Hermes Agent — stelle, download e dati di utilizzo — classifica live di 20 framework con rankings token OpenRouter, conteggi download pacchetti, metriche di salute della comunità e analisi delle tendenze di ricerca
Estensione e configurazione di OpenClaw:
I plugin estendono il runtime OpenClaw — aggiungendo backend di memoria, provider di modelli, canali di comunicazione, strumenti web e osservabilità. Le competenze (Skills) estendono il comportamento dell’agente — definendo come e quando l’agente utilizza quelle capacità. La configurazione per la produzione significa combinare entrambi, modellata attorno a chi sta effettivamente utilizzando il sistema.
- Plugin OpenClaw — Guida all’Ecosistema e Scelte Pratiche — tipi di plugin nativi, ciclo di vita CLI, safety rails e scelte concrete per memoria, canali, strumenti e osservabilità
- Ecosistema delle Competenze OpenClaw e Scelte Pratiche per la Produzione — scoperta ClawHub, flussi di installazione e rimozione, stack per ruolo e le competenze da mantenere nel 2026
- Pattern di Configurazione per la Produzione di OpenClaw con Plugin e Competenze — configurazioni complete di plugin e competenze per tipo di utente: sviluppatore, automazione, ricerca, supporto e crescita — ciascuno con script di installazione combinati
Hermes: Un Agente Persistente con Competenze e Sandbox degli Strumenti
Hermes Agent è un assistente self-hosted, agnostico rispetto al modello, focalizzato sull’operazione persistente: può girare come un processo a lunga durata, eseguire strumenti tramite backend configurabili e migliorare i flussi di lavoro nel tempo attraverso la memoria e le competenze riutilizzabili.
Su un piano pratico, Hermes è utile quando si desidera:
- Un assistente prima di tutto basato su terminale che può anche interfacciarsi con app di messaggistica
- Flessibilità del provider attraverso endpoint compatibili OpenAI e commutazione del modello
- Confini di esecuzione degli strumenti tramite backend locali e sandbox
- Operazioni del secondo giorno con diagnostica, log e igiene della configurazione
I profili Hermes sono ambienti completamente isolati — ciascuno con la propria configurazione, segreti, memorie, sessioni, competenze e stato — rendendo i profili l’unità reale di proprietà in produzione, non la singola competenza.
- Assistente AI Hermes - Installazione, Configurazione, Flusso di Lavoro e Troubleshooting — installazione, configurazione provider, pattern di flusso di lavoro e troubleshooting
- Guida rapida CLI Hermes Agent — comandi, flag e scorciatoie slash — indice tabulare dei sottocomandi
hermes, flag globali, strumentazione gateway e profilo, e comuni scorciatoie slash - Controllo Vocale Hermes dal tuo Telefono — flusso di lavoro vocale mobile-first per Telegram e Discord, con tuning provider STT e TTS più troubleshooting
- Sistema di Memoria Hermes Agent: Come Funziona Davvero la Memoria AI Persistente — guida tecnica approfondita alla memoria core a due file, pattern di snapshot congelato, tutti gli 8 provider esterni e la filosofia della memoria limitata
- Competenze Assistente AI Hermes per Configurazioni Reali di Produzione — architettura delle competenze prima di tutto basata sui profili per ingegneri, ricercatori, operatori e flussi di lavoro esecutivi
- Autore di Competenze Hermes Agent — Struttura SKILL.md e Best Practices — layout pratico
SKILL.md, metadata, attivazione condizionale e troubleshooting quando le competenze scompaiono dall’indice - Kanban in Hermes Agent per Flussi di Lavoro LLM Self-Hosted — pattern di controllo pratici per concorrenza del dispatcher, catene di dipendenze e batching basato su cron su gateway self-hosted
Conoscenza persistente e memoria
Alcuni problemi non sono risolti solo da una finestra di contesto più grande — hanno bisogno di conoscenza persistente (grafici, pipeline di ingestione) e plugin di memoria dell’agente (Honcho, Mem0, Hindsight e backend simili) cablati in assistenti come Hermes o OpenClaw.
- Hub Memoria Sistemi AI — ambito del sottocluster di memoria più link alle guide Cognee e contesto dello stack
- Sistemi di Memoria negli Assistenti AI che Aiutano Davvero — progettazione della memoria cross-framework per stato di lavoro, fatti strutturati e livelli di recupero
- Provider di memoria agente confrontati — confronto completo di Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover e Supermemory per integrazioni stile Hermes
MCP: Server Protocollo Contesto Modello
Il Model Context Protocol (MCP) è uno standard aperto introdotto da Anthropic per connettere i modelli di linguaggio AI a fonti di dati esterne, strumenti e sistemi. Risolve il problema di integrazione N×M fornendo un’interfaccia universale — pensalo come una porta USB-C per le applicazioni AI. Costruire server MCP permette di estendere gli assistenti AI con integrazioni personalizzate per file, database, API e strumenti chiamabili, utilizzando un protocollo semplice basato su JSON-RPC su stdio o HTTP.
- Server MCP in Go — architettura del protocollo, struttura dei messaggi JSON-RPC, negoziazione delle capacità, SDK Go ufficiale e un tutorial passo-passo per costruire server MCP in Go
- Costruire Server MCP in Python — guida pratica all’implementazione Python che copre server MCP per ricerca web e scraping, transport stdio e SSE, e integrazione con Claude Desktop
A2A: Protocollo Agent-to-Agent
Il Protocollo Agent2Agent (A2A) è uno standard aperto per la comunicazione tra sistemi di agenti AI distribuiti indipendentemente. Dove MCP connette un agente agli strumenti, A2A connette agenti ad altri agenti — permettendogli di scoprirsi tramite Agent Cards, scambiare task e messaggi, streaming progresso e restituire artefatti tipizzati. A2A è progettato per sistemi in cui gli agenti sono posseduti da team diversi, costruiti con framework diversi o distribuiti come servizi separati che devono interoperare.
- Cos’è il Protocollo A2A? Agent Cards e Tasks Spiegati — approfondimento sui concetti A2A: Agent Cards, ciclo di vita del task, messaggi, parti, artefatti, streaming, sicurezza e il pattern orchestratore-più-specialisti
- Streaming A2A e Tasks Asincroni per Flussi di Lavoro Agenti a Lunga Durata — guida operativa allo streaming SSE, webhook push, flussi input_required human-in-the-loop, gestione dei fallimenti e osservabilità per task che sopravvivono a una singola richiesta HTTP
- A2A vs MCP: Gli Agenti AI Hanno Davvero Bisogno di Entrambi i Protocolli? — confronto pratico dei due protocolli: quando MCP da solo è sufficiente, quando A2A aggiunge valore reale e come funziona il pattern “A2A fuori, MCP dentro” su larga scala
- Protocollo A2A Google nel 2026: Adozione, Hype e Realtà — uno sguardo misurato su dove A2A ha davvero trazione in produzione nel 2026, cosa l’hype sbaglia e un framework decisionale pratico per quando usarlo
Cosa Rende Diversi i Sistemi AI
Diverse caratteristiche rendono i sistemi AI meritevoli di un esame più attento.
Instradamento del Modello come Scelta di Design
La maggior parte delle configurazioni locali predefinisce un modello. I sistemi AI supportano la selezione intenzionale dei modelli.
Ciò introduce domande:
- Le richieste piccole dovrebbero usare modelli più piccoli?
- Quando il ragionamento giustifica una finestra di contesto più grande?
- Qual è la differenza di costo per 1.000 token?
Queste domande si collegano direttamente ai compromessi di prestazioni discussi in la guida alle prestazioni LLM e alle decisioni infrastrutturali delineate in la guida all’hosting LLM.
I sistemi AI mettono in superficie queste decisioni invece di nasconderle.
Il Recupero è Trattato come un Componente Evolutivo
I sistemi AI integrano il recupero dei documenti, ma non come un semplice passo “embed e cerca”.
Essi riconoscono:
- La dimensione del chunk influisce sul recall e sui costi
- La ricerca ibrida (BM25 + vettore) può superare il recupero denso puro
- Il reranking migliora la rilevanza al costo della latenza
- La strategia di indicizzazione impatta il consumo di memoria
Questi temi si allineano con le considerazioni architetturali più profonde discusse in il tutorial RAG.
La differenza è che i sistemi AI incorporano il recupero in un assistente vivente piuttosto che presentarlo come una demo isolata.
La Memoria come Infrastruttura
Gli LLM stateless dimenticano tutto tra le sessioni.
I sistemi AI introducono livelli di memoria persistente. Ciò solleva immediatamente domande di design:
- Cosa dovrebbe essere memorizzato a lungo termine?
- Quando il contesto dovrebbe essere riassunto?
- Come si previene l’esplosione dei token?
- Come si indicizza la memoria in modo efficiente?
Queste domande si intersecano direttamente con le considerazioni dello strato dati da la guida all’infrastruttura dati. Per Hermes Agent specificamente — memoria limitata a due file, caching prefisso, plugin esterni — iniziare con Sistema di Memoria Hermes Agent e il confronto cross-framework Provider di memoria agente confrontati. L’Hub Memoria Sistemi AI elenca le guide correlate Cognee e strato di conoscenza.
La memoria smette di essere una funzionalità e diventa un problema di storage.
L’Osservabilità Non è Opzionale
La maggior parte degli esperimenti AI locali si ferma a “risponde”.
I sistemi AI rendono possibile osservare:
- Utilizzo dei token
- Latenza
- Utilizzo dell’hardware
- Pattern di throughput
Questo si collega naturalmente con i principi di monitoraggio descritti in la guida all’osservabilità.
Se l’AI gira su hardware, dovrebbe essere misurabile come qualsiasi altro carico di lavoro.
Cosa Si Sente di Usare
Dal di fuori, un sistema AI può ancora sembrare un’interfaccia chat.
Sotto la superficie, succede di più.
Se gli chiedi di riassumere un rapporto tecnico memorizzato localmente:
- Recupera segmenti di documento rilevanti.
- Seleziona un modello appropriato.
- Genera una risposta.
- Registra l’utilizzo dei token e la latenza.
- Aggiorna la memoria persistente se necessario.
L’interazione visibile rimane semplice. Il comportamento del sistema è stratificato.
Quel comportamento stratificato è ciò che differenzia un sistema da una demo.
Dove i Sistemi AI si Inseriscono nello Stack
Il cluster Sistemi AI si trova all’intersezione di diversi livelli infrastrutturali:
- Hosting LLM: Il livello runtime dove i modelli si eseguono (Ollama, vLLM, llama.cpp)
- RAG: Il livello di recupero che fornisce contesto e grounding
- Prestazioni: Il livello di misurazione che traccia latenza e throughput
- Osservabilità: Il livello di monitoraggio che fornisce metriche e tracciamento dei costi
- Infrastruttura Dati: Il livello di storage che gestisce memoria e indicizzazione
Capire questa distinzione è utile. Eseguirlo da soli rende la differenza più chiara.
Per un’installazione locale minima con OpenClaw, vedi la guida rapida all’avvio di OpenClaw, che passa attraverso una configurazione basata su Docker utilizzando un modello Ollama locale o una configurazione Claude basata su cloud.
Se la tua configurazione dipende da Claude, questo cambiamento di policy per gli strumenti agente chiarisce perché la fatturazione API è ora richiesta per i flussi di lavoro OpenClaw di terze parti.
Risorse Correlate
A2A: Protocollo Agent-to-Agent:
- Cos’è il Protocollo A2A? Agent Cards e Tasks Spiegati
- A2A vs MCP: Gli Agenti AI Hanno Davvero Bisogno di Entrambi i Protocolli?
- Protocollo A2A Google nel 2026: Adozione, Hype e Realtà
Server MCP:
Guide assistente AI:
- Architettura dell’Assistente AI: LLM, Memoria, Strumenti, Instradamento, Osservabilità
- Pattern di Orchestrazione Multi-Agente: Una Guida Pratica
- Agenti di Polling negli Assistenti AI: 11 Pattern di Implementazione
- Panoramica del sistema OpenClaw
- Timeline di ascesa e caduta di OpenClaw
- Guida rapida all’avvio di OpenClaw
- Plugin OpenClaw — Guida all’Ecosistema e Scelte Pratiche
- Ecosistema delle Competenze OpenClaw e Scelte Pratiche per la Produzione
- Pattern di Configurazione per la Produzione di OpenClaw con Plugin e Competenze
- Assistente AI Hermes - Installazione, Configurazione, Flusso di Lavoro e Troubleshooting
- Sistema di Memoria Hermes Agent: Come Funziona Davvero la Memoria AI Persistente
- Hub Memoria Sistemi AI
- Provider di memoria agente confrontati
- Competenze Assistente AI Hermes per Configurazioni Reali di Produzione
- Autore di Competenze Hermes Agent — Struttura SKILL.md e Best Practices
Livelli infrastrutturali:
- Hosting LLM nel 2026: Confronto tra Infrastruttura Locale, Self-Hosted e Cloud
- Tutorial sulla Generazione Aumentata dal Recupero (RAG): Architettura, Implementazione e Guida alla Produzione
- Prestazioni LLM nel 2026: Benchmark, Colli di Bottiglia e Ottimizzazione
- Parametri di inferenza Agentic LLM per Qwen e Gemma
- Osservabilità per Sistemi AI
- Infrastruttura Dati per Sistemi AI