Come funziona l'IA Contesto, RAG e prompt
Diagramma Dodici stadi · Settembre 2026

Cosa mettere nel contesto, e come

Un modello non sa niente di te finché non glielo scrivi. Tutte le tecniche di questa pagina — prompt, RAG, CAG, cache, batch, memoria — servono a una cosa sola: decidere quali token entrano nella finestra, in che ordine, e quante volte li paghi.

Il filo rosso

Un assistente interno attraversa tutto il diagramma. Ogni riquadro con la riga rossa racconta cosa gli succede in quello stadio.

«quanti giorni di permesso mi restano?»

4.000 documenti HR: contratti, circolari, accordi firmati e scansionati.

01
Premessa

La finestra di contesto è una scrivania, non una memoria

È grande, ma è finita, si paga a peso, e viene sgombrata a ogni chiamata. Il modello non ricorda la richiesta precedente: gliela rimandi tu, per intero, ogni volta.

Analogia

Un consulente bravissimo e senza memoria, che ogni mattina entra in ufficio senza ricordare nulla di ieri. Quello che gli lasci sulla scrivania è tutto ciò che sa del tuo caso. Tutta l'ingegneria che segue è la disciplina di preparare quella scrivania.

Quanto ci sta, in una finestra da 1 milione di token
Questa pagina
≈ 6k
Un contratto
≈ 12k
Un manuale interno
≈ 50k
Un piccolo progetto software
≈ 150k
I 4.000 documenti HR
≈ 40 M
L'ultima riga è quaranta volte la finestra più grande oggi in commercio, e duecento volte quella dei modelli più piccoli. Da quel divario nasce tutto il resto del diagramma.
Capienza non vuol dire attenzione

Tutti i modelli peggiorano man mano che il contesto si allunga, anche su compiti facili: è il «context rot», ripreso allo stadio 11. In pratica la finestra affidabile è una frazione di quella dichiarata. Che ci stia non basta: bisogna chiedersi se serve.

200k – 1M+
token di finestra, oggi: 1M è lo standard dei modelli di punta
≈ 600–650
parole italiane ogni 1.000 token (750 in inglese; varia col tokenizer)
≈ 1.500
token per pagina scansionata
02
Struttura

Anatomia di un prompt

Per il modello è un unico flusso di token: la divisione in blocchi serve a te. Ma l'ordine conta davvero — sia per la qualità della risposta, sia per il costo, come si vedrà allo stadio 09.

Analogia

Il fascicolo che passi a un collega esterno: prima chi è e cosa deve fare, poi due lavori già fatti come esempio, poi il materiale, e in fondo la domanda. Nessuno consegnerebbe il materiale prima di aver detto a cosa serve.

System
Ruolo, regole, tono, cosa non fare. Identico a ogni chiamata.
statico
Strumenti
Le funzioni disponibili con le rispettive firme. Lunghe, e sempre uguali.
statico
Esempi
Due o tre coppie domanda-risposta esemplari. Insegnano il formato meglio di qualsiasi istruzione.
statico
Documenti
Il materiale recuperato per questa domanda. Delimitato, con la fonte accanto a ogni pezzo.
variabile
Domanda
La richiesta vera, per ultima. È la posizione a cui il modello dà più peso.
variabile
Statico prima, variabile dopo. Non è estetica: è la condizione perché la cache dello stadio 09 funzioni.
03
Tecnica

Prompting: poche mosse che funzionano

Delle decine di tecniche pubblicate ne restano quattro che pagano in produzione. Le altre sono varianti, o rimedi a difetti che i modelli recenti non hanno più.

Analogia

Un briefing a un professionista competente ma nuovo. Non gli spieghi il mestiere: gli dai il contesto, gli mostri un lavoro fatto bene, gli dici in che formato lo vuoi e gli lasci il tempo di ragionare. Le stesse cose funzionano qui, per lo stesso motivo.

Few-shot

Mostra, non descrivere

Due o tre esempi completi valgono più di mezza pagina di istruzioni, soprattutto per il formato. Includi anche un caso limite gestito bene.

Ragionamento

Lascia spazio prima della risposta

Chiedere di ragionare per passi prima di concludere migliora i compiti a più passaggi. Sui modelli di ragionamento è già incorporato: si regola il budget, non si supplica.

Delimitatori

Marca dove finisce il dato

Tag espliciti attorno ai documenti separano ciò che è materiale da ciò che è istruzione e riducono, senza eliminarlo, il rischio che il modello esegua istruzioni nascoste nei documenti.

Output strutturato

Chiedi uno schema

JSON con schema imposto invece di prosa da interpretare: elimina una classe intera di errori a valle e rende testabile la risposta.

Dire cosa fare, non cosa evitare

«Rispondi solo con quanto scritto nei documenti, altrimenti dichiara che non risulta» funziona meglio di «non inventare». Un'istruzione negativa lascia aperto tutto il resto.

Prompt injection

Il testo recuperato è input non fidato, esattamente come l'input di un utente. Un documento può contenere istruzioni. Delimitalo, dichiaralo come dato, e non far dipendere azioni con effetti da ciò che ci trovi dentro.

04
Bivio

Come far arrivare al modello ciò che non sa

Cinque strade. Le prime quattro si scelgono in base a quanto materiale c'è e quanto spesso cambia; la quinta, in base a quanto è complicata la domanda.

Analogia

Un nuovo assunto davanti all'archivio aziendale. Puoi dargli i tre fogli che servono oggi, fargli leggere tutto l'archivio ogni mattina, lasciarglielo già letto e memorizzato, mandarlo a un corso di sei mesi, o dargli le chiavi dell'archivio e lasciarlo cercare da solo. Costano cose diverse e si aggiornano a velocità diverse.

Nel prompt

Incollalo e basta

Finché il materiale ci sta nella finestra, questa è la soluzione giusta. Nessuna infrastruttura, nessun errore di recupero.

Fino a: qualche decina di documenti.

RAG

Cerca, poi rispondi

Si indicizza tutto una volta e a ogni domanda si recuperano solo i pezzi pertinenti. Scala a milioni di documenti e si aggiorna in tempo reale.

Costo: se il recupero sbaglia, il modello risponde bene alla domanda sbagliata.

CAG

Precaricato una volta sola

Tutto il corpus nel contesto, elaborato una volta e tenuto in cache. Nessuna ricerca, nessun pezzo mancante.

Vincolo: deve starci nella finestra. Stadio 08.

Fine-tuning

Riaddestrare il modello

Insegna comportamenti, stile, formati e gerghi. Non è il modo di insegnare fatti: quelli invecchiano e non si citano.

Errore comune: usarlo al posto del recupero.

Ricerca agentica

Lascia cercare il modello

Invece di una pipeline fissa che recupera venti pezzi e li passa al modello, gli si danno strumenti di ricerca: testo, database, lettura di un file. Il modello decide cosa cercare, legge, e se non basta cerca di nuovo. Il RAG classico diventa uno degli strumenti, non la strada.

Costo: più chiamate e più latenza. In cambio regge domande a più passi e fonti eterogenee (stadio 06).

05
Architettura

RAG: due tempi, e il primo non usa il modello

Un tempo offline che prepara l'indice, un tempo online che risponde. La qualità di un sistema RAG si decide quasi tutta nel primo, ma i problemi si vedono solo nel secondo.

Analogia

Il bibliotecario e lo studioso. Il bibliotecario ha schedato tutto in anticipo e sa andare a colpo sicuro; lo studioso legge solo i tre volumi che gli arrivano sul tavolo e scrive la risposta. Se il bibliotecario porta il volume sbagliato, lo studioso non se ne accorge: risponderà benissimo, e a un'altra domanda.

Offline
una volta
Documenti
PDF, wiki, ticket
Chunk
pezzi di 200-800 token
Embedding
un vettore per chunk
Indice
vettoriale + testuale
Online
ogni domanda
Domanda
anch'essa in vettore
Recupero
i 20 più vicini
Rerank
restano i 5 migliori
Generazione
risposta con citazioni
Ricerca ibrida

Il solo vettoriale sbaglia su codici, sigle e nomi propri: cerca significato, non stringhe. Si affianca sempre una ricerca testuale classica (BM25) e si fondono le due classifiche, di solito con la reciprocal rank fusion. È il singolo miglioramento con il miglior rapporto fra guadagno e fatica. Una via di mezzo è la late interaction (ColBERT): un vettore per ogni token invece che per chunk, più precisa e più pesante, lo stesso meccanismo della variante ColPali dello stadio 07.

Reranker

Un secondo modello, più lento e più preciso, legge domanda e chunk insieme e riordina i primi venti. Costa decine o centinaia di millisecondi e recupera gran parte degli errori del primo passaggio.

06
Dettagli

Dove il RAG si rompe davvero

Nessuno di questi problemi riguarda il modello. Sono tutti a monte, e sono la ragione per cui un prototipo che funziona in un pomeriggio non regge il primo mese di uso vero.

Analogia

Fotocopiare un manuale tagliando le pagine a metà. Ogni foglio è leggibile, ma la frase che ti serve è spezzata fra due fogli e nessuno dei due, preso da solo, dice a quale capitolo apparteneva.

Il taglio

Segui la struttura, non i caratteri

Taglia per sezione, articolo, paragrafo — non ogni 500 caratteri. Sovrapponi un poco i pezzi. Una tabella o un blocco di codice non si spezzano mai.

Il contesto perduto

«Il presente articolo» — quale?

Un chunk isolato perde titolo, capitolo e data. Si rimedia anteponendo a ogni pezzo una o due frasi che lo collocano nel documento, scritte da un modello che legge il documento intero: è il «contextual retrieval». Nei test pubblicati dimezza circa i recuperi falliti, e con il reranker li riduce di due terzi. Con la cache sul documento costa poco.

I metadati

Filtrare prima di cercare

Data, versione, permessi, tipo di documento. Servono a restringere il campo e, nel caso dei permessi, a non mostrare a qualcuno ciò che non deve vedere. Il controllo accessi va nel recupero, non nel prompt.

Le domande difficili

«Quante volte…», «riassumi tutto»

Il recupero dei primi k pezzi non risponde a domande aggregate né comparative. Vanno riconosciute e indirizzate altrove: una query sul database, una lettura completa in batch, oppure un indice a grafo (GraphRAG) che in fase di indicizzazione estrae entità e relazioni e prepara riassunti per gruppi di documenti. Costa molto costruirlo, ma risponde a «riassumi tutto».

Valutare, altrimenti si naviga a vista

Servono due misure separate: il recupero (il pezzo giusto era fra quelli passati al modello?) e la risposta (era corretta e fondata su quei pezzi?). Tenerle distinte dice subito quale metà sistemare. Bastano un centinaio di domande reali con la risposta attesa, raccolte una volta e rigiocate a ogni modifica.

07
Variante

Pixel RAG: indicizzare la pagina, non il testo

Il RAG classico comincia con l'estrazione del testo dai PDF, ed è lì che perde tabelle, grafici, moduli e timbri. Il pixel RAG salta quel passaggio: incorpora direttamente l'immagine della pagina con un modello che vede.

Analogia

Trascrivere uno spartito a parole per poterlo archiviare, contro fotografarlo. La trascrizione perde tutto ciò che stava nella disposizione — e in un bilancio, in un modulo o in un organigramma la disposizione è l'informazione.

RAG testuale
PDF
→ estrazione testo / OCR
→ chunk
→ embedding di testo
→ indice

Fragile su scansioni, colonne multiple, tabelle. Ogni errore di estrazione resta nell'indice per sempre.

Pixel RAG
PDF
→ immagine di ogni pagina
(nessun chunk)
→ embedding visivi della pagina
→ indice

La pagina resta intera. Al modello si passa l'immagine stessa, che la legge come la leggeresti tu.

Come funziona

Due varianti. La più precisa (ColPali, «late interaction») trasforma la pagina in centinaia di vettori, uno per zona, e la domanda in un vettore per parola: il punteggio confronta ogni parola con la zona che le somiglia di più. Recupero fine, indice pesante. La più leggera dà un solo vettore per pagina, come un embedding di testo. In letteratura si chiama visual RAG o visual document retrieval.

Quando conviene

Sì: scansioni, moduli, bilanci, cataloghi, slide, tutto ciò che è nato per essere guardato. No: testo digitale pulito — lì il RAG testuale costa dieci volte meno e non perde nulla.

08
Alternativa

CAG: togliere del tutto la ricerca

Cache-augmented generation: se il corpus ci sta nella finestra, mettilo tutto dentro una volta, congela lo stato interno del modello e riusalo a ogni domanda. Niente indice, niente chunk, niente recupero da sbagliare.

Analogia

Invece di mandare l'assistente in archivio a ogni domanda, glielo fai leggere tutto una volta il primo giorno — e lo assumi già preparato. Funziona benissimo finché l'archivio è una libreria, non un capannone.

Una volta
tutto il corpus entra nel contesto
Si congela
lo stato interno resta in cache
Ogni domanda
si aggiunge solo la domanda
↑ il corpus si rilegge solo quando cambia
RAGCAG
Dimensione del corpusillimitatadeve stare nella finestra
Errori di recuperoil rischio principalenessuno esterno, ma il modello può trascurare il passaggio giusto se il corpus è lungo
Aggiornamentoimmediato, per documentosi rifà la cache
Latenza per domandaricerca + generazionesolo generazione
Costo per domandabasso, poche migliaia di tokenlettura della cache: ridotta ma sull'intero corpus
Infrastrutturaindice, embedding, rerankerquasi nessuna
In pratica si combinano: CAG per il nucleo stabile che serve sempre, RAG per la coda lunga che cambia.
09
Economia

Prompt caching: non ripagare ciò che non cambia

Il modello elabora il prompt dall'inizio alla fine. Se l'inizio è identico a quello di poco fa, il lavoro già fatto si può riusare — e allora quei token si pagano una frazione, e non si aspetta di rielaborarli.

Analogia

Un segnalibro. Il consulente ha già letto le prime cento pagine del fascicolo: se il fascicolo comincia esattamente come prima, riparte dal segnalibro. Basta cambiare una virgola nella prima pagina e deve rileggere tutto — la cache vale solo per un prefisso identico, carattere per carattere.

Regola d'oro

Statico in cima, variabile in fondo

System, strumenti, esempi, corpus fisso: prima e sempre nello stesso ordine. Documenti recuperati e domanda: dopo. Una data o un nome utente messi in cima annullano la cache per tutti.

Conti

Scrivere costa un po' di più, leggere molto meno

La prima chiamata che riempie la cache costa qualcosa in più del normale; ogni successiva legge quei token a un decimo o meno. Conviene già dalla seconda o terza chiamata.

Scadenza

Da minuti a ore

Secondo il fornitore la cache dura da 5 minuti a qualche decina di minuti di inattività, e si rinfresca a ogni uso. Durate di un'ora o di un giorno si possono richiedere, pagando di più la scrittura o la conservazione. Conviene sul traffico continuo, non sulle chiamate isolate.

Effetto collaterale

La latenza crolla

Non è solo risparmio: rileggere 100.000 token in cache è molto più rapido che elaborarli da capo. Su prompt lunghi il tempo alla prima parola si riduce in modo netto.

≈ 1/10 o meno
prezzo dei token letti in cache (su alcuni modelli recenti 1/20 – 1/40)
minuti–ore
durata tipica, estendibile
prefisso esatto
condizione per il riuso
10
Economia

Batch: due cose diverse con lo stesso nome

Una è una modalità di consegna asincrona che costa circa la metà. L'altra è mettere più compiti in un singolo prompt. Si confondono spesso, e solo la prima è quasi sempre una buona idea.

Analogia

La posta ordinaria contro l'espresso: stessa lettera, metà prezzo, arriva quando arriva. Diverso è infilare venti lettere nella stessa busta — risparmi la busta, ma se il destinatario ne salta una te ne accorgi tardi.

Batch asincrono

Mandi 50.000 richieste e torni domani

Si consegna un file di richieste indipendenti, si ritirano i risultati entro le ore successive. Circa metà prezzo, nessun limite di traffico da gestire.

Per: classificazioni di massa, arricchimento di archivi, valutazioni, indicizzazione. Mai per: qualcosa che un utente sta aspettando.

Più compiti in un prompt

Venti domande in una chiamata

Risparmia sulle istruzioni ripetute, ma la qualità cala verso il fondo della lista, un errore di formato ne compromette venti e diventa difficile capire quale è andata storta.

Ha senso quando i compiti sono brevi, omogenei e si giudicano insieme. Con la cache attiva il vantaggio economico si assottiglia.

Le tre leve, insieme

Cache, batch e recupero mirato agiscono su cose diverse e si sommano: la cache toglie il costo del prefisso ripetuto, il batch dimezza quello che resta sui lavori non urgenti, il recupero riduce quanti token entrano in gioco. Un carico di lavoro che le usa tutte e tre costa un ordine di grandezza meno dello stesso carico scritto in modo ingenuo.

11
Continuità

Memoria: una finzione ben costruita

Nessun modello ricorda niente fra una chiamata e l'altra. Quello che i prodotti chiamano memoria è testo che qualcuno ha salvato altrove e reinserisce nel prompt al momento giusto. Decidere cosa tenere, cosa riassumere e cosa buttare è la disciplina che oggi si chiama context engineering.

Analogia

Il consulente smemorato con un quaderno. Ogni sera qualcuno annota le cose importanti della giornata; ogni mattina gli mette il quaderno sulla scrivania. Sembra continuità, ed è archiviazione — con tutte le domande che ne derivano: chi decide cosa vale la pena annotare, e chi può cancellare.

Nella conversazione

Rimandare tutto

Ogni turno reinvia l'intera cronologia. Semplice e fedele, ma cresce senza limite: il costo per messaggio aumenta a ogni battuta.

Compattazione

Riassumere il vecchio

Quando la finestra si riempie, i turni lontani diventano un riassunto e gli ultimi restano per esteso. Oggi le API lo fanno da sole, lato server, e tolgono anche i risultati vecchi degli strumenti, spesso la parte più voluminosa. Ciò che deve sopravvivere al riassunto il modello lo scrive in un file di memoria.

Memoria persistente

Fatti estratti e archiviati

Preferenze e dati stabili estratti dalle conversazioni, salvati fuori e recuperati quando servono. A volte è RAG applicato all'utente invece che ai documenti; più spesso è un breve profilo sempre presente nel prompt, o un archivio che il modello consulta da sé con uno strumento quando gli serve.

Il logoramento del contesto

Riempire la finestra non è gratis in qualità. Tutti i modelli peggiorano man mano che il contesto cresce («context rot», stadio 01), e peggio ancora se il contesto contiene passaggi simili ma sbagliati, come una circolare abrogata. La vecchia regola «il centro è la zona più trascurata» oggi pesa meno della lunghezza in sé. Mille token pertinenti battono centomila token generici.

Chi possiede il quaderno

Una memoria persistente è un archivio di dati personali: va mostrata, modificabile e cancellabile dall'utente. Nel caso HR, con dati di salute o disciplinari, questa non è una raffinatezza ma un requisito.

12
Bilancio

Cosa si paga, e quando si aspetta

Tre voci: i token in ingresso, quelli in ingresso già visti, quelli in uscita. Prezzi molto diversi fra loro, ed è da questo che discende quasi ogni scelta architetturale della pagina.

Analogia

Leggere costa poco, rileggere ciò che si ricorda costa quasi niente, scrivere costa caro — e scrivere è anche l'unica delle tre che si fa una parola per volta, quindi è lì che sta l'attesa.

Costo relativo per token, ordini di grandezza
Input in cache
≤ 0,1 ×
Input in batch
0,5 ×
Input normale
1 ×
Output
≈ 5 ×
Rapporti indicativi, variabili per fornitore e modello. La conclusione però è stabile: un prompt lungo con una risposta breve è economico, e chiedere al modello di ragionare a lungo si paga sulla voce più cara. Attenzione alle soglie: alcuni fornitori, sopra i 200-300 mila token, fanno pagare l'intera richiesta a una tariffa maggiorata, e questo cambia i conti di una CAG da mezzo milione di token. Fra batch e sincrono esiste spesso un livello «flex»: sincrono ma più lento, a un prezzo vicino a quello del batch.
Dove va il tempo

Il tempo alla prima parola dipende dalla lunghezza del prompt — e la cache lo abbatte. Il resto dipende da quante parole scrive. Per la percezione dell'utente conta soprattutto il primo, motivo per cui si trasmette in streaming.

L'ordine in cui intervenire

Prima riordina il prompt per la cache, poi manda in batch tutto ciò che nessuno aspetta, poi riduci il materiale recuperato, e solo alla fine valuta un modello più piccolo. Le prime tre non costano qualità.

Sintesi

Come si sceglie, in pratica

Se hai…UsaAggiungiNon serve
Pochi documenti, stabiliTutto nel promptPrompt cachingIndice vettoriale
Un corpus che sta comodo in finestraCAGRAG per la coda lungaChunking
Migliaia di documenti che cambianoRAG ibridoReranker, filtri per data e permessiFine-tuning per i fatti
Domande a più passi, fonti eterogeneeRicerca agenticaRAG ibrido e query sul database come strumentiUna pipeline fissa per ogni caso
Scansioni, moduli, tabellePixel RAG su quelliIndice testuale per il restoOCR come unica strada
Un prefisso lungo e ripetutoPrompt cachingStatico in cima, sempreAccorciare le istruzioni
Un lavoro che nessuno aspettaBatch asincronoChiamate sincrone in ciclo
Conversazioni lungheCompattazione a sogliaFatti persistenti, visibili all'utenteRimandare tutto per sempre
Uno stile o un formato da imporreEsempi nel promptFine-tuning se non bastaIstruzioni sempre più lunghe
Regola trasversale: comincia dalla cosa più stupida che funziona — incollare i documenti nel prompt — e aggiungi un pezzo di infrastruttura solo quando una misura ti dice che serve.
In una riga

Tutto è un problema di cosa entra nella finestra.

RAG, CAG, pixel RAG, ricerca agentica, cache, batch e memoria non sono sette tecnologie diverse: sono sette risposte alla stessa domanda — quali token servono davvero adesso, e come evitare di pagarli due volte.

Prezzi e durate sono rapporti indicativi: variano per fornitore, modello e periodo. Le cifre dell'esempio sono illustrative. Settembre 2026