Come funziona l'IA Come funzionano gli LLM
Diagramma Dieci stadi · Settembre 2026

Come funziona un LLM di frontiera

Dal testo che scrivi al testo che ricevi. Ogni stadio con l'analogia che serve a capirlo, il meccanismo reale sotto, e i numeri veri di un modello del 2026. Scritto per chi programma e non ha mai toccato il machine learning.

Il filo rosso

Un prompt solo attraversa tutto il diagramma. Ogni riquadro con la riga rossa racconta cosa gli succede in quello stadio.

«scrivi una funzione che valida un IBAN»

01
Input

Il testo diventa numeri

Il modello non vede lettere e non vede parole. Vede pezzi di parola presi da un vocabolario fisso, deciso una volta per tutte prima dell'addestramento.

Analogia

I caratteri mobili di una tipografia: una cassetta di centomila pezzi, sempre gli stessi. Qualsiasi testo del mondo va composto con quei pezzi lì — e i pezzi frequenti sono parole intere, quelli rari sono sillabe.

scri7411
vi1290
·una3308
·funzione54021
·che1177
·val9040
ida2265
·un704
·I358
BAN18832
Il puntino segna lo spazio iniziale: « ·una » e « una » sono due token diversi.
Un ID è solo un indice

Ogni ID pesca una riga da una tabella gigantesca: la matrice degli embedding, ≈200.000 righe × ≈8.000 colonne.

« ida » = 2265 =
[ 0.021, −0.443, 0.870, 0.114, … ]8.192 numeri: una posizione in uno spazio a ottomila assi, dove i significati vicini stanno vicini.
100k–200k
token nel vocabolario
≈ 3–4
caratteri per token
10
token in questo prompt
02
Architettura

Cento strati che annotano lo stesso vettore

Ogni token porta con sé un vettore che attraversa la pila di strati dal basso verso l'alto. Nessuno strato lo riscrive da zero: ognuno ci somma le proprie annotazioni.

Analogia

Un fascicolo che passa in cento uffici. Ogni ufficio fa due cose: guarda gli altri fascicoli sul tavolo per capire il contesto (attenzione), poi ci scrive sopra quello che sa (MLP). Alla fine il fascicolo è lo stesso, ma è pieno di annotazioni.

↑ flusso residuo
il vettore del token sale, e ogni blocco ci somma qualcosa
Uscita → logits
Attenzione
guarda gli altri token
MLP
elabora da solo
… × 96 strati identici, pesi tutti diversi …
Attenzione
chi c'entra con me?
MLP
qui stanno i fatti
Ingresso: 10 vettori (uno per token)
Dove stanno i parametri

In un modello denso circa due terzi dei pesi sono negli MLP; in un MoE, dove l'MLP è un banco di esperti, si supera il 90%. Sono loro il magazzino delle conoscenze. L'attenzione è il meccanismo che decide cosa cercare nel magazzino.

Mixture of experts

Nei modelli di frontiera l'MLP è un banco di esperti: per ogni token se ne accendono 4 o 8 su centinaia. Un trilione di parametri sulla carta, qualche decina di miliardi effettivamente usati per token.

60–120
strati impilati
10¹¹–10¹²
parametri totali
≈ 3–10%
attivi per token (MoE)
03
Meccanismo

Attenzione: ogni token interroga il passato

È l'unico punto in cui i token si parlano. Tutto il resto della rete lavora su un token per volta, isolato.

Analogia

Una query su una tabella. Ogni token emette una query («sto cercando il verbo a cui mi riferisco»); ogni token precedente espone una chiave («io sono un verbo»). Il grado di somiglianza fra query e chiave decide quanta parte del valore di quel token viene copiata dentro il mio. Un JOIN pesato, ricalcolato a ogni strato.

Quanto il token « ida » guarda indietro — una testa, uno strato profondo
scri
0.03
vi
0.02
·una
0.02
·funzione
0.24
·che
0.03
·val
0.56
ida
0.10
·un
·I
BAN
I pesi di una riga sommano sempre a 1: l'attenzione è una torta da dividere. Le righe tratteggiate sono il futuro: mascherate. Un token non può mai vedere quelli che vengono dopo di lui — è questa regola che rende il modello capace di scrivere, e non solo di leggere.
Multi-head

Il conto qui sopra non si fa una volta: si fa 64–128 volte in parallelo, con domande diverse. Una testa cerca il soggetto, una tiene il conto delle parentesi aperte, una segue chi ha detto cosa.

KV cache

Chiavi e valori dei token già visti si tengono in memoria e non si ricalcolano. Senza cache, ogni token nuovo costringerebbe a rileggere da capo tutto il testo; con la cache calcola solo sé stesso. Resta comunque una passata su tutti gli strati per ogni token: per questo scrivere costa più che leggere (stadio 07). E un contesto lungo occupa gigabyte di VRAM.

Contesti lunghi

Guardare tutto il passato costa: raddoppi il testo, quadruplichi il calcolo. Per questo i modelli recenti risparmiano. Molte teste condividono le stesse chiavi, chiavi e valori si salvano compressi, alcuni strati guardano solo gli ultimi token o una memoria riassunta, e solo pochi consultano l'intero contesto.

04
Addestramento

Pre-training: leggere tutto, coprendo la parola dopo

Un solo esercizio, ripetuto per mesi: prendi un pezzo di testo, nascondi il token successivo, prova a indovinarlo, guarda la risposta, correggi un pochino tutti i pesi. Nessuna regola grammaticale, nessun fatto inserito a mano.

Analogia

Un apprendista chiuso in biblioteca con la biblioteca intera e un solo compito. Per imparare davvero a indovinare la parola dopo — in un giallo, in un teorema, in uno stack trace — è costretto a costruirsi per conto suo la grammatica, l'aritmetica e un modello del mondo. Le capacità sono un effetto collaterale dell'esercizio.

Che cosa legge — ordini di grandezza tipici, la ricetta esatta è segreta
40% web
pagine filtrate e deduplicate
22% codice
repo pubbliche
16% sintetico
generato e filtrato da altri modelli
12% libri e paper
testo lungo e curato
10% altro
multilingua, dialoghi, dati
Testo
«il codice IBAN italiano è lungo 27 ___»
Previsione
« cifre » 0.31 · « caratteri » 0.44
Correzione
era « caratteri »: sposta i pesi di un'inezia
Le previsioni sono circa 10¹³, una per token letto. Le correzioni però si fanno a blocchi: si sommano gli errori di qualche milione di token e poi si spostano i pesi una volta sola, per qualche centinaio di migliaia di passi in tutto. Il risultato si chiama modello base: sa continuare qualsiasi testo, non sa rispondere a una domanda. Se gli chiedi «come funziona un IBAN?» può benissimo rispondere con altre cinque domande simili — è la continuazione statisticamente più plausibile di una FAQ.
10–30 T
token letti
10²⁶–10²⁷
operazioni (FLOP)
10⁴–10⁵
GPU per mesi
10⁸ $
ordine di costo
05
Allineamento

Post-training: da testo plausibile a interlocutore utile

Il modello base sa già quasi tutto quello che saprà mai. Il post-training non aggiunge conoscenza: sceglie, fra le mille continuazioni plausibili, quella che vale la pena dare.

Analogia

L'apprendista esce dalla biblioteca ed entra in bottega. Prima gli si mostra come si lavora (SFT), poi il maestro giudica due lavori e dice quale è migliore (RLHF), infine lo si mette davanti a compiti che si correggono da soli — il pezzo entra o non entra nella sede (RLVR).

SFT · imitazione

Gli si mostra la forma

Da 10.000 a qualche milione di conversazioni esemplari: domanda e risposta modello. Oggi la maggior parte la genera un modello più grande o già addestrato, e un altro modello o un verificatore la filtra; gli umani scrivono i casi difficili e controllano la qualità. Stesso identico esercizio del pre-training, su dati diversissimi.

Risolve: ora risponde invece di continuare.

RLHF · preferenze

Gli si dice quale è meglio

Due risposte, un umano sceglie. Con abbastanza scelte si addestra un secondo modello a dare un voto, e il primo viene spinto verso i voti alti.

Risolve: tono, sicurezza, rifiuti. Rischio: impara a piacere, non ad aver ragione.

RLVR · verifica

Ci pensa la realtà

Compiti con risposta controllabile da una macchina: i test passano? la dimostrazione regge? Il premio lo calcola una macchina, quindi si può girare su milioni di compiti senza umani. Il verificatore va progettato con la stessa cura del compito.

Risolve: è quello che ha fatto esplodere codice, matematica e ragionamento lungo. Rischio: impara a far passare il controllo invece di fare il lavoro, per esempio ritoccando i test.

Il maestro è un modello

Oggi chi sceglie fra due risposte è spesso un altro modello. Gli si dà un elenco di principi o una rubrica («la risposta cita la fonte? rispetta il formato?») e giudica milioni di coppie. È così che l'RL arriva ai compiti senza una risposta verificabile: scrittura, consigli, sicurezza. Due scorciatoie, DPO e GRPO, hanno poi reso il ciclo più semplice ed economico: la prima impara direttamente dalle coppie senza il modello che dà i voti, la seconda confronta fra loro più tentativi sulla stessa domanda.

Dall'esercizio all'ambiente

L'ultima evoluzione dell'RLVR: invece di un esercizio, un ambiente. Il modello riceve un repository, un terminale e un obiettivo, lavora per cento passi e alla fine si controlla se il bug è davvero sparito. Si premia l'intero percorso, così impara a usare gli strumenti, a verificare e a non arrendersi. Sono gli agenti dello stadio 08.

10⁴–10⁶
esempi di SFT
settimane–mesi
e per l'RL un calcolo vicino al pre-training
↑ in crescita
quota di compute sul totale
06
Test-time

Ragionare vuol dire spendere token

Non c'è un modulo logico in più. C'è lo stesso meccanismo di prima, addestrato con RLVR a scrivere una lunga bozza prima di rispondere — e la bozza, rientrando nel contesto, diventa il supporto su cui il calcolo si appoggia.

Analogia

Il foglio di brutta. Un modello senza brutta deve dare il risultato di getto, con una quantità di calcolo fissa. Un modello che scrive la brutta può tornarci sopra, accorgersi dell'errore e correggersi: ogni riga scritta è calcolo in più che si porta dietro.

La forma di una bozza
<pensiero>
IBAN: 2 lettere paese, 2 cifre di controllo, poi il BBAN.
Validazione: sposto i primi 4 caratteri in fondo, converto le lettere in numeri (A=10 … Z=35), mod 97 deve dare 1.
Attenzione: la lunghezza cambia per paese — serve una tabella.
Rifaccio il conto sulle lettere: A=10, quindi IT → 18, 29. Sì.
</pensiero>
Questa parte spesso non ti viene mostrata, ma la paghi: sono token generati come tutti gli altri.
Accuratezza vs token spesi
alta bassa 10² 10³ 10⁴
La curva sale con il logaritmo del budget: dieci volte più pensiero per un gradino di accuratezza. E la latenza segue, da secondi a minuti.
Quanta brutta

Quanto pensare si decide. Nelle API imposti un budget di token o un livello di sforzo (basso, medio, alto), e i modelli più recenti scelgono da soli di pensare poco sulle domande facili e molto su quelle difficili.

Più brutte insieme

Si può anche pensare in larghezza: dieci bozze in parallelo, poi si tiene o si combina la migliore. Costa dieci volte tanto, ma la latenza non cresce.

07
Output

La risposta nasce un token alla volta

Tutto quello che hai visto finora produce una cosa sola: un punteggio per ciascuno dei duecentomila token del vocabolario. Poi il ciclo ricomincia da capo, con un token in più in coda.

Analogia

Chi scrive così non ha una scaletta sul foglio: sceglie una sillaba, e quella sillaba vincola tutte le successive. In testa però qualche passo avanti lo vede: quello che scrive adesso prepara dove vuole arrivare.

Contesto
i token finora, prompt compreso
Forward pass
96 strati, una volta sola
Probabilità
un punteggio per ogni token possibile
Estrazione
se ne pesca uno, secondo la temperatura
↑ il token estratto entra in coda al contesto, e si ricomincia — finché non esce il token di stop
Primo token della risposta
def
0.71
Ecco
0.14
import
0.09
Certo
0.03
Temperatura

A 0 vince sempre il più probabile: ripetitivo ma stabile. Sopra 1 la classifica si appiattisce e il modello osa di più — e sbaglia di più. È qui che entra il caso. Attenzione però: anche a temperatura 0 le API possono dare risposte diverse. I conti in virgola mobile cambiano di un soffio a seconda di quante altre richieste girano insieme alla tua, e ogni tanto basta a cambiare il token vincente.

Prefill vs decode: il prompt intero si elabora in un colpo, in parallelo; la risposta no, un token per volta. Ecco perché costa molto meno leggere che scrivere.

Prompt caching: se l'inizio del prompt è identico a una richiesta di poco prima, il server riusa le chiavi e i valori già calcolati (la KV cache dello stadio 03). Quei token costano circa un decimo e il primo token arriva molto prima. Conviene mettere in testa le parti fisse e in coda quelle che cambiano.

50–200
token al secondo
≈ 200.000
candidati valutati per token
1 passata
su tutti gli strati, solo esperti accesi, per token
08
In esercizio

Contesto, strumenti, agenti

I pesi sono congelati dal giorno del rilascio. Tutto ciò che il modello «sa» della tua situazione sta nel contesto: una fila di token. Per lo più è testo, ma anche un'immagine o uno screenshot vengono tagliati in pezzi e trasformati in vettori, come le parole.

Analogia

Il contesto è la scrivania, non la memoria. Grande (200.000–1.000.000 di token: un paio di romanzi, o un repository medio), ma finita, e sgombrata a ogni conversazione nuova. Quello che non ci metti sopra, per il modello non esiste. E una scrivania grande non si guarda tutta con la stessa attenzione: più il contesto si allunga, più il modello fatica a usare quello che sta nel mezzo. Per questo gli agenti riassumono e compattano la cronologia, o delegano pezzi di lavoro a sotto-agenti con una scrivania pulita.

RAG

Portare le carte giuste

Si cercano i documenti pertinenti con una ricerca normale e si incollano nel prompt. Il modello non «consulta» niente: legge quello che gli hai messo davanti.

Tool use

Uscire dal testo

Il modello genera una chiamata strutturata invece della risposta. La esegue qualcun altro: il tuo codice, oppure il fornitore stesso per tool come la ricerca web o l'interprete. Il risultato torna nel contesto come nuovo testo. Il modello non esegue nulla da solo. Per collegare tool e dati esiste uno standard, MCP.

Agente

Il ciclo, molte volte

Nient'altro che quel ciclo ripetuto finché il compito non è chiuso, con gli esiti che si accumulano nel contesto. Tutta la difficoltà sta nel decidere quando fermarsi.

Pensa
«devo provare questa funzione»
Agisce
emette run_python(...)
Osserva
l'output torna nel contesto
↑ ripeti
09
Economia

Perché «più grande» funziona ancora

L'errore di previsione cala in modo regolare e prevedibile all'aumentare di calcolo, dati e parametri. È una legge empirica, non un teorema — ma finora non si è rotta, e su di essa si pianificano data center da miliardi.

GenerazioneParametriToken di addestramentoCalcoloOrdine di costo
2019≈ 10⁹≈ 10¹⁰≈ 10²¹10⁴ $
2020≈ 10¹¹≈ 3 · 10¹¹≈ 3 · 10²³10⁶–10⁷ $
2024≈ 10¹² (MoE)≈ 10¹³≈ 10²⁵10⁷–10⁸ $
Oggi≈ 10¹² (MoE)≈ 3 · 10¹³≈ 10²⁶10⁸–10⁹ $
Ordini di grandezza pubblici e stime: i laboratori non pubblicano più i numeri esatti. Regola pratica: il calcolo di pre-training è circa 6 × parametri attivi × token. In un MoE conta solo la parte accesa per ogni token, quindi con i valori medi dell'ultima riga si arriva a ≈ 2 · 10²⁵: i modelli più grandi usano più parametri attivi e più token, e a questo si somma una quota crescente di calcolo speso nel post-training con RL.
La brutta notizia

I guadagni sono logaritmici: serve dieci volte il calcolo per un miglioramento costante. Ogni gradino costa un ordine di grandezza in più del precedente.

Tre assi, non uno

Oggi si scalano tre cose: il pre-training, l'addestramento con RL (stadio 05, ormai con quote di calcolo simili al pre-training) e il pensiero al momento della domanda (stadio 06), che si paga a risposta invece che una volta sola. Il modello grande serve anche da maestro: i modelli piccoli ed economici vengono addestrati sulle sue risposte.

10
Chiarimenti

Quattro cose che non succedono

Quasi tutti gli equivoci sugli LLM nascono dall'immaginare, dentro la scatola, un pezzo di software che lì dentro non c'è.

Non c'è

Nessun database

Dentro non c'è nessun testo salvato: ci sono solo pesi. Quello che sembra ricordo è ricostruzione. Se ti serve una fonte, gliela devi passare tu.

Non c'è

Nessun apprendimento in chat

Correggerlo non lo cambia: i pesi sono congelati. La correzione vale solo finché resta nel contesto. La «memoria» dei prodotti è testo che qualcuno rimette nel prompt.

Non c'è

Nessun «non lo so» affidabile

Dentro il modello un segnale di incertezza c'è: un meccanismo che di default dice «non so» e si spegne quando riconosce l'argomento. Quando si spegne a torto, nasce un'allucinazione. Quel segnale però non arriva all'esterno in modo affidabile, e l'addestramento ha a lungo premiato chi tira a indovinare. Ne esce una risposta inventata fluida quanto una giusta.

Non c'è

Nessun piano scritto

Da nessuna parte c'è una scaletta esplicita: la risposta esce un token per volta. Dentro gli strati, però, il modello guarda avanti: prima di scrivere un verso sceglie già la parola in rima a cui arrivare. Il piano c'è, ma è implicito nei vettori e non si legge. Anche la bozza di ragionamento è testo, e non sempre dice quello che il modello fa davvero.

In una riga

Nessuna regola è stata scritta a mano.

Tutto quello che un modello di frontiera sa fare è la conseguenza di un unico esercizio ripetuto su scala industriale — indovinare il pezzo di testo successivo — più un addestramento che gli ha insegnato quali continuazioni valga la pena dare.

I numeri sono ordini di grandezza da fonti pubbliche e stime: i laboratori di frontiera non pubblicano le cifre esatte. Settembre 2026