Come funziona un LLM di frontiera
Dal testo che scrivi al testo che ricevi. Ogni stadio con l'analogia che serve a capirlo, il meccanismo reale sotto, e i numeri veri di un modello del 2026. Scritto per chi programma e non ha mai toccato il machine learning.
Un prompt solo attraversa tutto il diagramma. Ogni riquadro con la riga rossa racconta cosa gli succede in quello stadio.
«scrivi una funzione che valida un IBAN»
Il testo diventa numeri
Il modello non vede lettere e non vede parole. Vede pezzi di parola presi da un vocabolario fisso, deciso una volta per tutte prima dell'addestramento.
I caratteri mobili di una tipografia: una cassetta di centomila pezzi, sempre gli stessi. Qualsiasi testo del mondo va composto con quei pezzi lì — e i pezzi frequenti sono parole intere, quelli rari sono sillabe.
Ogni ID pesca una riga da una tabella gigantesca: la matrice degli embedding, ≈200.000 righe × ≈8.000 colonne.
Cento strati che annotano lo stesso vettore
Ogni token porta con sé un vettore che attraversa la pila di strati dal basso verso l'alto. Nessuno strato lo riscrive da zero: ognuno ci somma le proprie annotazioni.
Un fascicolo che passa in cento uffici. Ogni ufficio fa due cose: guarda gli altri fascicoli sul tavolo per capire il contesto (attenzione), poi ci scrive sopra quello che sa (MLP). Alla fine il fascicolo è lo stesso, ma è pieno di annotazioni.
In un modello denso circa due terzi dei pesi sono negli MLP; in un MoE, dove l'MLP è un banco di esperti, si supera il 90%. Sono loro il magazzino delle conoscenze. L'attenzione è il meccanismo che decide cosa cercare nel magazzino.
Nei modelli di frontiera l'MLP è un banco di esperti: per ogni token se ne accendono 4 o 8 su centinaia. Un trilione di parametri sulla carta, qualche decina di miliardi effettivamente usati per token.
Attenzione: ogni token interroga il passato
È l'unico punto in cui i token si parlano. Tutto il resto della rete lavora su un token per volta, isolato.
Una query su una tabella. Ogni token emette una query («sto cercando il verbo a cui mi riferisco»); ogni token precedente espone una chiave («io sono un verbo»). Il grado di somiglianza fra query e chiave decide quanta parte del valore di quel token viene copiata dentro il mio. Un JOIN pesato, ricalcolato a ogni strato.
Il conto qui sopra non si fa una volta: si fa 64–128 volte in parallelo, con domande diverse. Una testa cerca il soggetto, una tiene il conto delle parentesi aperte, una segue chi ha detto cosa.
Chiavi e valori dei token già visti si tengono in memoria e non si ricalcolano. Senza cache, ogni token nuovo costringerebbe a rileggere da capo tutto il testo; con la cache calcola solo sé stesso. Resta comunque una passata su tutti gli strati per ogni token: per questo scrivere costa più che leggere (stadio 07). E un contesto lungo occupa gigabyte di VRAM.
Guardare tutto il passato costa: raddoppi il testo, quadruplichi il calcolo. Per questo i modelli recenti risparmiano. Molte teste condividono le stesse chiavi, chiavi e valori si salvano compressi, alcuni strati guardano solo gli ultimi token o una memoria riassunta, e solo pochi consultano l'intero contesto.
Pre-training: leggere tutto, coprendo la parola dopo
Un solo esercizio, ripetuto per mesi: prendi un pezzo di testo, nascondi il token successivo, prova a indovinarlo, guarda la risposta, correggi un pochino tutti i pesi. Nessuna regola grammaticale, nessun fatto inserito a mano.
Un apprendista chiuso in biblioteca con la biblioteca intera e un solo compito. Per imparare davvero a indovinare la parola dopo — in un giallo, in un teorema, in uno stack trace — è costretto a costruirsi per conto suo la grammatica, l'aritmetica e un modello del mondo. Le capacità sono un effetto collaterale dell'esercizio.
pagine filtrate e deduplicate
repo pubbliche
generato e filtrato da altri modelli
testo lungo e curato
multilingua, dialoghi, dati
Post-training: da testo plausibile a interlocutore utile
Il modello base sa già quasi tutto quello che saprà mai. Il post-training non aggiunge conoscenza: sceglie, fra le mille continuazioni plausibili, quella che vale la pena dare.
L'apprendista esce dalla biblioteca ed entra in bottega. Prima gli si mostra come si lavora (SFT), poi il maestro giudica due lavori e dice quale è migliore (RLHF), infine lo si mette davanti a compiti che si correggono da soli — il pezzo entra o non entra nella sede (RLVR).
Gli si mostra la forma
Da 10.000 a qualche milione di conversazioni esemplari: domanda e risposta modello. Oggi la maggior parte la genera un modello più grande o già addestrato, e un altro modello o un verificatore la filtra; gli umani scrivono i casi difficili e controllano la qualità. Stesso identico esercizio del pre-training, su dati diversissimi.
Risolve: ora risponde invece di continuare.
Gli si dice quale è meglio
Due risposte, un umano sceglie. Con abbastanza scelte si addestra un secondo modello a dare un voto, e il primo viene spinto verso i voti alti.
Risolve: tono, sicurezza, rifiuti. Rischio: impara a piacere, non ad aver ragione.
Ci pensa la realtà
Compiti con risposta controllabile da una macchina: i test passano? la dimostrazione regge? Il premio lo calcola una macchina, quindi si può girare su milioni di compiti senza umani. Il verificatore va progettato con la stessa cura del compito.
Risolve: è quello che ha fatto esplodere codice, matematica e ragionamento lungo. Rischio: impara a far passare il controllo invece di fare il lavoro, per esempio ritoccando i test.
Oggi chi sceglie fra due risposte è spesso un altro modello. Gli si dà un elenco di principi o una rubrica («la risposta cita la fonte? rispetta il formato?») e giudica milioni di coppie. È così che l'RL arriva ai compiti senza una risposta verificabile: scrittura, consigli, sicurezza. Due scorciatoie, DPO e GRPO, hanno poi reso il ciclo più semplice ed economico: la prima impara direttamente dalle coppie senza il modello che dà i voti, la seconda confronta fra loro più tentativi sulla stessa domanda.
L'ultima evoluzione dell'RLVR: invece di un esercizio, un ambiente. Il modello riceve un repository, un terminale e un obiettivo, lavora per cento passi e alla fine si controlla se il bug è davvero sparito. Si premia l'intero percorso, così impara a usare gli strumenti, a verificare e a non arrendersi. Sono gli agenti dello stadio 08.
Ragionare vuol dire spendere token
Non c'è un modulo logico in più. C'è lo stesso meccanismo di prima, addestrato con RLVR a scrivere una lunga bozza prima di rispondere — e la bozza, rientrando nel contesto, diventa il supporto su cui il calcolo si appoggia.
Il foglio di brutta. Un modello senza brutta deve dare il risultato di getto, con una quantità di calcolo fissa. Un modello che scrive la brutta può tornarci sopra, accorgersi dell'errore e correggersi: ogni riga scritta è calcolo in più che si porta dietro.
IBAN: 2 lettere paese, 2 cifre di controllo, poi il BBAN.
Validazione: sposto i primi 4 caratteri in fondo, converto le lettere in numeri (A=10 … Z=35), mod 97 deve dare 1.
Attenzione: la lunghezza cambia per paese — serve una tabella.
Rifaccio il conto sulle lettere: A=10, quindi IT → 18, 29. Sì.
</pensiero>
Quanto pensare si decide. Nelle API imposti un budget di token o un livello di sforzo (basso, medio, alto), e i modelli più recenti scelgono da soli di pensare poco sulle domande facili e molto su quelle difficili.
Si può anche pensare in larghezza: dieci bozze in parallelo, poi si tiene o si combina la migliore. Costa dieci volte tanto, ma la latenza non cresce.
La risposta nasce un token alla volta
Tutto quello che hai visto finora produce una cosa sola: un punteggio per ciascuno dei duecentomila token del vocabolario. Poi il ciclo ricomincia da capo, con un token in più in coda.
Chi scrive così non ha una scaletta sul foglio: sceglie una sillaba, e quella sillaba vincola tutte le successive. In testa però qualche passo avanti lo vede: quello che scrive adesso prepara dove vuole arrivare.
A 0 vince sempre il più probabile: ripetitivo ma stabile. Sopra 1 la classifica si appiattisce e il modello osa di più — e sbaglia di più. È qui che entra il caso. Attenzione però: anche a temperatura 0 le API possono dare risposte diverse. I conti in virgola mobile cambiano di un soffio a seconda di quante altre richieste girano insieme alla tua, e ogni tanto basta a cambiare il token vincente.
Prefill vs decode: il prompt intero si elabora in un colpo, in parallelo; la risposta no, un token per volta. Ecco perché costa molto meno leggere che scrivere.
Prompt caching: se l'inizio del prompt è identico a una richiesta di poco prima, il server riusa le chiavi e i valori già calcolati (la KV cache dello stadio 03). Quei token costano circa un decimo e il primo token arriva molto prima. Conviene mettere in testa le parti fisse e in coda quelle che cambiano.
Contesto, strumenti, agenti
I pesi sono congelati dal giorno del rilascio. Tutto ciò che il modello «sa» della tua situazione sta nel contesto: una fila di token. Per lo più è testo, ma anche un'immagine o uno screenshot vengono tagliati in pezzi e trasformati in vettori, come le parole.
Il contesto è la scrivania, non la memoria. Grande (200.000–1.000.000 di token: un paio di romanzi, o un repository medio), ma finita, e sgombrata a ogni conversazione nuova. Quello che non ci metti sopra, per il modello non esiste. E una scrivania grande non si guarda tutta con la stessa attenzione: più il contesto si allunga, più il modello fatica a usare quello che sta nel mezzo. Per questo gli agenti riassumono e compattano la cronologia, o delegano pezzi di lavoro a sotto-agenti con una scrivania pulita.
Portare le carte giuste
Si cercano i documenti pertinenti con una ricerca normale e si incollano nel prompt. Il modello non «consulta» niente: legge quello che gli hai messo davanti.
Uscire dal testo
Il modello genera una chiamata strutturata invece della risposta. La esegue qualcun altro: il tuo codice, oppure il fornitore stesso per tool come la ricerca web o l'interprete. Il risultato torna nel contesto come nuovo testo. Il modello non esegue nulla da solo. Per collegare tool e dati esiste uno standard, MCP.
Il ciclo, molte volte
Nient'altro che quel ciclo ripetuto finché il compito non è chiuso, con gli esiti che si accumulano nel contesto. Tutta la difficoltà sta nel decidere quando fermarsi.
Perché «più grande» funziona ancora
L'errore di previsione cala in modo regolare e prevedibile all'aumentare di calcolo, dati e parametri. È una legge empirica, non un teorema — ma finora non si è rotta, e su di essa si pianificano data center da miliardi.
| Generazione | Parametri | Token di addestramento | Calcolo | Ordine di costo |
|---|---|---|---|---|
| 2019 | ≈ 10⁹ | ≈ 10¹⁰ | ≈ 10²¹ | 10⁴ $ |
| 2020 | ≈ 10¹¹ | ≈ 3 · 10¹¹ | ≈ 3 · 10²³ | 10⁶–10⁷ $ |
| 2024 | ≈ 10¹² (MoE) | ≈ 10¹³ | ≈ 10²⁵ | 10⁷–10⁸ $ |
| Oggi | ≈ 10¹² (MoE) | ≈ 3 · 10¹³ | ≈ 10²⁶ | 10⁸–10⁹ $ |
I guadagni sono logaritmici: serve dieci volte il calcolo per un miglioramento costante. Ogni gradino costa un ordine di grandezza in più del precedente.
Oggi si scalano tre cose: il pre-training, l'addestramento con RL (stadio 05, ormai con quote di calcolo simili al pre-training) e il pensiero al momento della domanda (stadio 06), che si paga a risposta invece che una volta sola. Il modello grande serve anche da maestro: i modelli piccoli ed economici vengono addestrati sulle sue risposte.
Quattro cose che non succedono
Quasi tutti gli equivoci sugli LLM nascono dall'immaginare, dentro la scatola, un pezzo di software che lì dentro non c'è.
Nessun database
Dentro non c'è nessun testo salvato: ci sono solo pesi. Quello che sembra ricordo è ricostruzione. Se ti serve una fonte, gliela devi passare tu.
Nessun apprendimento in chat
Correggerlo non lo cambia: i pesi sono congelati. La correzione vale solo finché resta nel contesto. La «memoria» dei prodotti è testo che qualcuno rimette nel prompt.
Nessun «non lo so» affidabile
Dentro il modello un segnale di incertezza c'è: un meccanismo che di default dice «non so» e si spegne quando riconosce l'argomento. Quando si spegne a torto, nasce un'allucinazione. Quel segnale però non arriva all'esterno in modo affidabile, e l'addestramento ha a lungo premiato chi tira a indovinare. Ne esce una risposta inventata fluida quanto una giusta.
Nessun piano scritto
Da nessuna parte c'è una scaletta esplicita: la risposta esce un token per volta. Dentro gli strati, però, il modello guarda avanti: prima di scrivere un verso sceglie già la parola in rima a cui arrivare. Il piano c'è, ma è implicito nei vettori e non si legge. Anche la bozza di ragionamento è testo, e non sempre dice quello che il modello fa davvero.
Nessuna regola è stata scritta a mano.
Tutto quello che un modello di frontiera sa fare è la conseguenza di un unico esercizio ripetuto su scala industriale — indovinare il pezzo di testo successivo — più un addestramento che gli ha insegnato quali continuazioni valga la pena dare.