Come funziona l'IA Addestrare un modello
Diagramma tecnico Diciannove stadi · Settembre 2026

Addestrare un modello, dall'inizio alla fine

Due imprese a confronto, stadio per stadio: un modello piccolo che una persona sola può portare a termine in una settimana, e un addestramento di frontiera che impegna un'organizzazione per un anno. Gli stessi diciannove passaggi, con numeri diversi di sei ordini di grandezza.

I due soggetti
Semplice — 0,5 G parametri, 100 G token, 8 schede, 3 giorni
Frontiera — MoE da migliaia di G (~450 G attivi), ~35 T token, ~100.000 schede, 70 giorni

Il riquadro rosso di ogni stadio segnala il dettaglio che, se trascurato, fa fallire il progetto.

01
Premessa

Stesso procedimento, due mestieri diversi

I passaggi sono identici e l'ordine anche. Ciò che cambia è che nel progetto piccolo ogni stadio è una scelta reversibile, mentre in quello grande ogni stadio è un impegno irrevocabile di milioni di euro deciso con settimane di anticipo.

SempliceFrontiera
Parametri0,5 G densimigliaia di G totali, ~450 G attivi
Token di addestramento100 G~35 T
Operazioni3 · 10²⁰~10²⁶
Schede8, un solo nodo~100.000, migliaia di nodi
Durata dell'addestramento3 giorni~70 giorni
Durata del progetto2 settimane12-18 mesi
Persone1alcune centinaia
Costo di un erroresi ricomincia domanisettimane e milioni
Il conto delle operazioni: 6 × parametri attivi × token. Semplice: 6 × 0,5·10⁹ × 10¹¹ = 3·10²⁰. Frontiera: 6 × 4,5·10¹¹ × 3,5·10¹³ ≈ 10²⁶. In entrambi i casi ogni scheda rende circa 150 TFLOP/s effettivi: 8 schede per 3 giorni, o 100.000 per 70.
La differenza culturale

Chi addestra il modello piccolo prova, sbaglia, riprova. Chi addestra quello di frontiera non può: la corsa finale si fa una volta sola. Tutto il lavoro preparatorio serve a poter prevedere, con modelli mille volte più piccoli, cosa succederà in quella corsa.

Dove va il tempo

In entrambi i casi, l'addestramento vero è la parte più breve. Nel progetto piccolo tre giorni su due settimane; in quello grande due mesi su un anno e mezzo. Il resto sono dati, esperimenti preliminari, infrastruttura e valutazione.

02
Dati

Raccogliere: il collo di bottiglia vero

Alla frontiera il testo pubblico di alta qualità è una risorsa che si sta esaurendo. Da qualche anno la crescita non viene più da nuove pagine raccolte ma da dati acquisiti sotto licenza e da dati generati apposta.

Semplice

Si parte da un corpus pubblico già filtrato e pronto: qualche terabyte scaricabile, licenza chiara, lavoro di preparazione già fatto da altri. Un pomeriggio di download. Il valore aggiunto sta semmai nell'aggiungere un dominio proprio.

Frontiera

Crawl proprio su decine di miliardi di pagine · accordi di licenza con editori e archivi · digitalizzazione di materiale non online · dati generati da modelli precedenti e filtrati, soprattutto riscritture: un modello riformula documenti esistenti in più stili, e un testo buono diventa dieci varianti invece di essere ripetuto dieci volte · trascrizioni, codice, dati strutturati. Un lavoro continuo, con una squadra dedicata e contratti.

Ordini di grandezza del testo disponibile
Crawl web grezzo
~100 T
Dopo filtri e deduplicazione
~15 T
Tutti i libri mai pubblicati
~5 T
Codice pubblico
~3 T
Wikipedia, tutte le lingue
~30 G
Stime aperte, in token. La riga più istruttiva è l'ultima: l'enciclopedia intera è circa un millesimo di un addestramento di frontiera. La qualità della fonte conta, ma il volume viene per forza da altrove.
03
Dati

La pipeline di pulizia, passaggio per passaggio

È la fase in cui si guadagna più qualità per euro speso. Nei confronti pubblicati, un miglioramento del filtro vale più di un raddoppio dei parametri: sette filtri in sequenza, ognuno con la sua soglia da tarare.

#
Passaggio
Come funziona
Scarta
1
Estrazione del testo
via menu, pubblicità, boilerplate; si tiene il contenuto principale
~60%
2
Lingua
classificatore veloce, soglia di confidenza per lingua
variabile
3
Euristiche di forma
lunghezza media delle righe, rapporto fra simboli e lettere, righe duplicate dentro il documento, presenza di punteggiatura finale
~15%
4
Deduplicazione
esatta per hash, poi approssimata: si riassume ogni documento in poche firme e si confrontano solo i documenti che finiscono nello stesso secchio
~40%
5
Classificatore di qualità
un modellino addestrato a distinguere testo curato da testo qualsiasi; si tiene la parte alta del punteggio
~50%
6
Sicurezza e dati personali
rimozione di contenuti vietati, oscuramento di identificativi e recapiti
pochi %
7
Decontaminazione
si tolgono i documenti che condividono lunghe sequenze con i test di valutazione
< 1%
Da 100 T di partenza a 10-15 T utilizzabili: circa l'85% viene buttato. La deduplicazione da sola migliora la qualità in modo netto — il testo ripetuto viene memorizzato invece che appreso, e a parità di calcolo peggiora la generalizzazione.
Il costo computazionale della pulizia

Non è trascurabile: elaborare 100 T di token con sette filtri, di cui uno è un modello neurale, richiede migliaia di macchine per settimane. Nei bilanci dei laboratori la preparazione dei dati vale una frazione a due cifre del costo totale.

Perché la decontaminazione è delicata

Se un test di valutazione è finito nei dati, il punteggio è privo di significato — e la contaminazione entra per vie indirette: qualcuno che ha discusso quel test in un forum, un articolo che ne cita gli esempi. Va fatta con soglie generose e ricontrollata alla fine.

04
Dati

Il mix e l'ordine in cui si legge

Avere i dati non basta: bisogna decidere in che proporzione e in che ordine darli. Sono due leve distinte, e la seconda è quella che i team hanno imparato a usare più di recente.

Le proporzioni

Le fonti non si usano nella proporzione in cui esistono. Le migliori si ripetono più volte, quelle abbondanti si campionano. Il codice riceve una quota molto superiore al suo peso naturale, perché migliora il ragionamento anche fuori dal codice.

Ripetere una fonte fino a 4 volte non danneggia. Oltre, il modello inizia a memorizzarla.

L'ordine

Il mix non resta fisso. Nella fase finale — l'ultimo 10-20% dei token, mentre il passo di apprendimento cala — si passa a un mix molto più selezionato: manuali, testi tecnici, esercizi svolti, dati sintetici curati. Oggi questa coda ha un nome, mid-training, e un compito preciso: preparare il modello al post-training. Si aggiungono ragionamenti passo passo generati da modelli precedenti, esempi di uso di strumenti, documenti lunghi. Un modello base che ha già visto catene di ragionamento trae molto di più dal rinforzo dello stadio 17.

Quella coda finale sposta i punteggi in modo sproporzionato rispetto ai token che contiene.

Come cambia il mix nel corso dell'addestramento — schema tipico
Fase iniziale
80% dei token
web
codice
libri
altro
Fase finale
ultimo 20%
web
codice
tecnico
sintetico curato, esercizi, matematica
05
Dati

Addestrare il tokenizer: la scelta irreversibile

Si fa una volta, prima di tutto, su un campione dei dati finali. Cambiarlo dopo significa buttare via l'addestramento: gli embedding sono legati agli indici del vocabolario e non hanno senso con un vocabolario diverso.

Semplice

Si riusa il tokenizer di un modello aperto esistente. Nessun lavoro, nessun rischio, e compatibilità con gli strumenti già in giro. Vocabolario 32.000-150.000, a seconda del modello da cui si prende. Attenzione: su 0,5 G un vocabolario grande occupa fino a un terzo dei parametri solo negli embedding, e per questo i modelli piccoli condividono la matrice d'ingresso con quella d'uscita.

Frontiera

Addestrato apposta su un campione rappresentativo del mix definitivo, con quote di lingue decise a mano perché una lingua sottorappresentata nel campione avrà token peggiori per sempre. Vocabolario 128.000-256.000.

Le decisioni che si prendono una volta sola
Dimensione del vocabolario
più grande = sequenze più corte e meno calcolo per testo, ma matrici di ingresso e uscita più pesanti e token rari poco allenati
Trattamento delle cifre
spezzare i numeri cifra per cifra migliora sensibilmente l'aritmetica, al prezzo di sequenze più lunghe
Spazi e indentazione
token dedicati alle sequenze di spazi: senza, il codice Python costa il doppio dei token
Token speciali
fine documento, delimitatori di conversazione, marcatori per gli strumenti. Vanno riservati adesso, anche se serviranno solo nel post-training
06
Dati

Impacchettare: che le schede non aspettino mai

I documenti hanno lunghezze diverse, il modello vuole sequenze di lunghezza fissa. Come si risolve questa discrepanza determina quanta capacità si spreca — e, in un caso, quanti errori sottili si introducono.

Riempire con vuoto

Semplice, sprecone

Un documento per sequenza, il resto riempito con token neutri e mascherato. Se i documenti sono corti si butta il 40-60% del calcolo.

Concatenare

Nessuno spreco

Si incollano i documenti uno dopo l'altro separati da un marcatore, e si taglia ogni 8192 token. Zero riempimento, ma i documenti finiscono spezzati a metà e mescolati.

Concatenare + isolare

Quello che si fa

Come sopra, ma la maschera di attenzione impedisce a un documento di guardare quello precedente nella stessa sequenza. Costa poco e toglie una fonte di rumore.

Il formato su disco

I dati si tokenizzano una volta sola, prima di iniziare, e si scrivono come sequenza binaria di interi a 16 o 32 bit in file grandi e contigui. Tokenizzare durante l'addestramento è un errore classico: la CPU non sta dietro alle schede e il cluster resta fermo ad aspettare.

Il mescolamento

L'ordine deve essere casuale ma riproducibile: si genera una permutazione deterministica da un seme, così che dopo un guasto si riprenda esattamente dagli stessi dati. Un dataloader non riproducibile rende impossibile capire cosa è successo quando qualcosa va storto.

~140 TB
35 T token a 4 byte: oltre 65.536 voci di vocabolario, 16 bit non bastano
~25 MB/s
token letti da 100.000 schede: poca cosa, la banda serve ai checkpoint
1 epoca
alla frontiera si passa sui dati quasi una volta sola
07
Progetto

Quanti parametri, quanti token

Dato un budget di calcolo fisso, esiste una ripartizione ottimale fra dimensione del modello e quantità di dati. Ma «ottimale» rispetto a cosa: al costo di addestramento, o al costo di tutta la vita del modello?

Ottimale per addestrare
≈ 20 token per parametro

Con un budget C, la loss più bassa si ottiene con N ≈ √(C/120) e D ≈ 20N. Un modello da 8 G vorrebbe 160 G di token, non 15.000.

Ottimale per usarlo
da centinaia a decine di migliaia di token per parametro

Se il modello servirà miliardi di richieste, conviene un modello più piccolo addestrato molto più a lungo: costa di più una volta, e meno per sempre. Un 8 G su 15 T ne vede ~2.000; un 0,6 G su 36 T ne vede ~60.000.

Tutti i modelli piccoli recenti sono deliberatamente sovra-addestrati rispetto all'ottimo teorico, per questa ragione. La legge non è stata smentita: è stata cambiata la funzione da minimizzare.
Come si decide, in pratica

Si addestrano sei-dieci modelli piccoli, da 50 M a 1 G, con budget crescenti. Si traccia la loss in funzione del calcolo e si adatta una legge di potenza. Quella curva, estrapolata, predice la loss del modello grande con un errore di pochi punti percentuali — ed è su quella previsione che si firma l'investimento.

La forma, non solo la taglia

A parità di parametri si sceglie il rapporto fra larghezza e profondità (in pratica d/strati attorno a 100-150), il numero di teste, quante teste condividono chiavi e valori, e — nei modelli a esperti — quanti esperti e quanti se ne accendono. Ognuna di queste è decisa con esperimenti su scala ridotta.

08
Progetto

Inizializzazione: da dove si parte

Mezzo miliardo di numeri casuali nel progetto piccolo, migliaia di miliardi in quello grande: ma non numeri casuali qualsiasi. La scala iniziale determina se le attivazioni crescono o si spengono salendo di strato, e uno sbaglio qui si manifesta come divergenza nelle prime migliaia di passi.

Regola di base
deviazione standard proporzionale a 1/√(dimensione d'ingresso): così la varianza del segnale resta costante attraversando lo strato
Correzione per la profondità
le proiezioni di uscita di ogni blocco si riducono ulteriormente di 1/√(2·strati), perché ogni blocco somma al flusso residuo e con 100 blocchi la somma esploderebbe
Parametrizzazione trasferibile
scalando in modo opportuno inizializzazione e passo di apprendimento con la larghezza (e, con varianti più recenti, con la profondità), gli iperparametri migliori sul piccolo restano buoni sul grande. Ciò che non si trasferisce, come batch e passo al variare dei token, si estrapola con leggi di scala apposite, misurate sui modelli pilota
L'ultima riga è una delle idee che hanno cambiato la pratica: senza, la taratura degli iperparametri su un modello di frontiera sarebbe un tentativo unico e alla cieca.
09
Ciclo

Un singolo passo di addestramento, per intero

Questo è il ciclo che si ripete da centinaia di migliaia a milioni di volte. Ogni riga corrisponde a millisecondi contati, e ottimizzare una sola di queste righe del 10% vale giorni di cluster.

#
Operazione
Dove avviene
Quota di tempo
1
Il dataloader consegna il micro-batch già tokenizzato
CPU, in anticipo
0% se fatto bene
2
Passaggio in avanti, salvando i punti di ripresa
schede
~25%
3
Passaggio all'indietro, ricalcolando le attivazioni non conservate
schede
~55%
4
Si ripete da 2 per ogni micro-batch, accumulando i gradienti
schede
× n
5
Media dei gradienti fra tutte le schede
rete
~15%, in parte sovrapposto
6
Si misura la norma globale del gradiente e, se supera la soglia, si riscala tutto
schede
< 1%
7
Aggiornamento dei pesi e degli stati dell'ottimizzatore (due con Adam, uno con Muon)
schede
~5%
Semplice

Batch da ~500.000 token · 200.000 passi in tre giorni · circa 1,3 secondi a passo · la comunicazione è solo fra 8 schede dello stesso server, quindi quasi gratis.

Frontiera

Batch da 16-64 milioni di token · da mezzo milione a due milioni di passi sui 35 T · 3-11 secondi a passo · la media dei gradienti coinvolge decine di migliaia di schede e va sovrapposta al calcolo, altrimenti domina.

10
Ciclo

Gli iperparametri, con i valori

Una decina di numeri, quasi tutti convergenti su valori standard di fatto. Il punto non è inventarli: è sapere quali si possono copiare e quali vanno tarati per il proprio caso.

ParametroValore tipicoCosa succede se sbagli
Passo di apprendimento massimo3·10⁻⁴ sul piccolo, 10⁻⁴ o meno sul grandetroppo alto: diverge. Troppo basso: spreco
Riscaldamento2.000 passi, o 1% del totalesenza, i primi passi distruggono l'inizializzazione
Andamento del passooggi soprattutto stabile a lungo, poi discesa rapida quasi a zero, in coincidenza con il mix finale; in alternativa cosenola discesa finale vale molti punti di loss, e col tratto stabile si decide quando fermarsi senza ripartire da capo
OttimizzatoreAdamW (β₁ 0,9 · β₂ 0,95 · ε 10⁻⁸), oppure Muon per le matrici e AdamW per embedding e normecon AdamW, β₂ a 0,999 è più instabile sui testi. Muon rende «ortogonale» ogni aggiornamento di matrice e tiene un solo stato per parametro invece di due: circa metà del calcolo per la stessa loss nei rapporti pubblicati, ma richiede un controllo sui logit dell'attenzione (stadio 14). Dal 2025 diversi modelli di frontiera a pesi aperti sono addestrati così
Decadimento dei pesi0,1 · escluse norme ed embeddingapplicarlo alle norme peggiora e basta
Taglio del gradientenorma globale a 1,0senza, un batch anomalo può rovinare la corsa
Dimensione del batch0,5 M token sul piccolo, 16-64 M sul grande, in crescitatroppo grande all'inizio: si spreca calcolo
Lunghezza di sequenza4-8 k, estesa a 128 k in codapartire lunghi costa e non serve
Perché il batch cresce nel tempo

All'inizio il gradiente è enorme e anche pochi esempi indicano la direzione giusta. Verso la fine il segnale è sottile e serve mediarne molti per distinguerlo dal rumore. Si parte da qualche milione di token e si arriva a decine di milioni in modo graduale.

Il contesto lungo si aggiunge dopo

Addestrare tutto a 128 k sarebbe assurdo: l'attenzione cresce col quadrato. Si addestra a 4-8 k per il 95% dei token, poi si scalano le frequenze delle rotazioni posizionali e si continua per un breve tratto su documenti lunghi. Il contesto esteso costa pochi punti percentuali del totale.

11
Sistemi

Cinque assi di parallelismo, insieme

Su un cluster grande si usano tutti e cinque contemporaneamente, e il numero di schede è il loro prodotto. La disposizione non è libera: ogni asse va collocato dove la rete è abbastanza veloce da reggerlo.

schede totali = dati × tensore × pipeline × contesto × esperti

Esempio su 16.384 schede: 256 repliche di dati × 8 tensore × 8 pipeline. Ogni asse ha il suo schema di comunicazione e il suo posto nella gerarchia di rete.

Asse
Cosa si divide · cosa si comunica
Dove si colloca
Dati
ogni replica vede batch diversi · si mediano i gradienti una volta per passo
l'asse più esterno, fra server
Tensore
ogni matrice tagliata a fette · due sincronizzazioni per ogni strato
solo dentro il dominio veloce: 8 schede in un server, fino a 72 in un rack recente. Nei modelli a esperti spesso si rinuncia a questo asse
Pipeline
gruppi di strati su gruppi di schede · si passa solo l'attivazione al confine
fra server, traffico minimo
Contesto
la sequenza divisa fra schede · scambio di chiavi e valori nell'attenzione
serve solo per contesti molto lunghi
Esperti
esperti diversi su schede diverse · ogni token spedito e riportato indietro, a ogni strato
il più esigente in banda
La bolla della pipeline

All'inizio e alla fine di ogni passo, parte delle schede è ferma perché aspetta il tratto precedente. La frazione sprecata è circa (P−1)/(m+P−1) con P stadi e m micro-batch: con 8 stadi e 8 micro-batch è il 47%, con 64 micro-batch scende al 10%. È il motivo per cui i micro-batch devono essere molti.

Spezzare anche l'ottimizzatore

Gli stati dell'ottimizzatore, i gradienti e persino i pesi possono essere distribuiti fra le repliche di dati invece che replicati: ognuna custodisce una fetta e la ricompone al volo quando serve. Si scambia memoria con comunicazione, in tre livelli di aggressività crescente.

12
Sistemi

Precisione mista: cosa resta in alta precisione

Non tutto si può fare a 16 bit, e ancora meno a 8. La regola è: le moltiplicazioni di matrici in bassa precisione, le somme lunghe e gli aggiornamenti in alta.

Operazione
Perché
Precisione
Moltiplicazioni di matrici
è il 95% del calcolo, ed è dove i circuiti dedicati danno il massimo
bf16 o fp8
Accumulo dentro la moltiplicazione
migliaia di somme in fila: a bassa precisione l'errore si accumula
fp32
Normalizzazioni e softmax
esponenziali e divisioni, sensibili agli estremi
fp32
Aggiornamento dei pesi
l'aggiornamento è 10⁻³-10⁻⁵ del peso, sotto la risoluzione di bf16 (circa 4 parti su mille): in bf16 sparirebbe nell'arrotondamento
fp32, copia master
Media dei gradienti fra schede
somma di decine di migliaia di termini
fp32 o bf16 con accumulo alto
La quarta riga è quella che sorprende chi arriva da altri campi: se si tenessero i pesi solo in bassa precisione, la maggior parte degli aggiornamenti verrebbe arrotondata a zero e l'addestramento si fermerebbe silenziosamente.
Come si usa fp8 senza rompere tutto

Otto bit hanno un intervallo strettissimo. Si tiene un fattore di scala per ogni piccolo blocco di valori (32-128 elementi), calcolato al momento sul massimo del blocco: un valore anomalo rovina solo il suo blocco, non l'intero tensore. Le schede più recenti fanno questa scalatura in hardware (formati MX). È la grana fine che ha reso stabile fp8 alla frontiera.

Il guadagno reale

Passare da bf16 a fp8 sulle moltiplicazioni dà, nella pratica, un 30-50% di throughput in più — non il doppio, perché il resto del passo non accelera. Su un addestramento da due mesi sono tre settimane risparmiate.

E a 4 bit?

Sulle schede più recenti si addestra anche a 4 bit: un modello da 12 G è stato portato a 10 T token restando vicino a fp8. Servono però blocchi di 16 valori con la loro scala, arrotondamento casuale sui gradienti, e una parte degli strati lasciata a 16 bit. È la frontiera attuale, non ancora la pratica corrente.

13
Sistemi

Il cluster si rompe, e va messo in conto

Con decine di migliaia di componenti e due mesi di corsa, la domanda non è se qualcosa si romperà. L'addestramento è sincrono: una scheda che cade ferma tutte le altre.

Semplice

Otto schede per tre giorni: la probabilità di un guasto è bassa. Si salva ogni mille passi per prudenza, il salvataggio pesa 8 GB e dura secondi. Se cade, si riparte a mano.

Frontiera

In un addestramento documentato su 16.000 schede si sono registrate oltre 400 interruzioni impreviste in 54 giorni — circa una ogni tre ore — per tre quarti dovute a guasti hardware. Il tempo effettivamente produttivo si è mantenuto attorno al 90% solo grazie all'automazione della ripresa. Scalato a 100.000 schede, lo stesso tasso dà un'interruzione ogni 30 minuti circa: la ripresa deve durare pochi minuti, non ore.

Cosa serve perché una ripresa sia indolore
Salvataggio frequente
ogni 15-30 minuti. Contiene pesi, stati dell'ottimizzatore e posizione nel flusso di dati: circa 16 byte per parametro (qualcuno in meno con Muon), quindi decine di TB per un modello grande
Scrittura asincrona
si copia in memoria locale e si scrive su disco mentre l'addestramento prosegue, altrimenti il salvataggio da solo costerebbe ore al giorno
Checkpoint in memoria
una copia dello stato resta nella RAM dei nodi vicini: si riparte in secondi, e il disco serve solo di rado
Diagnosi automatica
individuare quale nodo è caduto, escluderlo, sostituirlo con una riserva calda e riavviare senza intervento umano — di notte, mille volte
Guasti silenziosi
una scheda può sbagliare un calcolo senza dare errore. Si scoprono solo con verifiche periodiche: si ripete un calcolo noto, si confrontano le repliche
Riproducibilità del flusso dati
alla ripresa si devono rileggere esattamente gli stessi dati che si sarebbero letti: senza, alcuni token vengono visti due volte e altri mai
14
Corsa

Cosa si guarda, ogni ora, per due mesi

Un addestramento lungo si sorveglia come un impianto. Quattro grandezze bastano a diagnosticare quasi tutto, e riconoscere per tempo un'anomalia è la differenza fra perdere un'ora e perdere due settimane.

La loss

Deve scendere in modo regolare, quasi una retta in scala logaritmica. Uno scalino verso l'alto è un picco; un appiattimento precoce significa passo di apprendimento troppo basso o dati esauriti.

La norma del gradiente

È l'indicatore che anticipa i guai: sale prima che la loss se ne accorga. Se comincia a oscillare in modo anomalo, il problema è già in corso.

Il rendimento effettivo

Token al secondo per scheda. Un calo improvviso senza cambiamenti al codice indica un nodo lento, una rete degradata o un disco che non tiene il passo.

Valutazioni continue

Perplexity su corpora di controllo mai visti, per dominio e per lingua. È qui che si vede se una fonte è sparita dal mix o se una lingua sta regredendo.

I picchi di loss, e cosa si fa

Sono la patologia caratteristica: la loss salta improvvisamente e o rientra da sola, o resta alta per sempre. Le cause sono un batch anomalo, un'instabilità numerica, o la divergenza dei valori interni della softmax.

La procedura standard: tornare al salvataggio precedente, saltare i batch incriminati, e ripartire con il passo di apprendimento leggermente ridotto. Come prevenzione si usa un termine aggiuntivo che scoraggia i valori interni della softmax dall'allontanarsi da zero — costa quasi nulla e riduce nettamente la frequenza dei picchi. Per l'attenzione si normalizzano query e chiavi prima del prodotto, o si riducono i pesi che le producono quando i punteggi superano una soglia: con questo accorgimento un modello da mille G è stato addestrato su 15 T token senza un solo picco.

15
Corsa

Valutare un modello base

Un modello base non risponde a domande: continua testi. Va misurato di conseguenza, e i benchmark pubblici vanno trattati con più diffidenza di quanta se ne usi di solito.

Perplexity di controllo
su testi mai visti, separati per dominio e lingua. Sensibile, continua, difficile da falsare
ogni ora
Prove a scelta multipla
conoscenza, ragionamento, comprensione. Comode e comparabili, ma sature e vulnerabili alla contaminazione
a checkpoint
Prove verificabili
problemi di codice e matematica con risposta controllabile da una macchina. Le più affidabili
a checkpoint
Prove interne mai pubblicate
scritte in casa e tenute segrete, quindi impossibili da contaminare. Sono quelle su cui i team decidono davvero
alla fine
Un punteggio pubblico alto non dimostra granché: il test potrebbe essere finito nei dati, oppure il modello è stato ottimizzato proprio su quella forma di domanda. È il motivo per cui ogni laboratorio serio mantiene una batteria di prove private.
16
Post

Adattamento supervisionato: stesso codice, altro mondo

Tecnicamente è identico al pre-training: si prevede il token successivo. Cambiano i dati — conversazioni scritte o revisionate da persone — e cambiano tre dettagli che, se sbagliati, rovinano tutto.

Si impara solo sulla risposta
i token della domanda entrano nel contesto ma sono esclusi dalla loss: al modello non si insegna a inventare le domande dell'utente
Passo di apprendimento basso
un ordine di grandezza sotto il pre-training, tipicamente 10⁻⁵. Più alto e il modello dimentica quello che sapeva
Pochissime epoche
una, al massimo tre. Alla quarta il modello ripete a memoria gli esempi invece di generalizzarne lo stile
Il formato è un contratto
i delimitatori dei turni usati qui devono essere identici a quelli che userà l'applicazione. Una differenza di un carattere degrada le risposte in modo difficile da diagnosticare
Semplice

10.000-50.000 conversazioni da raccolte pubbliche. Poche ore su una scheda sola. È lo stadio con il miglior rapporto fra fatica e risultato percepito: il modello smette di farfugliare e comincia a rispondere.

Frontiera

Centinaia di migliaia o milioni di esempi, molti scritti da esperti retribuiti del dominio, altri generati e poi selezionati. La qualità di questa raccolta è uno dei beni più gelosamente custoditi di un laboratorio.

17
Post

Rinforzo: il modello genera i propri dati

Qui l'infrastruttura cambia natura. Non si legge più un file: a ogni passo il modello produce risposte, qualcuno le giudica, e da quei giudizi si ricava il gradiente. L'addestramento contiene un sistema di generazione al suo interno.

1
Si prende un lotto di richieste e si generano 8-64 risposte diverse per ciascuna
70-90% del tempo
2
Ogni risposta riceve un punteggio: da un modello di ricompensa addestrato su preferenze umane, oppure da un verificatore automatico che esegue i test
5-15%
3
Si aumenta la probabilità delle risposte sopra la media del gruppo e si abbassa quella delle altre, limitando quanto può cambiare ogni singolo passo. I gruppi con risposte tutte giuste, o tutte sbagliate, non insegnano nulla e si scartano. Nel rinforzo con verifica il freno verso il modello di partenza spesso si toglie: il ragionamento lungo deve potersene allontanare
5-15%
4
I pesi aggiornati vanno ricopiati nel sistema di generazione, che deve ripartire con il modello nuovo
l'attrito principale
Da preferenze umane

Persone scelgono fra due risposte; da quelle scelte si addestra un giudice automatico. Insegna tono, utilità, rifiuti. Rischio: ottimizza il piacere, non la correttezza.

Da verifica

Il premio è oggettivo: i test passano, il risultato è quello atteso. Si può iterare all'infinito senza persone. È ciò che ha prodotto il salto su codice, matematica e ragionamento lungo.

Diretto dalle preferenze

Si salta il modello di giudizio e si ottimizza direttamente sulle coppie preferite. Molto più semplice e leggero, e per questo la scelta ragionevole nel progetto piccolo.

Non aspettare

Su larga scala generazione e aggiornamento non si alternano: corrono in parallelo, su schede separate. I pesi nuovi arrivano ai generatori mentre stanno ancora scrivendo, e una parte delle risposte viene da una versione del modello vecchia di qualche passo; la loss lo corregge pesando ogni token. Con i compiti agentici, dove una sola risposta usa strumenti per minuti, è l'unico modo di non lasciare ferme le schede.

Perché la generazione domina

Produrre 32 risposte da 2.000 token per ognuna di 1.000 richieste significa generare 64 milioni di token — un token alla volta, con tutti i limiti di banda del caso — per ottenere un solo passo di aggiornamento. Il rinforzo è costoso non per l'aggiornamento ma per ciò che serve a produrlo.

Aggirare il premio

Il modello ottimizza ciò che viene misurato, non ciò che si intendeva. Se il giudice premia le risposte lunghe, le risposte si allungano. Se i test si possono superare senza risolvere il problema, li supererà. Il freno verso il modello di partenza, dove si usa, e la revisione umana periodica servono esattamente a questo.

18
Post

Distillazione: dove i due progetti si incontrano

Quasi tutti i modelli piccoli buoni di oggi non sono stati addestrati da soli: hanno imparato da un modello grande. È la ragione per cui i due soggetti di questo diagramma non sono indipendenti.

Sulle sequenze

Imparare dalle risposte

Il modello grande genera milioni di risposte, si filtrano quelle corrette, e il piccolo si addestra su quelle come se fossero dati normali.

Semplicissimo, non richiede accesso ai pesi del maestro. È il metodo più diffuso.

Sulle distribuzioni

Imparare dalle incertezze

Invece del solo token scelto, si insegna al piccolo l'intera distribuzione di probabilità del maestro su tutto il vocabolario.

Molto più informativo — ogni token trasmette un vettore invece di una scelta — ma richiede di eseguire il maestro e di conservarne le probabilità.

Sulle proprie risposte

Imparare dai propri errori

Lo studente scrive, il maestro dà un voto a ogni token, lo studente corregge proprio i punti in cui ha sbagliato.

È un rinforzo con un premio per ogni token invece che uno solo alla fine, e costa una frazione dell'RL.

Perché funziona così bene

Il testo del web è pieno di rumore e ambiguità; le risposte di un buon modello sono già ripulite, coerenti nello stile e corrette nel formato. Il modello piccolo impara da un curriculum ideale invece che da internet — e infatti un modello da 8 G distillato bene supera facilmente un 8 G addestrato da zero sugli stessi dati grezzi.

19
Sintesi

Come si distribuisce il tempo, davvero

In entrambi i progetti la corsa vera è una minoranza del calendario. Chi si aspetta che «addestrare un modello» significhi soprattutto guardare una loss scendere, ha in mente la parte più breve.

Semplice · 2 settimane
dati e tokenizer
prove
pre-training
SFT
valutazione
Frontiera · 12-18 mesi
dati
esperimenti di scala
infrastruttura
pre-training
post-training
verifiche
Le fasi si sovrappongono: mentre il modello pre-addestra, la squadra del post-training lavora sui dati e quella di valutazione prepara le prove. La corsa finale, la parte che costa più di tutte, è meno di un sesto del calendario.
In una riga

La ricetta è pubblica. Ciò che non lo è sono i dati e la disciplina.

Ogni passaggio di questo diagramma è descritto in letteratura, e il codice per eseguirlo è aperto. La distanza fra i due soggetti non sta in un segreto architetturale: sta in quanti dati sono stati raccolti e ripuliti, in quante volte si è misurato invece di discutere, e in quanto rigore si è messo nel non sbagliare niente per due mesi di fila.

Valori indicativi ricostruiti da rapporti tecnici pubblici e dalla pratica sui modelli a pesi aperti. Le configurazioni dei laboratori di frontiera non sono divulgate e cambiano rapidamente. Settembre 2026