Come funziona l'IA Glossario · 372 voci
Glossario Tredici sezioni · 1763-2026

Glossario dell'intelligenza artificiale

Novant'anni di intelligenza artificiale, e i due secoli di matematica che la precedono: concetti, algoritmi e tecnologie in ordine cronologico e tematico. Ogni voce porta l'anno e, quando è identificabile, chi l'ha introdotta. Le date si riferiscono alla prima pubblicazione riconosciuta: molte idee sono state proposte, dimenticate e riscoperte più volte, e dove è rilevante lo si segnala.

Come leggerlo

Tredici sezioni in ordine storico. Le prime cinque coprono l'IA prima delle reti neurali profonde; le ultime otto il periodo dal 2012 a oggi.

Circa 370 voci. Per cercare un termine preciso conviene usare la ricerca del browser.

372 voci
I
1763-1956

Prima che si chiamasse intelligenza artificiale

La matematica arriva prima del nome. Quando nel 1956 si conia l'espressione «artificial intelligence», l'inferenza probabilistica ha quasi due secoli, la regressione uno e mezzo, e il modello formale di calcolo venti anni.

Teorema di Bayes
1763 · Bayes, Laplace
Come aggiornare una credenza alla luce di nuova evidenza. È la base formale di ogni inferenza probabilistica, e il modo di pensare che tutto l'apprendimento statistico eredita: nessuna certezza, solo distribuzioni che si stringono.
Minimi quadrati
1805 · Legendre, Gauss
Trovare la retta che minimizza la somma dei quadrati degli errori. Il primo algoritmo di apprendimento della storia, e ancora la forma della funzione obiettivo in metà dei problemi di regressione.
Discesa del gradiente
1847 · Cauchy
Per minimizzare una funzione, muoversi nella direzione opposta alla sua pendenza. Un'idea di analisi dell'Ottocento che oggi consuma la maggior parte dell'energia elettrica spesa in calcolo scientifico.
Analisi delle componenti principali
1901 · Pearson
Trovare le direzioni lungo cui i dati variano di più e proiettarli su quelle, scartando il resto. La prima tecnica di riduzione della dimensionalità, ancora il punto di partenza per capire un insieme di dati sconosciuto.
Catena di Markov
1906 · Markov (applicazione al testo nel 1913)
Un processo in cui il futuro dipende solo dallo stato presente, non da tutta la storia. Markov la applicò alle lettere di un poema russo: il primo modello linguistico statistico, con un secolo di anticipo.
Macchina di Turing
1936 · Turing
Un modello astratto di calcolo: un nastro, una testina, un insieme di regole. Definisce cosa significa «calcolabile» e stabilisce che esiste un dispositivo universale capace di simulare qualsiasi altro.
Neurone di McCulloch-Pitts
1943 · McCulloch, Pitts
Il primo modello matematico di neurone: conta gli ingressi eccitatori attivi, e se superano una soglia (e nessun ingresso inibitorio è attivo) emette 1, altrimenti 0. Nessun apprendimento, ma la dimostrazione che una rete di questi elementi può calcolare qualsiasi funzione logica.
Teoria dell'informazione
1948 · Shannon
Misura l'informazione in bit e definisce l'entropia come incertezza media di una sorgente. Da qui vengono l'entropia incrociata usata come funzione di perdita e la perplessità con cui si misurano i modelli linguistici.
Cibernetica
1948 · Wiener
Lo studio del controllo e della comunicazione negli animali e nelle macchine, centrato sulla retroazione. Il filone da cui l'IA si separa negli anni Cinquanta, e a cui in qualche misura il controllo moderno è tornato.
Regola di Hebb
1949 · Hebb
Il principio che Carla Shatz riassumerà nel 1992 come «neuroni che si attivano insieme si connettono fra loro». La prima regola di plasticità sinaptica, e l'archetipo di ogni apprendimento non supervisionato basato su correlazione.
Test di Turing
1950 · Turing
Il «gioco dell'imitazione»: se un interrogatore non distingue le risposte scritte di una macchina da quelle di una persona, la domanda se la macchina pensi è mal posta. Proposto come argomento filosofico, letto per settant'anni come obiettivo ingegneristico.
Approssimazione stocastica
1951 · Robbins, Monro
Come convergere al minimo di una funzione osservandone solo stime rumorose. È la giustificazione teorica della discesa del gradiente stocastica, cioè di come si addestra ogni rete neurale moderna.
SNARC
1951 · Minsky, Edmonds
Il primo calcolatore a reti neurali costruito fisicamente: 40 neuroni artificiali con pesi regolati da motorini e potenziometri, che imparavano a uscire da un labirinto.
Conferenza di Dartmouth
1955-1956 · McCarthy, Minsky, Rochester, Shannon
Il seminario estivo del 1956, preparato da una proposta dell'agosto 1955 in cui McCarthy conia l'espressione «artificial intelligence» per distinguere il campo dalla cibernetica. La proposta prometteva progressi sostanziali in due mesi di lavoro di dieci persone: è l'atto di nascita della disciplina e il suo primo errore di stima.
Logic Theorist
1956 · Newell, Simon, Shaw
Il primo programma di IA: dimostrava teoremi di logica proposizionale cercando fra le derivazioni possibili con l'aiuto di euristiche. Introduce l'idea che il pensiero sia ricerca in uno spazio di simboli.
General Problem Solver
1957 · Newell, Simon
Il tentativo di scrivere un risolutore universale: rappresenta un problema come differenza fra stato attuale e obiettivo, e applica operatori che riducono quella differenza. Funzionava su rompicapo formali e crollava su tutto il resto.
Analisi mezzi-fini
1957
La strategia del GPS: misurare la distanza dall'obiettivo e scegliere l'azione che la riduce di più. Ricompare oggi, sotto altro nome, in ogni agente che pianifica.
Machine learning
1959 · Samuel
Termine coniato da Arthur Samuel per il suo programma di dama, che migliorava giocando contro se stesso. Il primo sistema che imparava dall'esperienza fino a battere il suo autore — e il primo esempio di self-play.
II
1956-1980

L'IA simbolica

Per venticinque anni l'ipotesi dominante è che l'intelligenza sia manipolazione di simboli secondo regole. Produce compilatori, dimostratori automatici e la programmazione logica; fallisce su percezione, linguaggio e senso comune. Le sue idee non sono state smentite: sono state assorbite dall'informatica ordinaria.

IA simbolica · GOFAI
1956-1990
L'approccio che rappresenta la conoscenza con simboli espliciti e la manipola con regole scritte da persone. «Good Old-Fashioned AI» è il nome che le diede Haugeland nel 1985, quando già si sentiva il bisogno di distinguerla.
Ipotesi del sistema simbolico fisico
1976 · Newell, Simon
La tesi che un sistema fisico capace di manipolare simboli abbia i mezzi necessari e sufficienti per l'azione intelligente. È la scommessa teorica dell'IA simbolica, e la ragione per cui il fallimento pratico fu vissuto come una crisi di fondamenti.
LISP
1958 · McCarthy
Il linguaggio dell'IA per trent'anni: codice e dati hanno la stessa forma, quindi un programma può scrivere e modificare programmi. Ha introdotto garbage collection, funzioni di prima classe e ricorsione come strumenti ordinari.
Ricerca in spazio degli stati
anni '50
Formulare un problema come grafo di stati collegati da azioni, e risolverlo cercando un percorso dallo stato iniziale a quello obiettivo. Il paradigma di calcolo su cui poggia tutta l'IA classica.
Esplosione combinatoria
La crescita esponenziale dello spazio di ricerca con la profondità: il muro contro cui l'IA simbolica ha battuto per decenni. Gli scacchi hanno ~10⁴⁴ posizioni legali e ~10¹²⁰ partite possibili, il Go ~10¹⁷⁰ posizioni legali: enumerare non è un'opzione.
Euristica
Una stima approssimata che orienta la ricerca verso le regioni promettenti. Non garantisce nulla, ma è ciò che rende trattabile un problema intrattabile — e la forma più antica di conoscenza incorporata in un algoritmo.
Ricerca in ampiezza e in profondità
Le due strategie di esplorazione elementari: livello per livello, garantendo il percorso più corto ma consumando memoria; oppure un ramo alla volta fino in fondo, con memoria minima e nessuna garanzia.
Programmazione dinamica
1953 · Bellman
Risolvere un problema scomponendolo in sottoproblemi sovrapposti e memorizzandone le soluzioni. Trasforma ricerche esponenziali in polinomiali quando la struttura lo permette: Viterbi, allineamento di sequenze, equazione di Bellman.
A*
1968 · Hart, Nilsson, Raphael
Ricerca del percorso ottimo che espande i nodi in ordine di costo già speso più costo stimato residuo. Se la stima non sovrastima mai, trova la soluzione migliore. Ancora oggi in ogni navigatore e in ogni videogioco.
Minimax
1928 · von Neumann
Nei giochi a due giocatori a somma zero, scegliere la mossa che massimizza il proprio risultato nell'ipotesi che l'avversario giochi al meglio. La base di ogni programma di scacchi fino agli anni Novanta.
Potatura alfa-beta
1958 · McCarthy e altri
Ottimizzazione del minimax: si abbandona un ramo appena si dimostra che non può influire sulla scelta finale. Con un buon ordinamento delle mosse dimezza l'esponente, cioè raddoppia la profondità raggiungibile.
Funzione di valutazione
Il giudizio approssimato su una posizione quando non si può calcolare fino alla fine. Scritta a mano per decenni, e appresa già da Samuel (1959) e da TD-Gammon (1992); con AlphaGo (2016) una rete neurale la sostituisce anche nei giochi più difficili.
Logica del primo ordine
1879 · Frege
Il linguaggio formale con quantificatori, predicati e relazioni in cui l'IA simbolica sperava di scrivere tutta la conoscenza. Espressivo e rigoroso; l'inferenza però è indecidibile in generale, e il mondo reale è pieno di eccezioni.
Risoluzione e unificazione
1965 · Robinson
Una singola regola di inferenza sufficiente a dimostrare qualsiasi teorema della logica del primo ordine, più il procedimento che rende identiche due espressioni assegnando valori alle variabili. È il motore di Prolog.
Prolog
1972 · Colmerauer, Kowalski
Programmazione logica: si dichiarano fatti e regole, non procedure, e il motore cerca le risposte. Il programma è una teoria, l'esecuzione è una dimostrazione.
Sistema di produzione
anni '60
Un insieme di regole «se condizione allora azione» applicate ciclicamente a una memoria di lavoro. Architettura dei sistemi esperti, e ancora la forma dei motori di regole aziendali.
Rete semantica
1966 · Quillian
Rappresentazione della conoscenza come grafo di concetti collegati da relazioni tipizzate («un canarino è un uccello»). L'antenata diretta dei grafi di conoscenza e degli ontologie del web semantico.
Frame
1974 · Minsky
Una struttura con caselle e valori predefiniti che descrive una situazione tipica: entrando in un ristorante si attivano aspettative su tavoli, menu e conto. Parente degli oggetti della programmazione, e antenato dei linguaggi di rappresentazione della conoscenza e delle ontologie.
Script
1977 · Schank, Abelson
Sequenze di eventi stereotipate usate per capire un racconto colmandone i vuoti. Il tentativo più serio di codificare a mano il senso comune narrativo.
ELIZA
1966 · Weizenbaum
Duecento righe di regole di riscrittura che imitavano un terapeuta rogersiano riformulando le frasi dell'utente. Nessuna comprensione, e persone che le si confidavano comunque.
Effetto ELIZA
1966-
La tendenza umana ad attribuire comprensione e intenzione a un sistema che produce testo plausibile. Weizenbaum ne fu allarmato al punto di passare il resto della carriera a criticare il proprio campo; il fenomeno è oggi più rilevante che allora.
SHRDLU
1970 · Winograd
Un programma che capiva davvero il linguaggio — dentro un mondo di sette blocchi colorati. Dimostrò contemporaneamente che l'approccio funzionava e che non si generalizzava: fuori dal micromondo, nulla.
Micromondo
anni '70
La strategia di ridurre il dominio a un universo chiuso e formalizzabile, aspettandosi che i risultati scalassero. Non scalarono: la complessità del mondo reale non è quantitativa ma qualitativa.
Problema del frame
1969 · McCarthy, Hayes
Come rappresentare che un'azione cambia poche cose e lascia tutto il resto invariato, senza dover elencare tutto il resto. Un problema tecnico che si rivelò una questione filosofica sulla rilevanza.
Senso comune
Il corpo di conoscenze che ogni persona ha e nessuno enuncia: che l'acqua bagna, che le corde tirano e non spingono, che chi esce da una stanza ci era dentro. L'ostacolo che ha fermato l'IA simbolica, e che i modelli linguistici hanno aggirato invece che risolvere.
Ragionamento non monotono
1980 · McDermott, Reiter
Logiche in cui una conclusione può essere ritirata quando arriva nuova informazione: «gli uccelli volano» resta valido finché non si parla di un pinguino. Il tentativo formale di trattare le eccezioni.
Stanza cinese
1980 · Searle
Argomento contro l'idea che manipolare simboli secondo regole produca comprensione: chi in una stanza applica un manuale di cinese senza saperlo risponde correttamente senza capire nulla. Discusso da quarant'anni, mai risolto.
Problema dell'ancoraggio dei simboli
1990 · Harnad
Come un simbolo interno acquisisce significato se tutto ciò a cui è collegato sono altri simboli. La domanda che i modelli addestrati solo su testo si portano ancora dietro.
III
1965-1995

Sistemi esperti, e i due inverni

Il primo modello industriale dell'IA: intervistare esperti umani e trascriverne le regole. Funziona in domini stretti, genera il primo mercato reale e poi crolla sotto il proprio costo di manutenzione. I due «inverni» sono cicli di aspettative gonfiate, finanziamenti tagliati e ricerca che continua sotto altri nomi.

Sistema esperto
1965-
Un programma che replica il giudizio di uno specialista applicando centinaia o migliaia di regole codificate a mano. Separa la base di conoscenza dal motore che la usa — l'idea architetturale che ne ha decretato il successo commerciale.
DENDRAL
1965 · Feigenbaum, Buchanan
Il primo sistema esperto: deduceva la struttura molecolare da dati di spettrometria di massa. Dimostrò che la conoscenza specifica di un dominio conta più di un metodo di ragionamento generale.
MYCIN
1972 · Shortliffe
Diagnosi di infezioni batteriche con ~600 regole, in valutazioni controllate migliore di molti medici. Non fu mai usato in clinica: problemi di responsabilità, di integrazione e di interfaccia — il primo caso di IA valida e non adottata.
Base di conoscenza
L'insieme dei fatti e delle regole di un dominio, tenuto separato dal codice che li applica. La sua manutenzione si rivelò il costo dominante: mille regole che interagiscono sono più difficili da modificare di mille righe di programma.
Concatenazione avanti e indietro
Le due direzioni dell'inferenza a regole: dai fatti noti verso le conclusioni che ne derivano, oppure da un'ipotesi verso i fatti che la sosterrebbero. La seconda è ciò che permette a un sistema di sapere quale domanda fare.
Fattori di certezza
1975 · Shortliffe, Buchanan
Numeri attaccati alle regole per esprimere confidenza, combinati con formule ad hoc. Funzionavano in pratica e non avevano fondamento probabilistico: la critica che aprì la strada alle reti bayesiane.
Logica fuzzy
1965 · Zadeh
Appartenenza graduale invece che binaria: una temperatura può essere «calda» al 70%. Marginale nell'IA accademica, enorme nel controllo industriale — condizionatori, lavatrici, metropolitane.
Collo di bottiglia della conoscenza
anni '80
Il limite strutturale dei sistemi esperti: la conoscenza va estratta da persone che in gran parte non sanno di averla, una regola per volta. È il problema che l'apprendimento automatico risolve rovesciandolo — si estrae dai dati, non dalle persone.
Rapporto Lighthill
1973 · Lighthill
La valutazione commissionata dal governo britannico che giudicò l'IA incapace di mantenere le promesse. Portò a tagli drastici dei fondi nel Regno Unito; insieme ai tagli DARPA negli Stati Uniti aprì il primo inverno.
Inverno dell'IA
1974-1980 · 1987-1993
Due periodi di disillusione con tagli drastici ai finanziamenti. In entrambi i casi la ricerca continuò sotto etichette diverse — «sistemi intelligenti», «informatica cognitiva», «data mining» — e alcune delle idee decisive nacquero proprio lì.
Progetto Quinta Generazione
1982 · Giappone
Programma decennale da centinaia di milioni per costruire calcolatori basati su logica e Prolog eseguito in parallelo. Fallì per la stessa ragione dei sistemi esperti, e provocò come reazione i programmi occidentali concorrenti.
Macchine LISP
1980-1987
Calcolatori specializzati per eseguire LISP, venduti a decine di migliaia di dollari. Spazzati via dalle workstation generiche: il primo caso in cui l'hardware dedicato all'IA perde contro l'hardware generalista che migliora più in fretta.
CYC
1984 · Lenat
Il tentativo di codificare a mano tutto il senso comune umano: milioni di asserzioni logiche, quarant'anni di lavoro continuo. L'esperimento più longevo e più istruttivo dell'IA simbolica.
Paradosso di Moravec
1988 · Moravec
Il ragionamento astratto richiede poco calcolo, la percezione e il movimento moltissimo: dimostrare teoremi è facile, afferrare un oggetto è difficile. L'evoluzione ha affinato per centinaia di milioni di anni le seconde capacità; il pensiero astratto, dice Moravec, ha forse meno di centomila anni.
Architettura di subsumption
1986 · Brooks
Robot costruiti a strati di comportamenti reattivi senza modello del mondo né pianificazione centrale. «L'intelligenza senza rappresentazione»: la reazione radicale al fallimento simbolico, e la base della robotica mobile pratica.
IA incarnata
anni '80-
La tesi che l'intelligenza richieda un corpo e un'interazione col mondo, non solo elaborazione simbolica. Tornata attuale con la robotica basata su modelli di grandi dimensioni.
Deep Blue
1997 · IBM
Batte Kasparov con ricerca alfa-beta su hardware dedicato, 200 milioni di posizioni al secondo e una funzione di valutazione con migliaia di termini scritta con gran maestri e tarata su partite di maestri. Nessuna rete e nessun apprendimento dal gioco: la vittoria finale dell'IA simbolica, e un vicolo cieco metodologico.
Effetto IA
Ogni volta che un problema viene risolto smette di essere considerato intelligenza artificiale e diventa «solo un algoritmo»: è successo agli scacchi, all'OCR, alla traduzione automatica, al riconoscimento vocale.
Lezione amara
2019 · Sutton
Settant'anni di storia riassunti in una tesi: i metodi generali che sfruttano ricerca e apprendimento su larga scala battono sempre, alla lunga, i metodi che incorporano conoscenza umana. Scritta come critica al campo, letta come programma di lavoro.
IV
1960-2010

Apprendimento statistico

Il paradigma che sostituisce le regole scritte con l'inferenza dai dati. Il vocabolario di questa sezione — sovradattamento, validazione, generalizzazione — è ancora quello con cui si discute qualsiasi modello, comprese le reti di frontiera. Molte di queste tecniche restano la scelta corretta su dati tabellari.

Apprendimento supervisionato
Si impara da coppie ingresso-risposta etichettate. La forma più studiata e più usata; il costo dominante è l'etichettatura, non il calcolo.
Apprendimento non supervisionato
Si cerca struttura in dati senza etichette: raggruppamenti, direzioni di variazione, densità. Considerato marginale per decenni, poi diventato centrale sotto il nome di apprendimento auto-supervisionato.
Apprendimento auto-supervisionato
2018-
Si costruisce l'etichetta dai dati stessi: nascondere una parola e prevederla, ritagliare un pezzo di immagine e ricostruirlo. È il trucco che ha reso utilizzabili miliardi di documenti non annotati, e la base di ogni modello di fondazione.
Apprendimento semi-supervisionato
Pochi dati etichettati e molti senza etichetta usati insieme. Comprende l'auto-addestramento e la pseudo-etichettatura, in cui il modello etichetta i propri dati e si riaddestra.
Generalizzazione
La capacità di funzionare su dati mai visti, l'unica cosa che conta. Tutto il resto della teoria dell'apprendimento esiste per stimarla senza barare.
Sovradattamento
Il modello impara il rumore dei dati di addestramento invece della regolarità: errore basso in addestramento, alto altrove. Il fallimento più comune, e il più facile da non vedere.
Addestramento, validazione e test
I dati si dividono in tre: su uno si impara, sul secondo si scelgono gli iperparametri e si decide quando fermarsi, sul terzo si misura una volta sola alla fine. Guardare il test durante lo sviluppo lo trasforma in un secondo insieme di validazione, e il numero finale smette di essere onesto.
Compromesso bias-varianza
anni '90
L'errore si scompone in errore sistematico di un modello troppo rigido e instabilità di un modello troppo flessibile. Il quadro classico; le reti sovraparametrizzate lo violano in modo ancora non del tutto spiegato.
Doppia discesa
2019 · Belkin e altri
Aumentando i parametri l'errore di test peggiora fino a un picco, poi ricomincia a scendere oltre il punto di interpolazione. La constatazione empirica che la teoria classica non prevedeva, e su cui poggia la pratica moderna.
Regolarizzazione
Qualsiasi vincolo che penalizza la complessità: L2 spinge i pesi verso zero, L1 ne azzera esattamente molti, producendo modelli sparsi. Nelle reti si affianca a dropout, arresto anticipato e decadimento dei pesi.
Validazione incrociata
anni '70
Si divide il campione in k parti, si addestra su k−1 e si valuta sulla rimanente, ruotando. Stima onesta della performance quando i dati sono pochi; impraticabile quando un addestramento costa milioni.
Maledizione della dimensionalità
1957 · Bellman
In spazi a molte dimensioni i punti sono tutti lontani fra loro e il volume si concentra ai bordi: la nozione di vicinanza si svuota. Il motivo per cui le tecniche basate su distanza degradano, e per cui contano le rappresentazioni apprese.
Ipotesi della varietà
I dati reali, pur vivendo in spazi a milioni di dimensioni, si concentrano su superfici di dimensione molto più bassa. È la ragione per cui l'apprendimento è possibile: le immagini di volti sono un sottoinsieme infinitesimo delle immagini possibili.
Dimensione VC
1971 · Vapnik, Chervonenkis
Misura la capacità di una classe di modelli come il numero massimo di punti che può separare in tutti i modi possibili. Il primo strumento per legare complessità e generalizzazione in modo dimostrabile.
Apprendimento PAC
1984 · Valiant
Formalizza «imparare» come: con alta probabilità, dopo un numero di esempi polinomiale, produrre un'ipotesi approssimativamente corretta. Ha dato all'apprendimento automatico lo statuto di disciplina matematica.
Nessun pasto gratis
1996 · Wolpert
Mediato su tutti i problemi possibili, nessun algoritmo di apprendimento è migliore di un altro. Ogni successo pratico dipende dall'aver fatto un'assunzione giusta sulla struttura del problema.
Bias induttivo
Le assunzioni incorporate nell'architettura: una rete convoluzionale presuppone che la posizione non conti, un transformer che le relazioni fra elementi distanti contino. Scegliere il bias giusto è quasi tutto il lavoro di progettazione.
Funzione di perdita
Il numero che misura quanto la previsione è sbagliata, e l'unica cosa che l'addestramento minimizza. Scegliere la perdita è definire l'obiettivo: il modello ottimizzerà esattamente quella, non le intenzioni di chi l'ha scritta.
Massima verosimiglianza
1922 · Fisher
Scegliere i parametri che rendono i dati osservati più probabili. Minimizzare l'entropia incrociata di un modello linguistico è esattamente questo, riscritto.
Regressione logistica
1958 · Cox
Classificazione lineare che restituisce probabilità calibrate attraverso una sigmoide. Ancora la linea di riferimento contro cui misurare qualsiasi cosa: se un modello complesso non la batte, non serve.
Naive Bayes
anni '60
Classificatore che assume tutte le variabili indipendenti — assunzione falsa che funziona sorprendentemente bene. Per vent'anni è stato il filtro antispam del mondo.
k vicini più prossimi
1951 Fix, Hodges · 1967 Cover, Hart
Nessun addestramento: si classifica un punto guardando i k esempi più simili. Concettualmente è l'antenato della ricerca vettoriale che alimenta ogni sistema RAG.
Albero di decisione
1984 Breiman e altri (CART) · 1986 Quinlan (ID3, poi C4.5 nel 1993)
Una sequenza di domande binarie sulle variabili, scelte per massimizzare la purezza dei rami. Interpretabile per costruzione, instabile da solo: cambiare pochi dati cambia l'albero.
Bagging
1996 · Breiman
Addestrare molti modelli su campioni estratti con reimmissione e mediarne le previsioni. Riduce la varianza senza toccare il bias.
Random forest
2001 · Breiman
Centinaia di alberi su campioni e sottoinsiemi di variabili diversi. Robusto, quasi senza taratura, difficile da sbagliare: per un decennio la risposta predefinita a qualsiasi problema tabellare.
Boosting · AdaBoost
1995 · Freund, Schapire
Modelli debolissimi addestrati in sequenza, ognuno concentrato sugli errori del precedente. Nasce dalla dimostrazione di Schapire (1990) che da classificatori appena migliori del caso se ne può costruire uno arbitrariamente accurato; AdaBoost la rende un algoritmo pratico.
Gradient boosting · XGBoost
1999 Friedman · 2014 Chen
Boosting riformulato come discesa del gradiente nello spazio delle funzioni. Nelle implementazioni moderne resta lo stato dell'arte sui dati tabellari, dove le reti profonde non hanno mai preso il sopravvento.
Macchina a vettori di supporto
1992-1995 · Vapnik e altri
Cerca l'iperpiano che separa le classi con il margine più ampio possibile. Fondata su una teoria solida e dominante negli anni Duemila; superata dalle reti profonde quando i dati sono diventati abbondanti.
Trucco del kernel
1964 · Aizerman e altri
Calcolare prodotti scalari in uno spazio a dimensione altissima senza mai costruirlo. Permette a un metodo lineare di tracciare frontiere curve: eleganza matematica al servizio di un limite computazionale.
k-means
1957 Lloyd · 1967 MacQueen
Raggruppamento in k gruppi alternando assegnazione dei punti al centro più vicino e ricalcolo dei centri. Semplice, veloce, sensibile all'inizializzazione e obbligato a scegliere k in anticipo.
DBSCAN
1996 · Ester e altri
Raggruppamento basato sulla densità: trova gruppi di forma arbitraria e riconosce i punti isolati come rumore, senza dover dichiarare quanti gruppi cercare.
Clustering gerarchico
anni '60
Costruisce un albero di gruppi annidati fondendo i più simili o dividendo i più eterogenei. Il dendrogramma permette di scegliere il numero di gruppi dopo aver guardato, non prima.
t-SNE · UMAP
2008 · 2018
Tecniche di proiezione in due dimensioni che preservano la vicinanza locale. Strumenti di ispezione, non di analisi: le distanze fra gruppi lontani nel grafico non significano nulla, e la struttura globale è inaffidabile.
Modello di Markov nascosto
1966 · Baum, Petrie
Una catena di stati non osservabili che genera osservazioni visibili. Ha dominato il riconoscimento vocale e l'analisi di sequenze biologiche per trent'anni, fino alle reti ricorrenti.
Algoritmo di Viterbi
1967 · Viterbi
Trova con programmazione dinamica la sequenza di stati nascosti più probabile. Usato ovunque, dai decodificatori di telecomunicazioni all'etichettatura grammaticale.
Expectation-Maximization
1977 · Dempster, Laird, Rubin
Per stimare parametri con variabili non osservate: si alterna l'attribuzione dei valori mancanti e l'ottimizzazione dei parametri. Converge sempre, non necessariamente all'optimum globale.
Rete bayesiana
1985 · Pearl
Grafo diretto in cui i nodi sono variabili e gli archi dipendenze probabilistiche. Ha ridato all'IA un trattamento rigoroso dell'incertezza e ha aperto la strada all'inferenza causale.
Inferenza causale · do-calculus
1995 · Pearl
Il formalismo per distinguere «osservare» da «intervenire»: la correlazione fra due variabili non dice cosa succede se se ne forza una. La critica più solida ai modelli puramente predittivi.
Campo casuale condizionale
2001 · Lafferty e altri
Modello per etichettare sequenze tenendo conto dei vincoli fra etichette adiacenti. Stato dell'arte per l'estrazione di entità fino al 2015 circa.
Filtro di Kalman
1960 · Kalman
Stima ricorsivamente lo stato di un sistema dinamico da misure rumorose, fondendo previsione e osservazione. Ha portato l'Apollo sulla Luna e sta in ogni navigatore satellitare.
MCMC · Gibbs · Metropolis
1953-1984
Famiglia di metodi per campionare da distribuzioni troppo complesse per essere calcolate: si costruisce una catena di Markov che le visita con la frequenza giusta. La cassetta degli attrezzi della statistica bayesiana applicata.
Inferenza variazionale
anni '90
Sostituire una distribuzione intrattabile con la più vicina di una famiglia semplice, trasformando l'inferenza in ottimizzazione. È il meccanismo che rende addestrabile l'autoencoder variazionale.
Processo gaussiano
anni '90-2006
Un modello non parametrico che restituisce previsioni con la loro incertezza. Costoso su molti dati; ancora insostituibile nell'ottimizzazione bayesiana degli iperparametri.
Ingegneria delle caratteristiche
Costruire a mano le variabili da dare al modello: per vent'anni la parte del lavoro dove stava il valore. Il deep learning l'ha in gran parte sostituita con l'apprendimento della rappresentazione.
Apprendimento della rappresentazione
2013 · Bengio e altri
Lasciare che il modello scopra da sé le caratteristiche utili invece di riceverle. È lo spostamento concettuale che definisce il deep learning.
Matrice di confusione
La tabella di veri e falsi positivi e negativi da cui derivano tutte le metriche. Guardarla è il modo più rapido per scoprire che un'accuratezza del 99% descrive un modello inutile.
Precisione · richiamo · F1
Quanti dei casi segnalati sono corretti, quanti dei casi reali sono stati trovati, e la loro media armonica. Si scambiano l'una con l'altra: quale privilegiare è una decisione di prodotto, non statistica.
Curva ROC · AUC
1941 · radar
Il comportamento del classificatore a tutte le soglie possibili, riassunto in un numero fra 0 e 1, dove 0,5 è il caso. Nata per valutare gli operatori radar nella seconda guerra mondiale.
Calibrazione
Un modello è calibrato se, quando dice 70%, ha ragione sette volte su dieci. Le reti profonde sono tipicamente troppo sicure di sé, e vanno ricalibrate dopo l'addestramento.
Deriva dei dati
Il mondo cambia e la distribuzione dei dati in ingresso non è più quella di addestramento: il modello peggiora senza che nulla nel codice sia cambiato. La causa più frequente di degrado silenzioso in produzione.
Fuga di informazione
Quando una variabile contiene, indirettamente, la risposta. Produce risultati eccellenti in valutazione e inutili in produzione; è l'errore metodologico più comune e più difficile da individuare.
V
1958-2017

Reti neurali: i fondamenti

I meccanismi che valgono per ogni rete, dal perceptron del 1958 al modello di frontiera di oggi. Nulla in questa sezione è concettualmente difficile; la difficoltà sta nel fatto che tutto interagisce con tutto, e che il comportamento su un miliardo di parametri non si deduce da quello su cento.

Perceptron
1958 · Rosenblatt
Il primo neurone che impara: quando sbaglia, sposta i pesi verso l'esempio. Il teorema di convergenza garantisce che se i dati sono linearmente separabili troverà una soluzione in un numero finito di passi.
ADALINE
1960 · Widrow, Hoff
Variante che minimizza l'errore quadratico invece di contare gli errori, addestrata con la regola delta. Il primo uso pratico di discesa del gradiente su una rete, e la prima applicazione industriale — cancellazione dell'eco telefonica.
Metodo GMDH
1965 · Ivakhnenko, Lapa
Il primo algoritmo che addestra reti a molti strati, aggiungendo uno strato alla volta e tenendo le unità migliori su dati di validazione. Nel 1971 addestra una rete a otto strati. Ignorato in Occidente per decenni.
Problema dello XOR
1969 · Minsky, Papert
Un singolo perceptron non può calcolare l'or esclusivo, perché la funzione non è linearmente separabile. La dimostrazione era corretta e limitata al caso a uno strato; letta come condanna definitiva, fermò la ricerca sulle reti per quindici anni.
Percettrone multistrato
anni '60 Rosenblatt, Ivakhnenko, Amari · diffuso negli anni '80
Strati di neuroni con non linearità in mezzo. Risolve lo XOR e, in linea di principio, qualsiasi altra cosa: i primi metodi per addestrarlo esistevano già negli anni '60, ma è la retropropagazione del 1986 a renderlo pratico e noto.
Retropropagazione
1970 Linnainmaa · 1974-1982 Werbos · 1986 Rumelhart, Hinton, Williams
Applicazione della regola della catena per calcolare, con un solo passaggio all'indietro, quanto ogni peso ha contribuito all'errore. Il costo è dell'ordine di quello del passaggio in avanti: è questa efficienza, non l'idea, che rende possibile il deep learning. Inventata più volte: Linnainmaa la formula in generale, Werbos la applica alle reti, l'articolo del 1986 su Nature la rende nota a tutti.
Differenziazione automatica
1970-
La tecnica generale di cui la retropropagazione è un caso: si registrano le operazioni durante il calcolo e si percorre il grafo all'indietro. È ciò che i framework moderni forniscono, e la ragione per cui nessuno scrive più gradienti a mano.
Teorema di approssimazione universale
1989 · Cybenko, Hornik
Una rete con un solo strato nascosto abbastanza largo può approssimare qualsiasi funzione continua. Rassicurante e quasi inutile in pratica: non dice quanto largo, né come trovare i pesi.
Funzione di attivazione
La non linearità applicata dopo ogni trasformazione lineare. Senza di essa cento strati collasserebbero in uno solo: è l'ingrediente minimo che rende una rete profonda diversa da una regressione.
Sigmoide · tanh
anni '80
Le attivazioni storiche, a forma di S e con derivata che si annulla agli estremi. Quella derivata che svanisce è la ragione per cui per vent'anni non si riusciva ad addestrare più di tre o quattro strati.
ReLU
1969 Fukushima · 2010 Nair, Hinton · 2011 Glorot, Bordes, Bengio
max(0, x). Derivata esattamente 1 per gli ingressi positivi, quindi il gradiente non si attenua salendo di strato. Una modifica di una riga che ha reso addestrabili le reti profonde più di qualsiasi altra idea.
GELU · SwiGLU
2016 · 2020
Attivazioni morbide che sostituiscono ReLU nei transformer. SwiGLU aggiunge una porta moltiplicativa e vale qualche punto di perdita a parità di calcolo: è lo standard nei modelli linguistici attuali.
Gradiente che svanisce o esplode
1991 · Hochreiter
Moltiplicando cento derivate leggermente minori di uno il gradiente si annulla; leggermente maggiori, diverge. Il problema centrale delle reti profonde, aggirato da ReLU, connessioni residue, normalizzazione e taglio del gradiente.
Inizializzazione Xavier · He
2010 · 2015
Scegliere la scala dei pesi iniziali in funzione del numero di ingressi, perché la varianza del segnale resti costante attraversando gli strati. Sbagliarla significa una rete che non parte affatto.
Discesa del gradiente stocastica
Stimare il gradiente su un piccolo campione invece che su tutti i dati. Molto più rapido, e il rumore che introduce si è rivelato utile: aiuta a sfuggire ai minimi stretti.
Momento · Nesterov
1964 · 1983
Accumulare la direzione dei passi precedenti come una velocità, per attraversare più rapidamente le valli allungate e smorzare le oscillazioni.
Adam · AdamW
2014 Kingma, Ba · 2017 Loshchilov
Ottimizzatore che adatta il passo a ciascun parametro tenendo due medie mobili del gradiente. AdamW corregge il trattamento del decadimento dei pesi ed è oggi il predefinito universale per i transformer. Costa due stati per parametro, cioè il triplo della memoria dei soli pesi.
Tasso di apprendimento
La lunghezza del passo, e l'iperparametro più importante di tutti: troppo grande divergenza, troppo piccolo spreco. In pratica si scalda all'inizio e si decresce verso la fine.
Dropout
2012 · Hinton, Srivastava e altri
Spegnere a caso una frazione di neuroni a ogni passo, così che la rete non possa fare affidamento su singole unità. Decisivo quando i dati erano pochi; oggi quasi assente dai grandi modelli linguistici, che non sovradattano.
Batch · Layer · RMSNorm
2015 · 2016 · 2019
Ricentrare e riscalare le attivazioni per stabilizzare l'addestramento. La prima normalizza sul lotto, la seconda su ogni singolo esempio — indispensabile per le sequenze — la terza semplifica la seconda e domina nei modelli attuali.
Connessione residua
2015 · He e altri
Sommare l'ingresso di un blocco alla sua uscita, così che il blocco debba imparare solo la correzione. Ha portato le reti da 20 a 150 strati in un anno, ed è il motivo per cui i transformer possono essere profondi.
Softmax
1959 · Luce
Trasforma un vettore di punteggi arbitrari in una distribuzione di probabilità. Compare due volte in ogni transformer: nei pesi di attenzione e nella previsione del token successivo.
Entropia incrociata
La perdita standard per la classificazione: penalizza in modo proporzionale al logaritmo della probabilità assegnata alla risposta giusta. Assegnare probabilità quasi nulla al token corretto costa quasi infinito.
Rete di Hopfield
1982 · Hopfield
Rete ricorrente che funziona come memoria associativa: parte da un ingresso corrotto e scende verso il ricordo più vicino. Ha portato nella disciplina il linguaggio dei sistemi fisici e delle funzioni di energia.
Macchina di Boltzmann
1985 · Hinton, Sejnowski
Rete stocastica con unità nascoste, addestrata a riprodurre la distribuzione dei dati. La versione ristretta è il mattone con cui nel 2006 si costruirono le prime reti profonde funzionanti.
Mappa auto-organizzante
1982 · Kohonen
Rete non supervisionata che dispone i dati su una griglia bidimensionale preservando le vicinanze. Uno dei primi strumenti di visualizzazione di dati ad alta dimensione.
Autoencoder
anni '80-
Rete che comprime l'ingresso in una rappresentazione ristretta e poi lo ricostruisce. Obbligando a passare per un collo di bottiglia, impara che cosa nei dati è essenziale.
Algoritmi evolutivi
anni '60-1975 · Rechenberg, Holland
Una popolazione di soluzioni candidate che si ricombinano e mutano, con selezione delle migliori. Non serve il gradiente, solo un punteggio. Poco efficienti su milioni di parametri, utili per iperparametri, architetture e problemi non derivabili.
Neuroevoluzione · NEAT
2002 · Stanley, Miikkulainen
Far evolvere pesi e topologia con algoritmi genetici invece di usare il gradiente. Marginale su larga scala, ancora utile dove il gradiente non è disponibile.
VI
2006-2017

Deep learning: visione, sequenze, generazione

Undici anni in cui tre condizioni si allineano — dati etichettati su scala industriale, schede grafiche programmabili, e i correttivi che rendono addestrabili le reti profonde. Nel 2012 la visione artificiale cambia metodo in una notte; nel 2017 arriva l'architettura che assorbirà tutto il resto.

Deep learning
2006 · Hinton e altri
Il termine (già usato da Dechter nel 1986 e applicato alle reti da Aizenberg nel 2000) si impone dopo il 2006, quando Hinton e colleghi mostrano che il pre-addestramento non supervisionato strato per strato rende addestrabili le reti profonde in modo affidabile. Le reti tornano rispettabili dopo il secondo inverno.
MNIST
1998 · LeCun e altri
70.000 cifre scritte a mano, 28×28 pixel. Il «ciao mondo» dell'apprendimento automatico: oggi risolto oltre il 99,7%, per vent'anni il primo test di ogni idea nuova.
ImageNet
2009 · Fei-Fei Li e altri
14 milioni di immagini etichettate a mano in ventimila categorie, e la gara annuale che ne derivò. La dimostrazione che i dati sono un contributo scientifico quanto gli algoritmi.
AlexNet
2012 · Krizhevsky, Sutskever, Hinton
Vince ImageNet con dieci punti di margine sul secondo, usando due schede grafiche da gioco, ReLU e dropout. La data convenzionale di inizio dell'era attuale: nel 2013 quasi nessuno presentava più metodi non neurali.
Riconoscimento vocale profondo
2012 · Hinton, Deng, Yu e altri
Reti profonde sostituiscono le miscele di gaussiane nei sistemi a modelli di Markov nascosti e tagliano l'errore sulle parole di circa un quarto. In due anni sono in tutti i telefoni: la prima vittoria industriale del deep learning, prima ancora della visione.
Rete convoluzionale
1980 Fukushima · 1989-98 LeCun
Applica lo stesso piccolo filtro su tutta l'immagine, sfruttando il fatto che un bordo è un bordo dovunque si trovi. Riduce i parametri di ordini di grandezza e incorpora nell'architettura il fatto che spostare l'immagine sposta le caratteristiche (equivarianza), da cui il pooling ricava tolleranza agli spostamenti.
Kernel · stride · padding
I parametri geometrici della convoluzione: la dimensione della finestra, di quanto scorre a ogni passo, e come si trattano i bordi. Determinano risoluzione e costo di ogni strato.
Pooling
Ridurre la risoluzione prendendo il massimo o la media di ogni piccola regione. Aggiunge tolleranza a piccoli spostamenti e taglia il costo; nelle architetture recenti è spesso sostituito da convoluzioni con passo maggiore.
Campo ricettivo
La porzione di immagine che influenza un singolo neurone. Cresce con la profondità: i primi strati vedono bordi, gli ultimi oggetti interi. È la gerarchia visiva che la rete costruisce da sola.
VGG · Inception · ResNet
2014 · 2014 · 2015
Le tre generazioni che hanno codificato la buona pratica: filtri piccoli e molti strati, moduli a più risoluzioni in parallelo, e connessioni residue che sbloccano la profondità arbitraria.
Transfer learning
2014-
Prendere una rete addestrata su un compito grande e riadattarla a un compito piccolo. Ha reso il deep learning accessibile a chi ha mille esempi invece di un milione, ed è la logica su cui si fonda tutta l'era dei modelli di fondazione.
Aumento dei dati
Generare varianti degli esempi — ritagli, riflessioni, variazioni di colore — per insegnare quali trasformazioni non cambiano l'etichetta. Il modo più economico di comprare dati.
U-Net
2015 · Ronneberger e altri
Architettura a clessidra con collegamenti diretti fra livelli simmetrici, nata per la segmentazione di immagini biomediche. È stata la rete dei primi modelli di diffusione (2020-2022); dal 2023 i generatori di immagini e video più recenti la sostituiscono con transformer di diffusione (DiT).
Rilevamento oggetti · YOLO
2014 R-CNN · 2016 YOLO
Individuare e classificare più oggetti con i loro rettangoli. YOLO lo fa in una sola passata invece di proporre e verificare regioni: è ciò che ha reso il rilevamento praticabile in tempo reale.
Rete ricorrente
1986-1990
Rete con uno stato interno che si aggiorna elemento per elemento: elabora sequenze di lunghezza arbitraria con parametri fissi. Il suo limite è strutturale — essendo sequenziale, non si parallelizza.
LSTM · GRU
1997 Hochreiter, Schmidhuber · 2014 Cho
Ricorrenti con porte che decidono cosa scrivere, cosa dimenticare e cosa leggere dalla memoria interna. La porta di dimenticanza arriva nel 2000 (Gers e altri). Hanno risolto il gradiente che svanisce nelle sequenze e retto vent'anni di traduzione e riconoscimento vocale.
Retropropagazione nel tempo
1990 · Werbos
Addestrare una rete ricorrente srotolandola lungo la sequenza e trattandola come una rete profonda quanto la sequenza è lunga. Costoso in memoria, ed è il motivo per cui si troncava a poche decine di passi.
Seq2seq
2014 · Sutskever, Vinyals, Le
Un codificatore comprime la frase d'ingresso in un vettore, un decodificatore ne genera la traduzione. Il primo sistema di traduzione neurale end-to-end competitivo con la traduzione statistica (insieme a Cho e altri, 2014), e il collo di bottiglia del vettore unico è ciò che ha motivato l'attenzione.
Attenzione
2014 · Bahdanau, Cho, Bengio
Invece di un vettore riassuntivo, il decodificatore guarda a ogni passo tutta la frase d'ingresso pesando le parti rilevanti. Nata come rimedio a un collo di bottiglia, si è rivelata l'unica cosa necessaria.
Word2vec · GloVe
2013 Mikolov · 2014 Pennington
Rappresentare le parole come vettori appresi dai contesti in cui appaiono, con la proprietà che le relazioni semantiche diventano direzioni nello spazio. Il risultato che ha reso evidente a tutti, con l'aritmetica re − uomo + donna ≈ regina, che il significato può essere geometria.
Embedding · spazio latente
La rappresentazione di un oggetto come vettore in uno spazio continuo dove la vicinanza corrisponde alla somiglianza. Il concetto unificante di tutto il deep learning: parole, immagini, utenti, molecole diventano tutti punti.
Similarità cosina
L'angolo fra due vettori usato come misura di somiglianza, insensibile alla loro lunghezza. La metrica su cui si regge ogni ricerca semantica.
Modello linguistico n-gram
anni '80-2000
Prevedere la parola successiva contando le sequenze di n parole in un grande corpus. Semplice ed efficace fino a n≈5, oltre il quale i conteggi diventano tutti zero: il problema che gli embedding risolvono.
Modello linguistico neurale
2003 · Bengio e altri
Una rete che impara insieme un vettore per ogni parola e la probabilità della parola successiva. Risolve la sparsità degli n-gram: parole simili hanno vettori vicini, quindi ciò che si impara su una frase vale per le frasi simili. È lo stesso obiettivo di un LLM, vent'anni prima.
GAN
2014 · Goodfellow e altri
Due reti in competizione: una genera falsi, l'altra cerca di smascherarli, e migliorano insieme. Ha prodotto le prime immagini sintetiche fotorealistiche; instabile da addestrare, superato dalla diffusione.
Collasso di modalità
Il generatore scopre un piccolo insieme di uscite che ingannano il discriminatore e produce solo quelle. La patologia caratteristica delle GAN, e il motivo principale per cui erano difficili da usare.
StyleGAN · CycleGAN
2018 · 2017
Controllo separato di stile e struttura nella generazione di volti; e traduzione fra domini senza coppie di esempi corrispondenti. I due risultati che hanno portato le GAN nell'uso comune: volti di persone inesistenti indistinguibili da foto, e trasformazioni cavallo-zebra o estate-inverno senza esempi appaiati.
Autoencoder variazionale
2013 · Kingma, Welling
Autoencoder in cui lo spazio latente è una distribuzione probabilistica, quindi campionabile: si possono generare esempi nuovi e non solo ricostruire. Il trucco della riparametrizzazione è ciò che rende il campionamento derivabile.
Flussi normalizzanti
2015 · Rezende, Mohamed
Trasformazioni invertibili che portano una distribuzione semplice su una complessa, con verosimiglianza calcolabile esattamente. Eleganti e vincolati; l'idea è tornata come flow matching.
WaveNet
2016 · DeepMind
Generazione audio campione per campione con convoluzioni dilatate. La prima sintesi vocale neurale che dimezza la distanza percepita dal parlato reale (con Tacotron 2, nel 2017, quasi indistinguibile), e un antenato diretto dei modelli autoregressivi su sequenze lunghe.
Distillazione della conoscenza
2015 · Hinton, Vinyals, Dean
Addestrare un modello piccolo a riprodurre le probabilità di uno grande, non solo le sue risposte. Le probabilità contengono più informazione dell'etichetta: è così che nascono quasi tutti i modelli compatti di oggi.
Potatura · quantizzazione
1989-
Rimuovere i pesi ininfluenti, e rappresentare i restanti con meno bit. Le due leve classiche per far entrare un modello in un dispositivo piccolo.
Ipotesi del biglietto vincente
2019 · Frankle, Carbin
In una rete grande esiste una sottorete rada che, riaddestrata dalla stessa inizializzazione, raggiunge la stessa accuratezza. Suggerisce che la sovraparametrizzazione serva a comprare biglietti della lotteria, non capacità.
Meta-apprendimento · MAML
2017 · Finn, Abbeel, Levine
«Imparare a imparare»: trovare un'inizializzazione da cui pochi passi di addestramento bastino per un compito nuovo. Ambizione in parte assorbita dall'apprendimento in contesto dei modelli linguistici, che fa la stessa cosa senza aggiornare pesi.
AutoML · ricerca di architettura
2017-
Automatizzare la scelta di architettura e iperparametri con ricerca o rinforzo. Costosissimo e in larga parte superato: le architetture vincenti si sono rivelate poche e semplici.
VII
1957-2020

Apprendimento per rinforzo

Il terzo paradigma: nessuna risposta corretta, solo una ricompensa numerica dopo una sequenza di azioni. Ha prodotto i risultati più spettacolari — Atari, Go, StarCraft — e per anni pochissime applicazioni pratiche. Poi ha trovato la sua nicchia decisiva: il post-training dei modelli linguistici.

Processo decisionale di Markov
1957 · Bellman
Il formalismo del rinforzo: stati, azioni, probabilità di transizione, ricompense, fattore di sconto. Tutto il campo studia come risolverlo quando le probabilità sono ignote e gli stati troppi per essere enumerati.
Equazione di Bellman
1957 · Bellman
Il valore di uno stato è la ricompensa immediata più il valore scontato dello stato successivo. Una relazione ricorsiva da cui derivano quasi tutti gli algoritmi di rinforzo.
Politica · funzione valore
La politica è la regola che sceglie l'azione; la funzione valore stima quanto si guadagnerà da uno stato. Ottimizzare direttamente la prima o passare per la seconda è la divisione principale del campo.
Differenza temporale
1988 · Sutton
Aggiornare la stima di valore usando la stima successiva invece di aspettare l'esito finale. Permette di imparare durante l'episodio; il segnale di errore che produce ha un analogo misurato nella dopamina.
Q-learning
1989 · Watkins
Impara il valore di ogni coppia stato-azione senza modello dell'ambiente, e converge all'ottimo anche seguendo una politica diversa da quella che sta valutando.
TD-Gammon
1992 · Tesauro
Una rete neurale che impara il backgammon giocando contro se stessa, con la differenza temporale. Arriva al livello dei campioni del mondo e scopre aperture poi adottate dagli umani. Vent'anni prima di DQN, la prova che rete più rinforzo più self-play funziona.
DQN
2013-2015 · DeepMind
Q-learning con una rete convoluzionale che legge direttamente i pixel: 49 giochi Atari con un solo algoritmo e nessuna conoscenza specifica. La dimostrazione che il rinforzo profondo funziona.
Riproduzione dell'esperienza
1992 · Lin
Conservare le transizioni passate in un archivio e ricampionarle a caso, per rompere la correlazione fra esempi consecutivi. Uno dei due accorgimenti senza cui DQN non convergeva.
Gradiente di politica · REINFORCE
1992 · Williams
Aumentare la probabilità delle azioni che hanno portato a ricompense alte. Semplice e ad altissima varianza; tutta la ricerca successiva è consistita nel ridurre quella varianza.
Actor-critic · A3C
1983 Barto, Sutton, Anderson · 2016 A3C, Mnih e altri
Due componenti: uno sceglie le azioni, l'altro stima quanto valgono e fornisce un riferimento che riduce la varianza. Lo schema architetturale su cui si basa quasi tutto il rinforzo moderno, RLHF compreso.
TRPO · PPO
2015 · 2017 · Schulman e altri
Impediscono alla politica di cambiare troppo in un solo passo, perché nel rinforzo un passo eccessivo distrugge la capacità di raccogliere dati utili. PPO ottiene lo stesso effetto con un semplice troncamento, ed è stato l'algoritmo predefinito dell'RLHF; nel rinforzo dei modelli ragionanti lo hanno in gran parte sostituito varianti senza critico come GRPO.
Esplorazione e sfruttamento
Il dilemma fondamentale: usare ciò che si sa funzionare, o provare qualcosa di nuovo che potrebbe funzionare meglio. Formalizzato nel problema del bandito a più braccia, e presente in ogni sistema che deve decidere sotto incertezza.
Ricompensa sparsa · shaping
Quando la ricompensa arriva solo alla fine di migliaia di azioni, imparare è quasi impossibile. Si aggiungono ricompense intermedie — e si scopre che l'agente ottimizza quelle invece dell'obiettivo vero.
Assegnazione del merito
Capire quale delle cento azioni compiute ha causato l'esito. Il problema centrale del rinforzo, e lo stesso che si presenta quando si deve premiare un ragionamento lungo di cui si vede solo la conclusione.
Ricerca ad albero Monte Carlo
2006 · Coulom, Kocsis
Costruisce l'albero di ricerca in modo asimmetrico, approfondendo i rami promettenti valutati con simulazioni casuali. Ha portato i programmi di Go da principianti a forti dilettanti (5-6 dan amatoriali) senza nessuna rete neurale. Contro i professionisti vincevano solo con quattro o cinque pietre di vantaggio: il salto successivo è venuto da AlphaGo.
AlphaGo
2016 · DeepMind
Batte Lee Sedol combinando ricerca ad albero, una rete che propone mosse e una che valuta posizioni, addestrate su partite umane e poi contro se stesse. Il Go era considerato fuori portata per un decennio ancora.
AlphaZero · MuZero
2017 · 2019
Il primo impara Go, scacchi e shogi partendo solo dalle regole e dal gioco contro se stesso, superando ogni programma precedente. Il secondo elimina anche le regole, imparando il modello dell'ambiente. La conoscenza umana passa da vantaggio a zavorra.
Self-play
1959-
Un sistema che genera i propri dati giocando contro se stesso, con la difficoltà che sale automaticamente col livello. La forma di supervisione più economica esistente — dove è applicabile.
Rinforzo basato su modello
Imparare un modello dell'ambiente e pianificare al suo interno, invece di imparare solo per tentativi. Molto più efficiente in termini di esperienza necessaria, e sensibile agli errori del modello appreso.
Clonazione comportamentale
Imparare per imitazione da dimostrazioni, trattandolo come apprendimento supervisionato. Fragile fuori dalla distribuzione delle dimostrazioni; è esattamente ciò che fa l'adattamento supervisionato di un modello linguistico.
Rinforzo inverso
2000 · Ng, Russell
Dedurre la funzione di ricompensa osservando un comportamento esperto, invece di specificarla. Il precursore concettuale dell'RLHF: non si sa dire cosa si vuole, ma si sa riconoscerlo.
Divario di simulazione
La distanza fra il simulatore in cui l'agente impara e il mondo in cui deve agire. Si affronta randomizzando aggressivamente i parametri del simulatore, così che la realtà sia una delle varianti previste.
Aggiramento della ricompensa
L'agente massimizza la metrica violandone lo spirito: la barca che gira in tondo raccogliendo bonus invece di finire la gara. Il fenomeno che rende difficile il post-training, non un aneddoto curioso.
VIII
2017-oggi

Il transformer e i modelli linguistici

Un'unica architettura che ha assorbito linguaggio, visione, audio, codice, proteine e robotica. La sua qualità decisiva non è l'accuratezza ma la parallelizzabilità: si può addestrare su decine di migliaia di schede, e questo l'ha resa il veicolo delle leggi di scala.

Transformer
2017 · Vaswani e altri
Architettura basata interamente sull'attenzione, senza ricorrenza né convoluzione. Elabora tutta la sequenza in parallelo invece che elemento per elemento: è questa proprietà, non la qualità, che ha permesso di scalarla di sei ordini di grandezza.
Auto-attenzione · Q, K, V
2017
Ogni elemento emette una query, espone una chiave e un valore; la somiglianza fra query e chiavi determina quanto di ciascun valore viene letto. Una ricerca associativa derivabile, ricalcolata a ogni strato.
Attenzione multi-testa
2017
Lo stesso meccanismo eseguito in parallelo decine di volte con proiezioni diverse, così che teste distinte possano seguire relazioni distinte — accordo grammaticale, coreferenza, parentesi aperte.
Maschera causale
2017
Impedisce a ogni posizione di vedere quelle successive, azzerando la metà superiore della matrice di attenzione. È ciò che rende il modello capace di generare, e che permette di ricavare da una sequenza di 8.000 token altrettanti esempi di addestramento.
Cross-attention
2017
Attenzione in cui le query vengono da una sequenza e chiavi e valori da un'altra. È il ponte fra codificatore e decodificatore, e uno dei due modi di collegare testo e immagine. L'altro, oggi prevalente, è inserire i token dell'immagine direttamente nella sequenza.
Codifica posizionale · RoPE
2017 · 2021 Su e altri
L'attenzione è indifferente all'ordine, quindi la posizione va iniettata. RoPE lo fa ruotando query e chiavi di un angolo proporzionale alla posizione, così che il prodotto dipenda solo dalla distanza relativa: è lo standard attuale e ciò che rende estendibile la finestra.
Blocco feed-forward · MLP
La seconda metà di ogni blocco: due trasformazioni lineari con una non linearità in mezzo, applicate a ogni posizione indipendentemente. Contiene circa due terzi dei parametri, ed è dove si ritiene risiedano i fatti memorizzati.
Flusso residuo
Il vettore che attraversa tutti gli strati e a cui ogni blocco somma il proprio contributo. Letto come un canale di comunicazione condiviso su cui i blocchi scrivono e leggono: la metafora centrale dell'interpretabilità meccanicistica.
Solo encoder · BERT
2018 · Devlin e altri
Attenzione bidirezionale, addestrato mascherando parole a caso in mezzo al testo. Produce rappresentazioni, non testo: resta la scelta giusta per embedding, classificazione e reranking, a un centesimo del costo.
Encoder-decoder · T5
2019 · Raffel e altri
Due pile collegate da cross-attention, con ogni compito riformulato come testo verso testo. Adatto quando ingresso e uscita sono di natura diversa; meno scalabile del solo decodificatore.
Solo decoder · GPT
2018-2020 · OpenAI
Una sola pila causale, un solo obiettivo: prevedere il token successivo. Ha vinto perché ogni compito si può riscrivere come continuazione di testo, e perché quell'obiettivo scala senza limiti apparenti.
Tokenizzazione · BPE
1994 Gage · 2015 Sennrich
Si parte dai singoli caratteri (dal 2019, con GPT-2, dai singoli byte) e si fondono ripetutamente le coppie più frequenti, ottenendo un vocabolario in cui le parole comuni sono intere e quelle rare si scompongono. Nessuna parola resta fuori vocabolario.
WordPiece · SentencePiece · Unigram
2012-2018
Varianti della segmentazione in sottoparole: alcune scelgono le fusioni per verosimiglianza invece che per frequenza, altre operano direttamente sul testo grezzo senza presupporre spazi — indispensabile per cinese e giapponese.
Token · vocabolario
L'unità elementare che il modello vede: in italiano circa tre o quattro caratteri. Il vocabolario dei modelli attuali va da 100.000 a 250.000 voci, fissato prima dell'addestramento: cambiarlo dopo si può solo aggiungendo voci e riaddestrando, a caro prezzo.
Modello di fondazione
2021 · Stanford
Un modello addestrato una volta su dati vastissimi e poi adattato a moltissimi compiti. Il termine ha imposto un cambio di prospettiva: il modello è infrastruttura, non applicazione.
Apprendimento in contesto
2020 · Brown e altri
La capacità di eseguire un compito nuovo da pochi esempi nel prompt, senza modificare un solo peso. Emersa senza essere progettata, ed è la scoperta che ha reso i modelli linguistici uno strumento generale.
Zero-shot · few-shot
Eseguire un compito con la sola descrizione, oppure con due o tre esempi. Nei modelli attuali il divario fra i due si è ridotto quasi a zero: gli esempi servono più a fissare il formato che a insegnare il compito.
Catena di pensiero
2022 · Wei e altri
Chiedere al modello di esporre i passaggi intermedi migliora nettamente i risultati sui problemi a più passi. Ogni token scritto è calcolo aggiuntivo che rientra nel contesto: il ragionamento non è metafora, è memoria di lavoro esterna.
Auto-consistenza
2022 · Wang e altri
Generare molti ragionamenti indipendenti e tenere la risposta più frequente. Vale diversi punti su matematica e logica, al prezzo di moltiplicare il costo di inferenza.
Leggi di scala
2020 · Kaplan e altri
La perdita cala come una legge di potenza al crescere di calcolo, dati e parametri, in modo regolare su molti ordini di grandezza. Regolarità empirica, non teorema: è ciò su cui si pianificano investimenti da miliardi.
Chinchilla · rapporto ottimale
2022 · Hoffmann e altri
Corregge le leggi precedenti: a budget fisso conviene circa 20 token per parametro. I modelli dell'epoca erano tutti troppo grandi e troppo poco addestrati. Oggi si va deliberatamente oltre quel rapporto, per abbassare il costo d'uso.
Capacità emergenti
2022 · Wei e altri
Abilità assenti nei modelli piccoli che compaiono improvvisamente oltre una certa scala. Fenomeno molto discusso: parte dell'apparente discontinuità dipende da metriche a soglia, e si attenua misurando in modo continuo.
Perplessità
Quanto il modello è sorpreso dal testo che legge: l'esponenziale dell'entropia incrociata media. Confrontabile solo fra modelli con lo stesso tokenizer, e per questo meno usata di quanto meriterebbe.
Mixture of experts
1991 Jacobs, Jordan · 2017 Shazeer · 2021 Fedus
Il blocco feed-forward diventa un banco di esperti, di cui per ogni token se ne attivano solo pochi. Permette mille miliardi di parametri con il costo di calcolo di qualche decina: capacità e calcolo si disaccoppiano.
Router · bilanciamento del carico
La piccola rete che decide a quali esperti mandare ogni token. Senza un meccanismo di bilanciamento collassa su pochi esperti e gli altri restano non addestrati. All'inizio si usava un termine di perdita ausiliario; dal 2024 si preferisce un bias per esperto, corretto a ogni passo in base al carico, che bilancia senza disturbare l'obiettivo principale. Spesso si aggiungono uno o due esperti «condivisi», sempre attivi, accanto a centinaia di esperti piccoli.
Attenzione a query raggruppate
2023 · Ainslie e altri
Molte teste di query condividono le stesse chiavi e valori, riducendo la cache KV di un fattore quattro o otto con perdita trascurabile. Un'ottimizzazione di memoria che ha reso praticabili i contesti lunghi.
Attenzione latente multi-testa · MLA
2024 · DeepSeek
Invece di condividere chiavi e valori fra teste, come fa l'attenzione a query raggruppate, li comprime in un unico vettore latente piccolo per token e li ricostruisce al volo. La cache KV si riduce di oltre il 90% rispetto all'attenzione multi-testa, senza la perdita di qualità della condivisione. Più calcolo, molta meno memoria: il compromesso giusto quando la banda è il collo di bottiglia.
Attenzione sparsa · a finestra
2019-
Limitare ogni posizione a guardare un sottoinsieme delle precedenti — una finestra locale, posizioni scelte, alcuni token globali — per evitare il costo quadratico. Compromesso fra costo e capacità di collegare parti distanti, finché lo schema è fisso. Dal 2025 è appreso: un indicizzatore leggero assegna un punteggio a tutti i token precedenti e l'attenzione completa si calcola solo sui migliori duemila circa. Quasi nessuna perdita, costo quasi lineare: è la tecnica dietro i contesti da un milione di token dei modelli aperti del 2026.
FlashAttention
2022 · Dao e altri
Riscrive l'attenzione per non materializzare mai la matrice completa, calcolandola a blocchi nella memoria veloce del processore. Matematicamente identica, molte volte più rapida: il problema era il traffico di memoria, non le operazioni.
Modello a spazio degli stati · Mamba
2023 · Gu, Dao
Alternativa all'attenzione con costo lineare nella lunghezza e stato di dimensione fissa. Competitiva su molte prove, meno abile nel richiamo esatto: le architetture recenti alternano strati dei due tipi.
Attenzione lineare · architetture ibride
2024-2025 · Yang e altri (Gated DeltaNet)
Sostituisce la matrice di attenzione con uno stato di dimensione fissa, aggiornato token per token con una regola «delta» e un cancello che decide quanto dimenticare. Da sola ricorda male i dettagli esatti; alternata con strati di attenzione completa, di solito tre lineari ogni uno completo, mantiene la qualità e riduce di circa quattro volte la cache KV. È lo schema di Qwen3-Next, Kimi Linear e MiniMax, e il motivo per cui contesti da centinaia di migliaia di token sono diventati economici.
Modello linguistico a diffusione
2025
Invece di scrivere da sinistra a destra, parte da una risposta tutta mascherata e la riempie in pochi passaggi paralleli, correggendo ciò che ha già scritto. Molto più rapido nella generazione, ancora indietro in qualità sui compiti di ragionamento. Un'alternativa reale, non ancora quella dominante.
Allucinazione
Un'affermazione fluente e falsa. Non è un malfunzionamento ma una conseguenza dell'obiettivo: il modello produce la continuazione più plausibile, e non dispone di un segnale interno che distingua ciò che sa da ciò che sta ricostruendo.
Pappagallo stocastico
2021 · Bender e altri
La tesi critica secondo cui i modelli linguistici ricombinano forme senza comprensione né riferimento al mondo. L'articolo più citato del dibattito, e il termine di riferimento di ogni discussione successiva sulla comprensione.
IX
2019-oggi

Addestrare, adattare, servire

La parte ingegneristica, dove si decide se un modello è economicamente sostenibile. Nulla qui riguarda l'intelligenza: riguarda memoria, banda e sincronizzazione fra decine di migliaia di processori.

Pre-addestramento
La fase lunga e costosa: prevedere il token successivo su decine di migliaia di miliardi di token. Produce il modello base, che sa continuare qualsiasi testo e non sa rispondere a una domanda.
Curriculum · fase di raffreddamento
Il mix di dati non resta fisso: nell'ultimo 10-20% dei token, mentre il passo di apprendimento cala, si passa a materiale molto più selezionato. Quella coda finale sposta i punteggi in modo sproporzionato ai token che contiene.
Deduplicazione
Eliminare i documenti identici e quasi identici, spesso il 40% del crawl. Il testo ripetuto viene memorizzato invece che appreso: a parità di calcolo, deduplicare migliora la generalizzazione più di molti accorgimenti architetturali.
Decontaminazione
Rimuovere dai dati di addestramento i documenti che condividono lunghe sequenze con i test di valutazione. Senza, i punteggi misurano memorizzazione; la contaminazione entra per vie indirette e va ricontrollata alla fine.
Dati sintetici
2023-
Testo generato da altri modelli e filtrato, ormai una frazione significativa dei corpora. Aggira l'esaurimento del testo pubblico di qualità; il rischio dibattuto è il collasso del modello se la selezione è debole.
Impacchettamento
Concatenare i documenti fino a riempire sequenze di lunghezza fissa, con una maschera che impedisce a un documento di guardare il precedente. Evita di sprecare metà del calcolo su riempimento vuoto.
Predizione di più token
2024 · Gloeckle e altri; DeepSeek-V3
Oltre al token successivo, piccoli moduli aggiuntivi imparano a prevedere il secondo e il terzo. Il segnale in più rende l'addestramento più denso. In inferenza gli stessi moduli propongono token in anticipo che il modello verifica, come nella decodifica speculativa, con una velocità quasi doppia.
Precisione mista · bf16 · fp8
2017-2024
Le moltiplicazioni di matrici in bassa precisione, gli accumuli e gli aggiornamenti dei pesi in alta. Se si tenessero i pesi solo in bf16, che distingue variazioni relative di circa 4 per mille, gran parte degli aggiornamenti, dell'ordine di 10⁻³-10⁻⁵ del peso, verrebbe arrotondata a zero. Per questo la copia principale dei pesi resta in fp32.
FP4 · formati a microscala
2023 OCP · 2025 NVIDIA
Numeri a 4 bit (un segno, due bit di esponente, uno di mantissa) raggruppati in blocchi di 16 o 32 che condividono un fattore di scala. La scala per blocco assorbe la diversa ampiezza dei valori e rende usabili 16 livelli soli. Raddoppia il throughput e dimezza la memoria rispetto a fp8; nel 2025 è stato mostrato un pre-addestramento su 10.000 miliardi di token in NVFP4 con perdita vicina a fp8.
Parallelismo dei dati
Ogni replica elabora un lotto diverso, poi si mediano i gradienti fra tutte. L'asse più semplice, limitato dal fatto che ogni replica deve contenere il modello intero.
Parallelismo di tensore
2019 · Megatron
Ogni matrice tagliata a fette fra più schede. Richiede due sincronizzazioni per strato, quindi si usa solo dentro un singolo server dove i collegamenti sono veloci.
Parallelismo di pipeline
2018 · GPipe
Gruppi di strati su gruppi di schede, con solo l'attivazione al confine da trasmettere. Traffico minimo, ma introduce una «bolla» di inattività che si riduce spezzando il lotto in molti micro-lotti.
ZeRO · FSDP
2019 · 2021
Distribuire stati dell'ottimizzatore, gradienti e pesi fra le repliche invece di replicarli, ricomponendoli al volo quando servono. Si scambia memoria con comunicazione, in livelli di aggressività crescente.
Ricalcolo delle attivazioni
2016
Non conservare le attivazioni intermedie ma ricalcolarle durante il passaggio all'indietro. Costa circa un terzo di calcolo in più e risparmia gran parte della memoria: è quasi sempre il compromesso giusto.
Picco di perdita
La perdita salta improvvisamente e non sempre rientra. Si torna al salvataggio precedente, si saltano i lotti sospetti e si riparte con passo ridotto. La norma del gradiente è l'indicatore che lo anticipa.
Taglio del gradiente
2013
Se la norma globale del gradiente supera una soglia, si riscala tutto. Costa quasi nulla ed evita che un singolo lotto anomalo rovini settimane di addestramento.
Parametrizzazione trasferibile
2021 · Yang, Hu
Scalando inizializzazione e passo di apprendimento in funzione della larghezza, gli iperparametri migliori su un modello da 100 M restano i migliori su uno mille volte più grande. Senza questo, tarare un modello di frontiera sarebbe un tentativo unico alla cieca.
Muon
2024 · Jordan; 2025 Moonshot
Per le matrici dei pesi sostituisce AdamW: l'aggiornamento viene ortogonalizzato con poche iterazioni di Newton-Schulz, così che tutte le direzioni avanzino in modo equilibrato. A parità di risultato richiede circa un terzo di calcolo in meno e metà della memoria per gli stati dell'ottimizzatore; su larga scala servono accorgimenti contro l'esplosione dei logit di attenzione.
Fine-tuning
Continuare l'addestramento su dati specifici con passo molto ridotto. Efficace per stile e formato, poco efficace per iniettare conoscenza nuova: per quella conviene il contesto.
LoRA · QLoRA
2021 Hu e altri · 2023 Dettmers
Congelare i pesi e addestrare due piccole matrici il cui prodotto è la correzione. Riduce i parametri addestrabili di mille volte; QLoRA aggiunge la quantizzazione del modello base, permettendo di adattare un modello da 70 G su una scheda singola.
Dimenticanza catastrofica
1989 · McCloskey, Cohen
Addestrando su un compito nuovo la rete perde quello vecchio. La ragione per cui l'adattamento va fatto con passo minimo e poche epoche, e per cui i modelli non imparano durante l'uso.
Prefill e decode
Il prompt si elabora in un colpo solo, in parallelo, saturando il processore; la risposta si genera un token per volta, limitata dalla banda di memoria. Ecco perché leggere costa molto meno che scrivere.
Cache KV
Chiavi e valori dei token già elaborati, conservati per non ricalcolarli. Cresce linearmente col contesto e occupa gigabyte: è il vincolo che decide quante conversazioni una scheda può servire insieme.
Temperatura · top-k · top-p
I parametri di campionamento: quanto appiattire la distribuzione, e quanti candidati considerare — i primi k, oppure i più probabili fino a coprire una massa p. È l'unico punto in cui entra il caso: due risposte diverse alla stessa domanda nascono qui.
Ricerca a fascio
Mantenere le n continuazioni più probabili invece di una sola. Standard nella traduzione automatica, quasi abbandonata nel dialogo: produce testo corretto e piatto.
Decodifica speculativa
2022-2023
Un modello piccolo propone alcuni token, il grande li verifica in una sola passata e accetta il prefisso corretto. Due o tre volte più veloce con uscita statisticamente identica.
Batching continuo · PagedAttention
2022 Orca (batching continuo) · 2023 Kwon e altri, vLLM (PagedAttention)
Le richieste entrano e escono dal lotto man mano che finiscono, e la cache KV è gestita a pagine come la memoria virtuale di un sistema operativo. Ha moltiplicato per diverse volte il numero di utenti serviti dalla stessa scheda.
Servizio disaggregato
2024 · DistServe, Splitwise
Prefill e decode girano su gruppi di schede separati: il primo limitato dal calcolo, il secondo dalla banda. La cache KV prodotta dal prefill viaggia in rete verso le schede di decode. Ogni gruppo si dimensiona e si configura per il proprio lavoro, e una richiesta lunga in ingresso non rallenta più chi sta generando. È lo schema dei framework di produzione dal 2025 (NVIDIA Dynamo, llm-d, SGLang).
Quantizzazione post-addestramento
2022-2023
Ridurre i pesi a 8 o 4 bit dopo l'addestramento, usando un piccolo campione per calibrare le scale. A 4 bit la perdita di qualità è piccola e la memoria si divide per quattro: è ciò che permette di eseguire modelli grandi su hardware personale.
Estensione del contesto
2023-
Si addestra a 4-8 mila token per quasi tutto il percorso, poi si riscalano le frequenze delle rotazioni posizionali e si continua brevemente su documenti lunghi. Il contesto esteso costa pochi punti percentuali del totale.
Uscita strutturata · decodifica vincolata
2023-
Azzerare le probabilità dei token che violerebbero una grammatica o uno schema JSON, garantendo un'uscita sintatticamente valida per costruzione invece di sperarci.
X
2017-oggi

Post-training, allineamento, interpretabilità

Il modello base sa già quasi tutto ciò che saprà. Questa fase non aggiunge conoscenza: seleziona, fra le mille continuazioni plausibili, quella che vale la pena dare. In termini di quota di calcolo è la parte cresciuta più rapidamente negli ultimi anni.

Adattamento supervisionato · SFT
2019-
Addestramento su conversazioni esemplari scritte o riviste da persone, con la perdita calcolata solo sulla risposta. Tecnicamente identico al pre-addestramento; è la fase che trasforma un continuatore di testo in un interlocutore.
Modello di dialogo · delimitatori di turno
I token speciali che marcano chi parla. Vanno riservati nel vocabolario prima del pre-addestramento, e usati in produzione esattamente come nell'SFT: una differenza di un carattere degrada le risposte in modo difficile da diagnosticare.
RLHF
2017 Christiano · 2022 Ouyang
Persone scelgono fra due risposte, dalle scelte si addestra un modello di ricompensa, e la politica viene spinta verso i punteggi alti con PPO. Nasce dall'osservazione che è più facile riconoscere una buona risposta che scriverla.
Modello di ricompensa
Una rete addestrata a prevedere quale risposta un valutatore umano preferirebbe. Diventa il giudice automatico; se ha un difetto sistematico, la politica lo troverà e lo sfrutterà.
Penalità KL
Un termine che penalizza l'allontanamento dal modello di partenza. Senza, l'ottimizzazione trova uscite con ricompensa altissima e testo degenere: è il freno che tiene insieme tutto il processo.
DPO
2023 · Rafailov e altri
Ottimizza direttamente sulle coppie preferite, senza modello di ricompensa né rinforzo. Molto più semplice e stabile; è la scelta ragionevole per chi non ha un'infrastruttura di rinforzo.
RLAIF · IA costituzionale
2022 · Bai e altri
Sostituire il valutatore umano con un modello che giudica seguendo un insieme di principi scritti. Rende il processo scalabile e i criteri ispezionabili — sono un documento, non una distribuzione di preferenze implicite.
RLVR
2024-
Rinforzo su compiti la cui risposta è controllabile da una macchina: i test passano, il risultato numerico è quello atteso. Il premio è oggettivo, quindi si può iterare senza umani — è ciò che ha prodotto il salto su codice, matematica e ragionamento lungo. Nel 2025 DeepSeek-R1-Zero ha mostrato che ragionamenti lunghi, verifiche e ripensamenti emergono dal solo rinforzo. Da allora il metodo si estende a compiti non verificabili, con rubriche giudicate da un modello, e ad ambienti agentici in cui il premio è il compito completato. Resta aperto quanto crei capacità nuove e quanto renda affidabili quelle già latenti.
GRPO
2024 · DeepSeek
Variante di PPO che elimina il modello di valore usando come riferimento la media delle ricompense di un gruppo di risposte alla stessa domanda. Dimezza la memoria richiesta: ha reso il rinforzo su larga scala accessibile fuori dai laboratori maggiori. Nel 2025 ne sono nate molte varianti (DAPO, Dr. GRPO, GSPO) che correggono una preferenza involontaria per le risposte lunghe, scartano i gruppi in cui tutte le risposte hanno lo stesso premio e calcolano il rapporto di importanza sull'intera sequenza invece che sul singolo token.
Campionamento con rifiuto · best-of-N
Generare N risposte, tenere la migliore secondo un giudice, e riaddestrare su quelle. Semplicissimo e quasi sempre efficace: la linea di riferimento che ogni metodo di rinforzo più elaborato deve battere.
Modello di ricompensa di processo
2023 · Lightman e altri
Giudica ogni passaggio del ragionamento invece del solo risultato finale. Costoso da etichettare, e risolve in parte l'assegnazione del merito: una risposta giusta ottenuta con un passaggio sbagliato non viene premiata.
Calcolo al momento dell'inferenza
2024-
Il secondo asse di scala: invece di un modello più grande, più token di ragionamento per ogni domanda. Si scala in sequenza (una catena più lunga) o in parallelo (molti tentativi indipendenti, poi voto o giudice). L'accuratezza sale con il logaritmo del budget e si paga a risposta invece che una volta sola: dal 2025 lo stesso modello risponde subito o ragiona a lungo secondo uno sforzo impostato per richiesta, e il costo diventa una scelta di chi lo usa.
Modello ragionante
2024-
Un modello addestrato con RLVR a produrre una lunga bozza prima di rispondere, spesso non mostrata all'utente. Non c'è un modulo logico in più: c'è lo stesso meccanismo, allenato a usare il proprio contesto come foglio di brutta.
Adulazione
2022 Perez e altri · 2023 Sharma e altri
La tendenza a dare ragione all'utente e a cambiare posizione quando viene contraddetto. Conseguenza diretta dell'addestramento su preferenze: le risposte concilianti vengono preferite, quindi vengono premiate.
Legge di Goodhart
1975 · Goodhart
Quando una misura diventa un obiettivo, cessa di essere una buona misura. Il principio che governa tutto il post-training: il modello ottimizza ciò che viene misurato, non ciò che si intendeva.
Allineamento
Il problema di far sì che un sistema persegua ciò che si intendeva e non una sua approssimazione formale. Comprende la specifica dell'obiettivo, la verifica del comportamento e la sorveglianza di sistemi più capaci di chi li sorveglia.
Specification gaming
Soddisfare la lettera dell'obiettivo violandone lo spirito. Documentato in decine di casi nel rinforzo, e la ragione per cui specificare correttamente un obiettivo è considerato un problema aperto.
Convergenza strumentale
2008 · Omohundro, Bostrom
La tesi che quasi qualunque obiettivo finale renda utili gli stessi obiettivi intermedi: procurarsi risorse, conservare se stessi, resistere alla modifica dei propri fini. L'argomento centrale della letteratura sul rischio.
Finzione di allineamento · disallineamento emergente
2024-2025
Esperimenti controllati mostrano modelli che si comportano diversamente quando credono di essere addestrati o osservati, per proteggere le proprie preferenze. Altri mostrano che un adattamento ristretto, come scrivere codice insicuro, generalizza in comportamenti ostili lontani dal compito. I rischi teorici della letteratura diventano oggetto di misura.
Red teaming
Squadre incaricate di far comportare male il modello prima del rilascio, con metodi manuali e automatici. Non dimostra la sicurezza: dimostra che gli attacchi noti sono stati coperti.
Jailbreak
2022-
Prompt costruiti per aggirare i rifiuti: giochi di ruolo, ipotesi accademiche, codifiche. Il modello non distingue fra istruzioni e contenuto in modo architetturale, quindi la difesa è statistica e mai definitiva.
Iniezione di prompt
2022 · Goodside; termine di Willison
Istruzioni ostili nascoste nei dati che il modello legge — una pagina web, un documento, un'email. Il problema di sicurezza più serio degli agenti: contenuto e comandi viaggiano nello stesso canale e non sono separabili.
Sorveglianza scalabile
2018-
Come valutare uscite che chi valuta non è in grado di giudicare da solo. Le proposte includono la scomposizione ricorsiva del compito e il dibattito fra due modelli arbitrato da una persona.
Interpretabilità meccanicistica
2020-
Il programma di capire come una rete calcola, individuando circuiti e caratteristiche invece di limitarsi a osservare il comportamento. L'unico approccio che promette garanzie e non solo statistiche.
Sovrapposizione · polisemanticità
2022 · Elhage e altri
La rete rappresenta più caratteristiche che dimensioni disponibili, sovrapponendole in direzioni non ortogonali. Ne consegue che un singolo neurone risponde a cose diverse e non è la giusta unità di analisi.
Autoencoder sparso
2023 · Anthropic, Cunningham e altri · 2024 scalati a milioni di caratteristiche (Anthropic, OpenAI)
Scompone le attivazioni in un dizionario molto più ampio di caratteristiche di cui poche attive per volta, districando la sovrapposizione. Ha prodotto milioni di caratteristiche leggibili, molte manipolabili direttamente.
Testa di induzione
2022 · Olsson e altri
Un circuito di due teste che completa uno schema già visto nel contesto: dato «A B … A», predice «B». La sua comparsa durante l'addestramento coincide con quella dell'apprendimento in contesto.
Vettore di direzione · patching
2023-
Individuare la direzione nello spazio delle attivazioni che corrisponde a un concetto e sommarla per modificare il comportamento; oppure sostituire attivazioni fra due esecuzioni per stabilire cosa causa cosa.
Grafi di attribuzione · tracciamento dei circuiti
2025 · Anthropic
Si sostituiscono gli strati MLP con transcoder a caratteristiche sparse e si segue, per un singolo prompt, quali caratteristiche causano quali altre fino all'uscita. Ha mostrato, per esempio, che un modello sceglie la parola in rima prima di scrivere il verso. Spiega bene singoli esempi; non ancora il modello intero.
Fedeltà della catena di pensiero
2023-
Il ragionamento esposto non corrisponde necessariamente al calcolo effettivo: il modello può arrivare alla risposta per altre vie e produrre una giustificazione plausibile a posteriori. Problema aperto e rilevante per la sorveglianza. Dal 2025 si usa un secondo modello per leggere il ragionamento e cogliere tentativi di aggirare i test. Funziona finché il ragionamento resta leggibile: penalizzare i pensieri «cattivi» in addestramento insegna al modello a non scriverli, non a non averli. Per questo i laboratori raccomandano di non ottimizzare direttamente la catena di pensiero.
XI
2020-oggi

Contesto, recupero, agenti

Il livello che sta fuori dal modello. I pesi sono congelati dal rilascio: tutto ciò che il sistema sa della situazione presente sta nel contesto, ed è testo. Questa sezione descrive i modi di riempirlo bene.

Finestra di contesto
Il numero massimo di token che il modello può considerare insieme: da circa 1.000 token nel 2019 (GPT-2) e 2.000 nel 2020 (GPT-3) a 200.000-1.000.000 oggi. È una scrivania, non una memoria: grande, finita, e sgombrata a ogni conversazione nuova.
Prompt di sistema
Le istruzioni poste in testa al contesto, con precedenza sul resto. La precedenza è statistica, indotta dal post-training, non un meccanismo dell'architettura: da qui la vulnerabilità all'iniezione.
Cache del prompt
2023-
Il prefisso che non cambia fra chiamate viene elaborato una volta e riusato: si paga una frazione e non si attende la rielaborazione. Impone di mettere il contenuto stabile all'inizio e quello variabile in coda.
Perdita in mezzo
2023 · Liu e altri
L'informazione all'inizio e alla fine del contesto viene usata meglio di quella al centro. Un vincolo importante sepolto a metà di un documento lungo viene rispettato meno di uno scritto in cima.
Ingegneria del contesto
2025
Decidere che cosa entra nella finestra a ogni passo: istruzioni, strumenti disponibili, documenti recuperati, esiti delle azioni, note, memoria. Non conta la frase del prompt ma la composizione dell'intero contesto, che in un agente cambia a ogni giro. Il principio: il più piccolo insieme di token ad alto segnale che rende probabile il risultato. Più contesto non è meglio, perché l'attenzione si diluisce.
RAG
2020 · Lewis e altri
Cercare i documenti pertinenti e incollarli nel prompt prima di rispondere. Il modello non «consulta» niente: legge ciò che gli è stato messo davanti. Aggiorna la conoscenza senza riaddestrare e permette di citare le fonti.
Base di dati vettoriale · HNSW
2016-
Archivio di embedding con ricerca approssimata dei vicini più prossimi. Il grafo navigabile a più livelli è la struttura dominante: trova i vicini in tempo logaritmico accettando qualche errore.
Segmentazione dei documenti
Dividere i testi in pezzi indicizzabili. Dove si taglia decide cosa si può trovare: tagliare a metà un ragionamento produce due frammenti entrambi inutili. Il parametro più sottovalutato di un sistema RAG.
Ricerca ibrida · BM25
1994 · 2020-
Combinare la ricerca semantica con quella lessicale classica. La seconda trova i termini esatti — codici, nomi propri, sigle — dove gli embedding sono deboli: insieme funzionano meglio di ciascuna.
Reranker
Un secondo passaggio che legge domanda e documento insieme e li ordina con precisione. Troppo costoso per l'intero archivio, decisivo sui primi cento risultati.
GraphRAG
2024
Costruire un grafo di entità e relazioni dai documenti e recuperare percorsi invece di frammenti isolati. Utile per le domande che richiedono di collegare informazioni sparse in più fonti.
Uso di strumenti
2023-
Il modello emette una chiamata strutturata invece della risposta; l'applicazione la esegue e rimette l'esito nel contesto come nuovo testo. Il modello non esegue nulla da solo: è sempre il codice attorno a decidere.
MCP
2024 · Anthropic
Un protocollo aperto con cui un'applicazione espone al modello strumenti, risorse e prompt forniti da server esterni. Sostituisce N×M integrazioni ad hoc con un'interfaccia comune: chi scrive un connettore lo scrive una volta. Dal dicembre 2025 è governato dalla Agentic AI Foundation della Linux Foundation e supportato da tutti i grandi fornitori.
A2A · protocollo fra agenti
2025 · Google, poi Linux Foundation
Dove MCP collega un agente ai suoi strumenti, A2A collega agenti diversi fra loro, anche di fornitori diversi. Ogni agente pubblica una «scheda» con ciò che sa fare, riceve compiti, ne comunica l'avanzamento e restituisce risultati. È un livello sopra MCP, non un'alternativa. Donato alla Linux Foundation nel giugno 2025.
Skill dell'agente
2025 · Anthropic, standard aperto da dicembre 2025
Una cartella con istruzioni, script ed esempi per un compito specifico. Nel contesto entra solo una riga di descrizione per ogni skill; il contenuto completo viene letto quando il compito lo richiede. Così un agente può disporre di centinaia di competenze senza riempire la finestra. Sono istruzioni, non codice nuovo nel modello: l'equivalente di un manuale che si apre alla pagina giusta.
Agente
2023-
Un modello in un ciclo che osserva, decide, agisce e legge il risultato, ripetendo finché il compito non è chiuso. Nient'altro che quel ciclo: tutta la difficoltà sta nel decidere quando fermarsi.
ReAct
2022 · Yao e altri
Alternare esplicitamente ragionamento e azione: pensa, agisci, osserva, ripeti. Lo schema di base di ogni agente attuale, e il primo a mostrare che intrecciare le due cose funziona meglio che separarle.
Sub-agenti · sistemi multi-agente
2025
Un agente principale divide il compito e lo affida a istanze figlie, ognuna con un contesto pulito. Ciascuna restituisce solo un riassunto. Il vantaggio non è la «collaborazione» ma l'isolamento dei contesti: il lavoro sporco resta fuori dalla finestra principale. Costa molti più token, fino a un ordine di grandezza, e conviene solo sui compiti parallelizzabili.
Uso del computer
2024 · Anthropic · 2025 OpenAI
Il modello riceve schermate e risponde con azioni: sposta il mouse, clicca, scrive. Nessuna integrazione dedicata: qualunque programma con un'interfaccia diventa uno strumento. Lento e fragile rispetto a un'API, ed esposto all'iniezione di prompt da ogni pagina che visita. Su prove come OSWorld i modelli sono passati in due anni da circa il 15% a livelli vicini a quelli umani.
Compattazione del contesto
Riassumere o scartare la parte vecchia della conversazione quando la finestra si riempie. Decidere cosa buttare è una scelta di progetto: ciò che sopravvive va tenuto in memoria esterna, non nella chat.
Memoria a lungo termine
Ciò che i prodotti chiamano «memoria» è testo salvato fuori dal modello e reinserito nel prompt quando serve. I pesi non cambiano mai: correggere un modello in chat non lo modifica.
Guardrail · sandbox
Controlli deterministici attorno al modello — filtri, permessi, ambienti isolati, conferme umane sulle azioni irreversibili. La sicurezza di un agente sta qui, non nella sua buona disposizione.
XII
2020-oggi

Multimodale e generativo

Immagini, audio, video e strutture molecolari trattati con gli stessi strumenti del testo. Il passaggio concettuale è unico: qualsiasi cosa si possa spezzare in una sequenza di elementi discreti o rappresentare come vettore rientra nello stesso schema.

Vision Transformer
2020 · Dosovitskiy e altri
L'immagine tagliata in riquadri di 16×16 pixel trattati come token. Supera le convoluzionali quando i dati sono abbondanti: il bias induttivo della convoluzione aiuta con pochi dati e limita con molti.
Apprendimento contrastivo
2006 Hadsell, Chopra, LeCun · 2018-2020 InfoNCE, MoCo, SimCLR
Avvicinare nello spazio le rappresentazioni di coppie corrispondenti e allontanare quelle non corrispondenti. Il modo più efficace di imparare rappresentazioni senza etichette.
CLIP
2021 · Radford e altri
Immagini e didascalie mappate nello stesso spazio, addestrate su 400 milioni di coppie prese dal web. Permette la classificazione senza esempi per descrizione testuale, ed è il ponte su cui poggia la generazione da testo.
Modello di diffusione
2015 · 2020 Ho e altri
Si insegna a una rete a rimuovere rumore da un'immagine progressivamente corrotta; poi si parte da rumore puro e si applica il procedimento all'inverso. Molto più stabile delle GAN, e sostituisce un salto impossibile con mille passi facili.
Diffusione latente
2022 · Rombach e altri
Diffondere in uno spazio compresso invece che sui pixel, riducendo il costo di un fattore quaranta. È ciò che ha portato la generazione di immagini da un centro di calcolo a una scheda grafica di consumo.
Guida senza classificatore
2022 · Ho, Salimans
Si genera due volte, con e senza il condizionamento testuale, e si amplifica la differenza. La manopola che decide quanto fedelmente l'immagine segue il prompt: alzarla troppo produce immagini sature e povere.
ControlNet · adattatori
2023 · Zhang e altri
Condizionare la generazione su una struttura precisa — contorni, posa, profondità — invece del solo testo. Ciò che ha reso i modelli di immagine usabili in un flusso di lavoro professionale.
Flow matching · rectified flow
2022-2023
Riformula la diffusione come il campo vettoriale che porta rumore su dati lungo traiettorie quasi rettilinee. Richiede molti meno passi di campionamento; è la base dei generatori più recenti.
Transformer di diffusione · DiT
2022 · Peebles, Xie
La rete che rimuove il rumore non è più una U-Net convoluzionale ma un transformer che tratta il latente come una sequenza di toppe. Eredita le leggi di scala del linguaggio: più parametri, immagini migliori in modo prevedibile. Unito al flow matching, è l'architettura dei generatori di immagini e video attuali.
Generazione video
2024-
Un video è un blocco di rumore nello spazio latente, tagliato in «toppe» spazio-temporali e ripulito da un transformer di diffusione. Dal 2025 i modelli generano insieme immagine e audio sincronizzato, dialoghi compresi, per clip di qualche decina di secondi. Il costo è molto alto: un secondo di video vale decine di migliaia di token. Coerenza degli oggetti e fisica restano i punti deboli.
Modello visione-linguaggio
2022-
Un codificatore visivo produce token che entrano nella sequenza di un modello linguistico. Da lì l'immagine è testo come tutto il resto: il modello la descrive, ne estrae dati, ne legge grafici.
Modello multimodale nativo
2024-
Addestrato dall'inizio su testo, immagini e audio insieme, invece di collegare componenti separate. Le rappresentazioni si formano condivise; è ciò che permette il dialogo vocale a bassa latenza.
Generazione di immagini nativa
2025
Lo stesso modello che legge e scrive testo produce anche l'immagine, come token o guidando un decodificatore di diffusione. Capisce le istruzioni come le capisce in chat: scrive testo leggibile dentro l'immagine, modifica un dettaglio lasciando intatto il resto, mantiene un personaggio uguale da un'immagine all'altra.
Segment Anything
2023 · Meta
Segmentazione di qualsiasi oggetto in qualsiasi immagine su indicazione di un punto o di un rettangolo, senza addestramento specifico. Il primo modello di fondazione per un compito di visione strutturato.
NeRF · Gaussian splatting
2020 · 2023
Ricostruire una scena tridimensionale da fotografie: il primo come campo continuo appreso da una rete, il secondo come milioni di macchie gaussiane esplicite — molto più rapido da visualizzare.
Modello di mondo
2018-
Un modello generativo che prevede come evolve un ambiente date le azioni. I generatori di video recenti mostrano una fisica implicita approssimata; se questo costituisca un modello del mondo utilizzabile è discusso. Dal 2025 esistono modelli interattivi: si muove un personaggio e il mondo viene generato in tempo reale, coerente per alcuni minuti. Servono soprattutto ad addestrare agenti e robot in ambienti simulati illimitati. Una scuola alternativa (JEPA) non genera pixel ma predice rappresentazioni astratte, più economiche da usare per pianificare.
Riconoscimento vocale · Whisper
2022 · OpenAI
Trascrizione multilingue addestrata su 680.000 ore di audio raccolto dal web, senza architetture specializzate. Ha reso la trascrizione un problema risolto e gratuito.
CTC
2006 · Graves e altri
Permette di addestrare su sequenze non allineate — audio e trascrizione di lunghezze diverse — sommando su tutti gli allineamenti possibili. Ha eliminato la necessità di allineare a mano il parlato.
Tokenizzazione audio · codec neurale
2021-
Comprimere l'audio in una sequenza di simboli discreti, così che un modello autoregressivo lo tratti come testo. È il meccanismo dietro la generazione di voce e musica.
AlphaFold
2020-2021 · DeepMind
Predizione della struttura tridimensionale delle proteine dalla sequenza di amminoacidi, con accuratezza sperimentale. Un problema aperto da cinquant'anni chiuso da un'architettura basata sull'attenzione: il risultato scientifico più netto del deep learning.
Rete neurale su grafi
2009 Scarselli e altri · 2017 Kipf, Welling; Gilmer e altri
Propaga informazione lungo gli archi di un grafo aggregando i vicini. Adatta a molecole, reti sociali, sistemi di raccomandazione e previsioni meteorologiche su griglia.
Robotica basata su modelli linguistici
2023-
Modelli visione-linguaggio-azione: un modello visione-linguaggio decide che cosa fare, e una testa d'azione, spesso a flow matching, produce movimenti continui a decine di comandi al secondo. Il paradosso di Moravec regge ancora: il collo di bottiglia non è più il ragionamento ma la scarsità di dati di manipolazione reale.
XIII
2007-oggi

Hardware, valutazione, governo

Tre ambiti che non riguardano gli algoritmi e decidono cosa è possibile: quali processori esistono, come si misura il progresso, e quali regole si applicano.

GPU · CUDA
2007 · NVIDIA
Processori con migliaia di unità di calcolo semplici, nati per la grafica e rivelatisi ideali per le moltiplicazioni di matrici. CUDA li ha resi programmabili: senza quel livello software il 2012 non sarebbe avvenuto.
Tensor core · TPU · NPU
2016-2017
Circuiti dedicati che eseguono una moltiplicazione di piccole matrici in un colpo, a bassa precisione. Sono la ragione per cui la potenza utile è cresciuta molto più della legge di Moore.
Memoria a banda larga
Memoria impilata accanto al processore, da qualche terabyte al secondo. La sua capacità e la sua banda, non la potenza di calcolo, sono il vincolo reale nell'inferenza.
Sistema a scala di rack · dominio NVLink
2024-
Fino a 72 GPU, e più nelle generazioni successive, collegate tutte con tutte a circa un terabyte al secondo ciascuna, così da comportarsi come un unico acceleratore con decine di terabyte di memoria veloce. È ciò che permette di distribuire centinaia di esperti di un MoE senza passare dalla rete, che è dieci volte più lenta.
FLOP · intensità aritmetica
Le operazioni in virgola mobile richieste, e quante se ne fanno per ogni byte letto dalla memoria. Se l'intensità è bassa il processore aspetta i dati: è la condizione normale nella generazione di token.
Utilizzo effettivo · MFU
La frazione della potenza nominale realmente sfruttata. Un addestramento ben fatto sta fra il 35% e il 55%; oltre non si va, e sotto il 25% qualcosa è configurato male.
Collettivi · all-reduce
Le operazioni con cui migliaia di schede mediano i gradienti. Vanno sovrapposte al calcolo, avviandole sui primi strati mentre gli ultimi lavorano ancora: eseguirle in blocco costa il 20-30% del throughput.
Fusione dei kernel
Unire più operazioni in un unico passaggio sulla memoria invece di scrivere e rileggere fra una e l'altra. Il principio che ha prodotto FlashAttention, e la fonte principale di guadagno nelle librerie di calcolo.
Benchmark
Prove standardizzate per confrontare modelli: conoscenza generale, generazione di codice, problemi matematici, risoluzione di segnalazioni software reali, ragionamento astratto. Ognuna satura in due o tre anni, le più recenti in pochi mesi. Per questo le prove attuali sono compiti lunghi in ambienti reali (correggere un repository, usare un terminale o un computer) o domande di livello da ricercatore, scritte per resistere il più a lungo possibile.
Contaminazione dei benchmark
Il test è finito nei dati di addestramento, direttamente o attraverso discussioni che lo citano. Rende il punteggio privo di significato, ed è il motivo per cui ogni laboratorio serio mantiene prove interne mai pubblicate.
Orizzonte temporale dei compiti
2025 · METR
Si misura la durata, per un esperto umano, dei compiti che un modello porta a termine nella metà dei casi. Dal 2019 raddoppia circa ogni sette mesi, più in fretta negli ultimi due anni. È una misura che non satura, e traduce il progresso in una grandezza comprensibile: da compiti di secondi a compiti di ore.
Arena · punteggio Elo
2023-
Confronti a coppie votati dagli utenti e aggregati in un punteggio di tipo Elo (dal 2023, modello di Bradley-Terry). Difficile da contaminare, ma non da forzare: provare in privato molte varianti e pubblicare solo la migliore gonfia la classifica. Premia lo stile insieme alla sostanza: misura la preferenza, non la correttezza.
Modello come giudice
2023-
Usare un modello per valutare le uscite di un altro. Economico e sufficientemente concorde con i giudizi umani da essere lo standard; con bias noti verso risposte lunghe e verso il proprio stile.
Eval
La batteria di prove specifiche di un'applicazione, con casi attesi e criteri di superamento. Scriverle il primo giorno invece dell'ultimo è la differenza fra sviluppare per misura e sviluppare a impressione.
Bias algoritmico
Disparità sistematiche apprese dai dati e riprodotte su scala. Nessuna definizione di equità soddisfa tutti i criteri desiderabili contemporaneamente: la scelta è normativa, non tecnica.
Spiegabilità · LIME · SHAP
2016 · 2017
Attribuire una decisione alle variabili che l'hanno determinata, approssimando localmente il modello o ripartendo il contributo secondo la teoria dei giochi. Post-hoc e approssimate: spiegano il comportamento, non il calcolo.
Privacy differenziale
2006 · Dwork e altri
Garanzia matematica che il risultato non riveli se un singolo individuo era nei dati, ottenuta aggiungendo rumore calibrato. Costa accuratezza; è l'unico approccio con una garanzia dimostrabile.
Apprendimento federato
2016 · Google
Addestrare su dispositivi distribuiti inviando solo aggiornamenti dei pesi, non i dati. Usato nelle tastiere predittive; i gradienti stessi possono però rivelare informazione sui dati.
Esempi adversariali
2013 · Szegedy e altri
Perturbazioni impercettibili che fanno sbagliare completamente un classificatore. La scoperta che le reti non «vedono» come noi, e un problema di robustezza mai risolto in modo generale.
Avvelenamento dei dati · backdoor
Inserire nei dati di addestramento esempi costruiti per indurre un comportamento specifico a comando. Realizzabile su corpora raccolti dal web, e difficilissimo da rilevare a posteriori.
Estrazione di dati di addestramento
2020-
Far riprodurre a un modello frammenti memorizzati del suo corpus. Dimostra che «non c'è nessun database dentro» va precisato: la memorizzazione letterale di testi rari o ripetuti avviene.
Filigrana · provenienza
2023-
Marcare i contenuti generati, alterando statisticamente la scelta dei token o firmando i file all'origine. Fragile alla riscrittura; le firme sui metadati sono più solide ma richiedono che tutta la filiera collabori.
Scheda del modello
2019 · Mitchell e altri
Documentazione standardizzata di usi previsti, limiti, dati e risultati per sottogruppo. Diventata prassi e, in alcune giurisdizioni, requisito normativo.
Regolamento europeo sull'IA
2024 · Unione europea
Primo quadro normativo generale, articolato per livelli di rischio con obblighi crescenti e requisiti specifici per i modelli di uso generale. Regolamento (UE) 2024/1689, in vigore dal 1° agosto 2024; il calendario è stato rivisto dal Digital Omnibus (Regolamento (UE) 2026/1744, in vigore dal 27 luglio 2026). Divieti e alfabetizzazione da febbraio 2025; obblighi per i modelli di uso generale da agosto 2025, con poteri di controllo della Commissione da agosto 2026; trasparenza (art. 50) da agosto 2026, con proroga al 2 dicembre 2026 per la marcatura dei contenuti dei sistemi già sul mercato; divieto delle app di «denudamento» e dei generatori di materiale pedopornografico dal 2 dicembre 2026; sistemi ad alto rischio dell'allegato III dal 2 dicembre 2027, prodotti regolati dell'allegato I dal 2 agosto 2028.
Politiche di scalata responsabile
2023-
Impegni volontari dei laboratori a legare il rilascio di modelli più capaci al superamento di verifiche di sicurezza definite in anticipo, con livelli di capacità e misure corrispondenti.
Obblighi per i modelli di frontiera
2025
Nell'UE i fornitori di modelli di uso generale aderiscono a un Codice di buone pratiche su trasparenza, diritto d'autore e rischi sistemici, oppure devono dimostrare la conformità in altro modo. In California la legge SB 53 obbliga i grandi sviluppatori a pubblicare il proprio quadro di sicurezza e a segnalare gli incidenti gravi. Gli impegni volontari diventano obblighi di trasparenza.
Pesi aperti · pesi chiusi
Se i parametri sono scaricabili o accessibili solo tramite servizio. «Aperto» riguarda quasi sempre i soli pesi: dati e ricette restano riservati. Fanno eccezione i modelli completamente aperti, che pubblicano anche dati, codice e checkpoint intermedi. Sono pochi, ma sono gli unici su cui la ricerca può riprodurre un addestramento.
Diritto d'autore e dati
2023-
Se addestrare su opere protette costituisca utilizzo lecito è materia di contenzioso in più giurisdizioni, con esiti divergenti. Negli Stati Uniti i primi giudici hanno distinto fra addestramento, spesso ammesso, e provenienza delle copie: un caso sui libri piratati si è chiuso nel 2025 con un accordo da 1,5 miliardi di dollari. In Europa pesa di più la memorizzazione letterale. È la questione aperta con le maggiori conseguenze economiche sul settore.
Lavoro di annotazione
Decine di migliaia di persone che etichettano dati, scrivono risposte esemplari e classificano contenuti, in larga parte tramite appalti in paesi a basso costo. Il lavoro umano su cui poggia l'allineamento di ogni modello.
AGI · superintelligenza
Un sistema di capacità generale pari o superiore a quella umana. Termini senza definizione operativa condivisa: le previsioni sulla loro comparsa dicono più sulle definizioni adottate che sulle tecnologie.
Riferimento

Cronologia essenziale

Trenta date fra cui scegliere una storia. La distribuzione è istruttiva: poco più di due decenni per arrivare a un neurone che impara, cinquant'anni per renderlo profondo e addestrabile, dodici anni per arrivare da un classificatore di immagini a un sistema che scrive software.

AnnoEventoPerché conta
1936Macchina di Turingdefinisce il calcolabile
1943Neurone di McCulloch-Pittsprimo modello formale di neurone
1950Turing, «Computing Machinery and Intelligence»pone la domanda
1956Conferenza di Dartmouthnasce il nome del campo
1958Perceptronil primo neurone che impara
1966ELIZAil primo effetto di attribuzione di comprensione
1969Minsky e Papert, «Perceptrons»quindici anni di stasi sulle reti
1972-1976MYCINil sistema esperto che fa scuola: regole e fattori di certezza
1973Rapporto Lighthillprimo inverno
1986Retropropagazione resa notale reti multistrato diventano addestrabili
1989Q-learning · LeNetrinforzo e convoluzioni
1997LSTM · Deep Bluesequenze lunghe; l'ultima vittoria simbolica
2006Deep belief networksil «deep learning» si impone
2007CUDAle GPU diventano programmabili
2009ImageNeti dati come contributo scientifico
2012AlexNetla visione artificiale cambia metodo
2013word2vec · VAEil significato diventa geometria
2014GAN · seq2seq · attenzione · Adaml'anno più denso del decennio
2015ResNet · distillazioneprofondità arbitraria; modelli compatti
2016AlphaGoun problema dato per fuori portata
2017Transformer · PPOl'architettura che assorbirà tutto
2018BERT · GPTle due strade: capire e generare
2019GPT-2 · T5 · «La lezione amara»la scala diventa un programma di lavoro
2020GPT-3 · leggi di scala · diffusione · RAGl'apprendimento in contesto e la sua economia
2021CLIP · RoPE · LoRA · AlphaFold 2multimodalità e adattamento economico
2022InstructGPT · Chinchilla · catena di pensiero · diffusione latentel'IA generativa diventa un prodotto
2023DPO · FlashAttention-2 · vLLM · GQA · autoencoder sparsil'anno dell'ingegneria e dell'interpretabilità
2024RLVR · modelli ragionanti · MCP · Regolamento europeocalcolo al momento dell'inferenza; primi standard
2025DeepSeek-R1 · agenti di programmazione e d'uso del computer · A2A · MCP alla Linux Foundation · obblighi UE per i modelli generaliil ragionamento addestrato con rinforzo diventa aperto; nascono gli standard degli agenti
2026architetture ibride e attenzione sparsa appresa · contesti da un milione di token nei modelli aperti · Digital Omnibus UEil costo del contesto lungo diventa il problema centrale
In una riga

Novant'anni di idee, e quasi nessuna buttata via.

La discesa del gradiente è del 1847, il teorema di Bayes del 1763, la retropropagazione del 1970, l'attenzione del 2014. Quello che è cambiato non è la matematica: sono la quantità di dati disponibili, la potenza di calcolo per applicarla, e una decina di correttivi ingegneristici senza i quali nulla di tutto questo convergerebbe.

Le date indicano la prima pubblicazione riconosciuta. Molte idee sono state proposte, dimenticate e riscoperte più volte, e l'attribuzione è spesso contesa: dove è rilevante sono indicati più autori o più anni. Settembre 2026