Glossario dell'intelligenza artificiale
Novant'anni di intelligenza artificiale, e i due secoli di matematica che la precedono: concetti, algoritmi e tecnologie in ordine cronologico e tematico. Ogni voce porta l'anno e, quando è identificabile, chi l'ha introdotta. Le date si riferiscono alla prima pubblicazione riconosciuta: molte idee sono state proposte, dimenticate e riscoperte più volte, e dove è rilevante lo si segnala.
Tredici sezioni in ordine storico. Le prime cinque coprono l'IA prima delle reti neurali profonde; le ultime otto il periodo dal 2012 a oggi.
Circa 370 voci. Per cercare un termine preciso conviene usare la ricerca del browser.
Nessuna voce corrisponde. La ricerca guarda sia il termine sia la definizione — prova con una parola più corta, o azzera il filtro.
Prima che si chiamasse intelligenza artificiale
La matematica arriva prima del nome. Quando nel 1956 si conia l'espressione «artificial intelligence», l'inferenza probabilistica ha quasi due secoli, la regressione uno e mezzo, e il modello formale di calcolo venti anni.
L'IA simbolica
Per venticinque anni l'ipotesi dominante è che l'intelligenza sia manipolazione di simboli secondo regole. Produce compilatori, dimostratori automatici e la programmazione logica; fallisce su percezione, linguaggio e senso comune. Le sue idee non sono state smentite: sono state assorbite dall'informatica ordinaria.
Sistemi esperti, e i due inverni
Il primo modello industriale dell'IA: intervistare esperti umani e trascriverne le regole. Funziona in domini stretti, genera il primo mercato reale e poi crolla sotto il proprio costo di manutenzione. I due «inverni» sono cicli di aspettative gonfiate, finanziamenti tagliati e ricerca che continua sotto altri nomi.
Apprendimento statistico
Il paradigma che sostituisce le regole scritte con l'inferenza dai dati. Il vocabolario di questa sezione — sovradattamento, validazione, generalizzazione — è ancora quello con cui si discute qualsiasi modello, comprese le reti di frontiera. Molte di queste tecniche restano la scelta corretta su dati tabellari.
Reti neurali: i fondamenti
I meccanismi che valgono per ogni rete, dal perceptron del 1958 al modello di frontiera di oggi. Nulla in questa sezione è concettualmente difficile; la difficoltà sta nel fatto che tutto interagisce con tutto, e che il comportamento su un miliardo di parametri non si deduce da quello su cento.
Deep learning: visione, sequenze, generazione
Undici anni in cui tre condizioni si allineano — dati etichettati su scala industriale, schede grafiche programmabili, e i correttivi che rendono addestrabili le reti profonde. Nel 2012 la visione artificiale cambia metodo in una notte; nel 2017 arriva l'architettura che assorbirà tutto il resto.
Apprendimento per rinforzo
Il terzo paradigma: nessuna risposta corretta, solo una ricompensa numerica dopo una sequenza di azioni. Ha prodotto i risultati più spettacolari — Atari, Go, StarCraft — e per anni pochissime applicazioni pratiche. Poi ha trovato la sua nicchia decisiva: il post-training dei modelli linguistici.
Il transformer e i modelli linguistici
Un'unica architettura che ha assorbito linguaggio, visione, audio, codice, proteine e robotica. La sua qualità decisiva non è l'accuratezza ma la parallelizzabilità: si può addestrare su decine di migliaia di schede, e questo l'ha resa il veicolo delle leggi di scala.
Addestrare, adattare, servire
La parte ingegneristica, dove si decide se un modello è economicamente sostenibile. Nulla qui riguarda l'intelligenza: riguarda memoria, banda e sincronizzazione fra decine di migliaia di processori.
Post-training, allineamento, interpretabilità
Il modello base sa già quasi tutto ciò che saprà. Questa fase non aggiunge conoscenza: seleziona, fra le mille continuazioni plausibili, quella che vale la pena dare. In termini di quota di calcolo è la parte cresciuta più rapidamente negli ultimi anni.
Contesto, recupero, agenti
Il livello che sta fuori dal modello. I pesi sono congelati dal rilascio: tutto ciò che il sistema sa della situazione presente sta nel contesto, ed è testo. Questa sezione descrive i modi di riempirlo bene.
Multimodale e generativo
Immagini, audio, video e strutture molecolari trattati con gli stessi strumenti del testo. Il passaggio concettuale è unico: qualsiasi cosa si possa spezzare in una sequenza di elementi discreti o rappresentare come vettore rientra nello stesso schema.
Hardware, valutazione, governo
Tre ambiti che non riguardano gli algoritmi e decidono cosa è possibile: quali processori esistono, come si misura il progresso, e quali regole si applicano.
Cronologia essenziale
Trenta date fra cui scegliere una storia. La distribuzione è istruttiva: poco più di due decenni per arrivare a un neurone che impara, cinquant'anni per renderlo profondo e addestrabile, dodici anni per arrivare da un classificatore di immagini a un sistema che scrive software.
| Anno | Evento | Perché conta |
|---|---|---|
| 1936 | Macchina di Turing | definisce il calcolabile |
| 1943 | Neurone di McCulloch-Pitts | primo modello formale di neurone |
| 1950 | Turing, «Computing Machinery and Intelligence» | pone la domanda |
| 1956 | Conferenza di Dartmouth | nasce il nome del campo |
| 1958 | Perceptron | il primo neurone che impara |
| 1966 | ELIZA | il primo effetto di attribuzione di comprensione |
| 1969 | Minsky e Papert, «Perceptrons» | quindici anni di stasi sulle reti |
| 1972-1976 | MYCIN | il sistema esperto che fa scuola: regole e fattori di certezza |
| 1973 | Rapporto Lighthill | primo inverno |
| 1986 | Retropropagazione resa nota | le reti multistrato diventano addestrabili |
| 1989 | Q-learning · LeNet | rinforzo e convoluzioni |
| 1997 | LSTM · Deep Blue | sequenze lunghe; l'ultima vittoria simbolica |
| 2006 | Deep belief networks | il «deep learning» si impone |
| 2007 | CUDA | le GPU diventano programmabili |
| 2009 | ImageNet | i dati come contributo scientifico |
| 2012 | AlexNet | la visione artificiale cambia metodo |
| 2013 | word2vec · VAE | il significato diventa geometria |
| 2014 | GAN · seq2seq · attenzione · Adam | l'anno più denso del decennio |
| 2015 | ResNet · distillazione | profondità arbitraria; modelli compatti |
| 2016 | AlphaGo | un problema dato per fuori portata |
| 2017 | Transformer · PPO | l'architettura che assorbirà tutto |
| 2018 | BERT · GPT | le due strade: capire e generare |
| 2019 | GPT-2 · T5 · «La lezione amara» | la scala diventa un programma di lavoro |
| 2020 | GPT-3 · leggi di scala · diffusione · RAG | l'apprendimento in contesto e la sua economia |
| 2021 | CLIP · RoPE · LoRA · AlphaFold 2 | multimodalità e adattamento economico |
| 2022 | InstructGPT · Chinchilla · catena di pensiero · diffusione latente | l'IA generativa diventa un prodotto |
| 2023 | DPO · FlashAttention-2 · vLLM · GQA · autoencoder sparsi | l'anno dell'ingegneria e dell'interpretabilità |
| 2024 | RLVR · modelli ragionanti · MCP · Regolamento europeo | calcolo al momento dell'inferenza; primi standard |
| 2025 | DeepSeek-R1 · agenti di programmazione e d'uso del computer · A2A · MCP alla Linux Foundation · obblighi UE per i modelli generali | il ragionamento addestrato con rinforzo diventa aperto; nascono gli standard degli agenti |
| 2026 | architetture ibride e attenzione sparsa appresa · contesti da un milione di token nei modelli aperti · Digital Omnibus UE | il costo del contesto lungo diventa il problema centrale |
Novant'anni di idee, e quasi nessuna buttata via.
La discesa del gradiente è del 1847, il teorema di Bayes del 1763, la retropropagazione del 1970, l'attenzione del 2014. Quello che è cambiato non è la matematica: sono la quantità di dati disponibili, la potenza di calcolo per applicarla, e una decina di correttivi ingegneristici senza i quali nulla di tutto questo convergerebbe.