Dal telefono al data center
Quanto hardware serve, e perché. Cinque taglie di modello, dalla mezza dimensione che gira su un telefono al modello di frontiera che occupa un edificio — con il conto della memoria, della banda, dei watt e degli euro a ogni gradino.
Cinque gradini attraversano tutto il diagramma. Ogni riquadro con la riga rossa dà il numero corrispondente a ciascuno.
Parametri. L'ultimo gradino è un MoE da qualche migliaio di miliardi.
Non è una risorsa sola: sono quattro
«Quanta potenza serve» è la domanda sbagliata. Le quattro risorse si esauriscono in momenti diversi, e in quasi tutti i casi pratici quella che ti ferma non è il calcolo.
Una cucina professionale. La potenza dei fornelli è il calcolo, il piano di lavoro è la capacità di memoria, la velocità con cui gli aiutanti portano gli ingredienti dal magazzino è la banda, e le porte fra una cucina e l'altra sono l'interconnessione. Puoi avere fornelli fortissimi e restare fermo perché nessuno ti porta le verdure.
Quante moltiplicazioni al secondo
Una scheda da data center attuale sta fra 10¹⁵ e 5 · 10¹⁶ operazioni al secondo in bassa precisione, il massimo a 4 bit sulla generazione più recente. È il numero che finisce nei comunicati stampa, ed è quello che limita meno spesso.
Limita: l'addestramento e la lettura dei prompt.
Quanto ci sta
80-290 GB per scheda nel 2026, oltre 400 GB sulle schede HBM4 più capienti. È un limite netto: se i pesi non ci stanno, il modello non parte. Non c'è modo di andare più piano e farcela lo stesso.
Limita: quale modello puoi far girare, e quanti utenti insieme.
Quanto in fretta si legge
3-8 TB/s su una scheda da data center con HBM3e, circa 20 TB/s sulla nuova generazione con HBM4; 1-1,8 TB/s su una da gioco; 50-100 GB/s su un PC normale. È questa a decidere la velocità di generazione, e quasi nessuno la guarda.
Limita: i token al secondo.
Quanto in fretta si parlano
Fra schede dello stesso dominio veloce, 1,8-3,6 TB/s ciascuna, e oggi il dominio è un armadio intero da 72 schede. Fra armadi, circa 100 GB/s: venti-trenta volte meno. Questo salto governa tutta l'architettura dei cluster.
Limita: l'addestramento distribuito e i modelli troppo grandi per una macchina.
I cinque gradini, con il loro hardware
Ogni gradino moltiplica per circa dieci i parametri, e cambia categoria di macchina. Non è un continuo: sono cinque regimi con vincoli, costi e casi d'uso diversi.
| Taglia | Pesi in bf16 | Hardware minimo | Cosa sa fare |
|---|---|---|---|
| 0,5 G · nano | 1 GB | un telefono, un computer a scheda singola | classificare, estrarre campi, completare |
| 8 G · piccolo | 16 GB | una scheda da gioco, se quantizzato | conversazione, riassunti, codice semplice |
| 70 G · medio | 140 GB | 1 scheda da data center, o un Mac con molta memoria | ragionamento discreto, buona conoscenza |
| 400 G · grande | 800 GB | un server intero, 8 schede collegate | vicino alla frontiera; in locale solo a 4 bit, e piano |
| frontiera · MoE 1-2 T | 2-4 TB | a 4 bit un server da 8 schede nuove; per servirlo, un armadio da 72 | tutto il resto |
Un modello da mezzo miliardo, addestrato bene su un compito preciso, batte un modello di frontiera generico su quel compito — e costa mille volte meno per chiamata. La domanda giusta non è «qual è il più capace» ma «qual è il più piccolo che risolve questo».
Un denso da 2000 miliardi richiederebbe 4000 GFLOP per token: impraticabile. Con gli esperti si accende il 2-5% dei parametri, 30-100 G, quindi il calcolo e la velocità sono quelli di un modello denso di quella taglia. La memoria invece deve contenere tutti e 2000. Si compra qualità con la capacità, non con la velocità.
Cosa c'è dentro un acceleratore
Una CPU ha una decina di core molto intelligenti. Un acceleratore ha decine di migliaia di unità stupide che fanno tutte la stessa cosa su dati diversi — e, accanto, circuiti dedicati a una sola operazione: moltiplicare matrici piccole.
Un artigiano contro una catena di montaggio. L'artigiano (CPU) fa qualsiasi cosa, decide, si adatta. La catena (GPU) sa fare una sola operazione, ma diecimila volte in parallelo. Le reti neurali sono state adottate anche perché si riducono a quell'unica operazione.
Accanto alle unità generiche ci sono blocchi che moltiplicano una matrice piccola in un colpo solo, in bassa precisione. Sono loro a produrre i numeri dichiarati: senza usarli, la stessa scheda va dieci volte più piano.
Non c'è solo un produttore: esistono acceleratori progettati dai grandi operatori cloud e schede concorrenti con memoria abbondante. La differenza principale non è il silicio ma l'ecosistema software — è lì che si è formato il vantaggio dominante.
La formula che spiega quasi tutto
Per generare un token bisogna leggere dalla memoria tutti i pesi che quel token usa. In un modello denso sono tutti; in un modello a esperti solo quelli attivi. Quindi la velocità massima di generazione non dipende dalla potenza di calcolo: dipende da quanto in fretta si legge la memoria.
Un tetto teorico che in pratica si raggiunge al 60-80%. Vale per un utente solo alla volta — con il batching dello stadio 08 il conto cambia radicalmente.
Nei modelli a esperti la velocità dipende dai parametri attivi, la memoria necessaria dai parametri totali. Un MoE da 120 G con 5 G attivi, a 4 bit, occupa ~65 GB ma ne legge ~3 per token: su una macchina da 270 GB/s ha un tetto di circa 90 token/s, contro i ~7 di un denso da 70 G sulla stessa macchina.
La decodifica speculativa. Un modello piccolo, o una testa aggiuntiva del modello stesso, indovina i prossimi 3-5 token. Il modello grande li verifica tutti insieme con una sola lettura dei pesi e tiene quelli giusti. Il risultato è identico e la velocità per utente cresce di 2-3 volte: si sfrutta il calcolo che durante la generazione resta inutilizzato.
Il conto della memoria, per intero
I pesi sono solo il primo addendo. Chi dimensiona un sistema guardando solo quelli scopre in produzione che con dieci utenti e contesti lunghi la memoria finisce.
Condividere le teste di chiavi e valori fra più teste di query, quantizzare la cache a 8 bit, allocarla a pagine invece che in blocco per non sprecare spazio, e riusare il prefisso comune fra utenti diversi. Ognuna vale un fattore due o tre. I modelli più recenti vanno oltre: alcuni comprimono chiavi e valori in un vettore latente piccolo, un altro fattore cinque o dieci; altri alternano strati che guardano tutto il contesto a strati con una finestra corta, che tengono pochi token. La cache che non serve subito si sposta in RAM o su disco e si ricarica quando l'utente torna.
Regola pratica: memoria ≈ pesi × 1,2 + cache, dove la cache vale circa 0,1-0,3 GB per migliaio di token di contesto per utente su un modello medio (0,32 GB sul 70 G dell'esempio). Basta per capire in trenta secondi se un'idea sta in piedi.
Quantizzare: la leva più efficace
Usare meno bit per peso riduce la memoria e — poiché la generazione è limitata dalla banda — accelera nella stessa proporzione. È l'unica leva che migliora entrambi i vincoli insieme.
Comprimere una fotografia. A qualità 90 nessuno vede la differenza e il file dimezza. A qualità 40 si vedono gli artefatti. La domanda non è se si perde qualcosa — si perde sempre — ma se si perde qualcosa che conta per l'uso che ne fai.
| Precisione | Byte/peso | Modello 8 G | Modello 70 G | Perdita di qualità |
|---|---|---|---|---|
| bf16 | 2 | 16 GB | 140 GB | riferimento |
| fp8 / int8 | 1 | 8 GB | 70 GB | quasi nulla, misurabile a fatica |
| int4 / fp4 (a gruppi) | 0,5 | 4,5 GB | 40 GB | piccola ma reale, si vede sui compiti difficili |
| sotto i 3 bit | < 0,4 | 3 GB | 28 GB | sensibile: da valutare caso per caso |
Le schede più recenti non si limitano a conservare i pesi in 4 bit: moltiplicano direttamente in un formato a virgola mobile da 4 bit, con un fattore di scala ogni 16 o 32 valori. Rispetto a 8 bit, la memoria si dimezza e il calcolo raddoppia. Sempre più modelli nascono già così, addestrati sapendo che verranno usati a 4 bit, e la perdita di qualità diventa trascurabile.
I pesi si dividono in gruppi di 64 o 128; per ogni gruppo si tiene un fattore di scala in alta precisione e i pesi si rappresentano con 16 livelli. Alcuni canali particolarmente sensibili si lasciano a precisione piena: costa poco e recupera gran parte della perdita.
La cache KV va quantizzata a parte, e sui contesti lunghi è lei il problema. E la quantizzazione non rende un modello più capace: rende accessibile un modello che c'era già. Il tetto resta quello del modello a piena precisione.
Far girare un modello su hardware tuo
Quattro categorie di macchina, quattro regimi diversi. Il criterio è sempre lo stesso: prima verifica che ci stia, poi dividi la banda per il peso letto a ogni token, cioè i soli parametri attivi nei modelli a esperti, e sai già quanto andrà veloce.
Fino a 1-3 G
8-16 GB condivisi con tutto il resto, banda 50-100 GB/s, e un limite che sul server non esiste: la batteria e il calore. Si usano acceleratori dedicati a basso consumo.
Realistico: 20-50 token/s su un modello da 1 G a 4 bit. Buono per correzione, riassunto, comandi vocali.
Fino a 8 G, con pazienza
Tanta RAM e pochissima banda: 50-100 GB/s sono il collo di bottiglia. Il modello ci sta ma striscia.
Realistico: 5-15 token/s su un 8 G a 4 bit. Utilizzabile per lavori in differita, faticoso in conversazione.
Fino a 30-50 G a 4 bit (14 G in bf16), sopra non ci sta
24-32 GB di memoria molto veloce, 1-1,8 TB/s. Il rapporto qualità-prezzo migliore in assoluto per un singolo utente, se il modello entra.
Realistico: 150-250 token/s su un 8 G a 4 bit. Più veloce di quanto chiunque possa leggere.
Fino a 400 G, di più con i MoE
Le macchine con memoria condivisa fra processore e grafica vanno da 128 GB (mini-PC e workstation compatte) a 512 GB (desktop di fascia alta), e sono l'unico modo pratico di far girare un modello grande in casa. La banda varia molto, da 250 a oltre 800 GB/s, e decide tutto.
Realistico: su un 70 G a 4 bit circa 5 token/s sulle prime e 15 sulle seconde. Un MoE da 120 G con 5 G attivi va a 50-70. Completamente privato.
Quasi mai per il costo: ai volumi normali un'API costa meno dell'ammortamento dell'hardware. Le ragioni vere sono tre — dati che non devono uscire, funzionamento senza rete, e nessuna dipendenza da un fornitore che può cambiare prezzi o ritirare un modello.
Servire molti utenti cambia tutto
Il tetto dello stadio 04 vale per un utente solo. Servendone sessantaquattro insieme si legge la memoria una volta e la si usa per sessantaquattro token: il lavoro utile si moltiplica quasi senza costo aggiuntivo.
L'autobus contro il taxi. Il taxi arriva prima per te; l'autobus fa lo stesso viaggio per sessanta persone con lo stesso carburante. Un modello che gira solo per te sta viaggiando in taxi, ed è il motivo per cui l'hardware personale è inefficiente rispetto al cloud, non più lento.
Leggere il prompt è una grande moltiplicazione di matrici, limitata dal calcolo. Generare è una lettura continua dei pesi, limitata dalla banda. Sulla stessa scheda le due fasi si disturbano: un prompt lungo in arrivo blocca la generazione di tutti gli altri. Per questo i grandi servizi le separano su gruppi di schede diversi, che si passano la cache KV in rete, e dimensionano ognuno per il suo vincolo.
Con una scheda a circa 2 €/ora che produce 16.000 token/s: 2 ÷ (16.000 × 3600) ≈ 0,035 € per milione di token in uscita sul modello da 8 G. Il prezzo di listino delle API per quella taglia è qualche decimo di euro: il resto è margine, ridondanza, e il fatto che il carico non è mai pieno.
Throughput e latenza si comprano a vicenda. Un servizio interattivo tiene batch piccoli e paga di più per token; un lavoro in differita accetta batch enormi. È esattamente la ragione tecnica per cui le API in modalità asincrona costano circa metà.
Quando il modello non ci sta su una scheda
Tre modi di spezzarlo, con costi di comunicazione molto diversi. La scelta dipende quasi interamente da dove passa il confine fra «dentro il dominio veloce» e «fuori». Fino al 2024 il dominio era un server da 8 schede; nel 2026 è un armadio da 72.
Ogni matrice tagliata a fette
Ogni scheda tiene un pezzo di ogni matrice e ne calcola una parte. Serve una sincronizzazione a ogni strato.
Solo dentro il dominio veloce, dove la connessione fra schede è quasi come la memoria locale. Riduce anche la latenza.
Ogni scheda prende un tratto
I primi 20 strati qui, i successivi 20 là. Si comunica una volta sola per confine: pochissimo traffico.
Anche fra server. Difetto: se non si organizzano i dati in flusso continuo, metà delle schede aspetta.
Ogni scheda alcuni esperti
Nei modelli a esperti, ogni token va spedito alla scheda che ospita il suo esperto e il risultato torna indietro.
Molto traffico, a ogni strato. È il motivo per cui i modelli a esperti hanno bisogno di reti eccezionali, e oggi si servono dentro un armadio.
Addestrare è un altro ordine di problema
Otto volte la memoria per parametro, e un numero di operazioni che si conta in unità che non compaiono altrove. Fra far girare un modello e crearlo ci sono quattro o cinque ordini di grandezza.
Pesi in bassa precisione, gradienti, una copia di riferimento in alta precisione e i due stati dell'ottimizzatore. Più le attivazioni conservate per il passaggio inverso.
Il modello da 8 G: 128 GB, più le attivazioni. Su una scheda da 80 GB non ci sta, su una da 288 ci sta a fatica. Ma su una scheda sola l'addestramento durerebbe circa cinquant'anni.
Sei operazioni per parametro per token: due in avanti, quattro all'indietro. Moltiplicato per tutti i token del corpus, ripetuto per tutto l'addestramento.
Il modello da 8 G su 15.000 miliardi di token: 7,2 · 10²³ operazioni.
La frazione della potenza nominale effettivamente usata. Fra il 30 e il 50% nei cluster ben fatti; il resto se ne va in attese, comunicazione e operazioni che non sono moltiplicazioni di matrici. Chi stima i tempi con i numeri di targa sbaglia di un fattore due o tre.
Poiché gli stati sono il grosso della memoria, si spezzano fra tutte le schede invece di replicarli: ognuna ne custodisce una fetta e la condivide al momento dell'aggiornamento. È la tecnica che rende possibile addestrare modelli molto più grandi della singola scheda.
Alla frontiera il vincolo è l'elettricità
Sopra le diecimila schede, il problema smette di essere informatico e diventa industriale: potenza allacciata, smaltimento del calore, e il fatto che qualcosa si rompe di continuo.
Non è una sala server: è un impianto siderurgico. Si sceglie dove costruirlo in base a dove c'è corrente disponibile, si progetta il raffreddamento prima del calcolo, e si mette in conto che una parte della linea sia sempre ferma per manutenzione.
Con centinaia di migliaia di componenti, qualcosa si rompe ogni poche ore: memoria difettosa, cavi, alimentatori. L'addestramento è sincrono, quindi un guasto ferma tutti. Si salva lo stato di continuo e si riparte dall'ultimo salvataggio — la percentuale di tempo effettivamente produttivo è una delle metriche che i team guardano di più.
Oltre i 50 kW per armadio l'aria non basta più: si passa al liquido, con tubazioni fino al singolo chip. È il motivo per cui i data center per l'IA non si ricavano in quelli esistenti ma si costruiscono nuovi, e per cui i tempi sono dettati dall'edilizia più che dalla disponibilità di silicio. Le generazioni nuove usano acqua a 45 °C, abbastanza calda da smaltire il calore senza refrigeratori.
Il conto completo, gradino per gradino
Ore-scheda, tempo, energia, spesa. Tutti stimati con 6ND su schede da ~10¹⁵ operazioni al secondo in bf16 (classe H100) con un rendimento effettivo del 40%, a circa 2 € l'ora e ~1,5 kW reali per scheda.
| Taglia | Operazioni | Ore-scheda | Con quante schede | Energia | Ordine di spesa |
|---|---|---|---|---|---|
| 0,5 G | 1,5 · 10²² | ~10.000 | 64 → 7 giorni | ~16 MWh | 10⁴ € |
| 8 G | 7,2 · 10²³ | ~500.000 | 500 → 42 giorni | ~0,75 GWh | 10⁶ € |
| 70 G | 6,3 · 10²⁴ | ~4,4 M | 4.000 → 46 giorni | ~6,6 GWh | 10⁷ € |
| 400 G | ~4 · 10²⁵ | ~28 M | 16.000 → 72 giorni | ~42 GWh | 10⁸ € |
| frontiera | ~10²⁶ | ~70 M | 50.000 → 58 giorni | ~100 GWh | 10⁸-10⁹ € |
Salendo di taglia si aggiungono schede invece di aspettare: i grandi addestramenti durano tutti fra uno e tre mesi, per taglie che differiscono di cento volte. Il limite non è la pazienza ma il ciclo del prodotto — un modello che impiegasse un anno nascerebbe già vecchio.
Il costo di addestramento è fisso e si ammortizza su tutte le richieste. Su un modello molto usato, l'inferenza supera il training in pochi mesi e da lì in poi è la voce dominante: sul ciclo di vita, il rapporto tipico è circa 90 a 10 a favore dell'inferenza.
Adattare un modello costa quasi niente
Fra «uso quello che c'è» e «ne addestro uno mio» c'è una via di mezzo che quasi nessuno considera, e che sull'hardware si colloca cinque ordini di grandezza più in basso.
Si congelano tutti i pesi e si aggiunge accanto a ogni matrice una correzione di rango basso: due matrici sottili il cui prodotto ha la forma dell'originale ma pochissimi parametri. Si addestrano solo quelle. Con lo 0,1-1% dei parametri si ottiene gran parte del beneficio di un adattamento completo.
| Sul modello da 8 G | Memoria | Hardware | Tempo | Spesa |
|---|---|---|---|---|
| Addestramento da zero | 128 GB+ | 500 schede | 42 giorni | 10⁶ € |
| Adattamento completo | 128 GB | 1-2 schede da data center | ore | 10²-10³ € |
| Rango basso, base a 4 bit | ~12 GB | una scheda da gioco | 1-6 ore | ~10 € |
L'adattamento pesa poche decine di MB invece di decine di GB. Si possono tenere caricati sullo stesso modello base decine di adattamenti diversi e scambiarli per richiesta: un modello per cliente, senza moltiplicare la memoria.
Insegna stile, formato, gergo, comportamento. Non è il modo di insegnare fatti — quelli invecchiano, non si citano, e la stessa spesa in un buon sistema di recupero rende molto di più.
Comprare hardware conviene molto più tardi di quanto si creda
La scheda va pagata ventiquattro ore al giorno; l'API si paga a consumo. Poiché nessun carico reale è costante, il confronto si decide sul fattore di utilizzo, non sul prezzo di listino.
di token/mese
Dati che non possono uscire · latenza garantita e prevedibile · funzionamento senza rete · volumi davvero enormi e costanti · indipendenza da un fornitore che può cambiare modello, prezzi o condizioni.
Le persone che lo mantengono · la ridondanza per i guasti · il sovradimensionamento per i picchi · l'aggiornamento a ogni nuova generazione di modelli · e il fatto che di notte la scheda continua a costare.
La scala completa, in una tabella
| 0,5 G | 8 G | 70 G | 400 G | Frontiera | |
|---|---|---|---|---|---|
| Pesi bf16 | 1 GB | 16 GB | 140 GB | 800 GB | 2-4 TB |
| Pesi a 4 bit | 0,3 GB | 4,5 GB | 40 GB | 220 GB | 0,6-1 TB |
| FLOP per token | 1 G | 16 G | 140 G | 800 G | 60-200 G (sui parametri attivi) |
| Inferenza minima | telefono | scheda da gioco | desktop grosso o 1 scheda | 1 server, o un desktop da 512 GB a 4 bit | 1 server a 4 bit, un armadio per servirla |
| Memoria per addestrare | 8 GB | 128 GB | 1,1 TB | 6,4 TB | decine di TB |
| Schede per addestrare | 64 | 500 | 4.000 | 16.000 | 50-100 mila |
| Spesa di addestramento | 10⁴ € | 10⁶ € | 10⁷ € | 10⁸ € | 10⁸-10⁹ € |
| Costo per milione di token | ~0,01 € | ~0,1 € | ~1 € | ~3 € | 3-15 € |
| Chi può addestrarlo | un'università | una startup finanziata | una grande azienda | un laboratorio | pochi al mondo |
Il limite è quasi sempre la memoria, non il calcolo.
Quanti GB per i pesi, quanti per la cache, e con che velocità si leggono. Da queste tre quantità discendono il modello che puoi far girare, quanti utenti servi, quanto ti costa e su quale macchina. La potenza di calcolo conta davvero in due momenti: quando il modello viene creato e quando legge prompt lunghi o serve molti utenti insieme. Per un utente solo che aspetta la risposta, conta la memoria.