Come funziona l'IA Hardware e calcolo
Diagramma tecnico Quattordici stadi · Settembre 2026

Dal telefono al data center

Quanto hardware serve, e perché. Cinque taglie di modello, dalla mezza dimensione che gira su un telefono al modello di frontiera che occupa un edificio — con il conto della memoria, della banda, dei watt e degli euro a ogni gradino.

La scala

Cinque gradini attraversano tutto il diagramma. Ogni riquadro con la riga rossa dà il numero corrispondente a ciascuno.

0,5 G · 8 G · 70 G · 400 G · frontiera

Parametri. L'ultimo gradino è un MoE da qualche migliaio di miliardi.

01
Premessa

Non è una risorsa sola: sono quattro

«Quanta potenza serve» è la domanda sbagliata. Le quattro risorse si esauriscono in momenti diversi, e in quasi tutti i casi pratici quella che ti ferma non è il calcolo.

Analogia

Una cucina professionale. La potenza dei fornelli è il calcolo, il piano di lavoro è la capacità di memoria, la velocità con cui gli aiutanti portano gli ingredienti dal magazzino è la banda, e le porte fra una cucina e l'altra sono l'interconnessione. Puoi avere fornelli fortissimi e restare fermo perché nessuno ti porta le verdure.

Calcolo · FLOP/s

Quante moltiplicazioni al secondo

Una scheda da data center attuale sta fra 10¹⁵ e 5 · 10¹⁶ operazioni al secondo in bassa precisione, il massimo a 4 bit sulla generazione più recente. È il numero che finisce nei comunicati stampa, ed è quello che limita meno spesso.

Limita: l'addestramento e la lettura dei prompt.

Capacità · GB

Quanto ci sta

80-290 GB per scheda nel 2026, oltre 400 GB sulle schede HBM4 più capienti. È un limite netto: se i pesi non ci stanno, il modello non parte. Non c'è modo di andare più piano e farcela lo stesso.

Limita: quale modello puoi far girare, e quanti utenti insieme.

Banda · GB/s

Quanto in fretta si legge

3-8 TB/s su una scheda da data center con HBM3e, circa 20 TB/s sulla nuova generazione con HBM4; 1-1,8 TB/s su una da gioco; 50-100 GB/s su un PC normale. È questa a decidere la velocità di generazione, e quasi nessuno la guarda.

Limita: i token al secondo.

Interconnessione · GB/s

Quanto in fretta si parlano

Fra schede dello stesso dominio veloce, 1,8-3,6 TB/s ciascuna, e oggi il dominio è un armadio intero da 72 schede. Fra armadi, circa 100 GB/s: venti-trenta volte meno. Questo salto governa tutta l'architettura dei cluster.

Limita: l'addestramento distribuito e i modelli troppo grandi per una macchina.

02
Scala

I cinque gradini, con il loro hardware

Ogni gradino moltiplica per circa dieci i parametri, e cambia categoria di macchina. Non è un continuo: sono cinque regimi con vincoli, costi e casi d'uso diversi.

TagliaPesi in bf16Hardware minimoCosa sa fare
0,5 G · nano1 GBun telefono, un computer a scheda singolaclassificare, estrarre campi, completare
8 G · piccolo16 GBuna scheda da gioco, se quantizzatoconversazione, riassunti, codice semplice
70 G · medio140 GB1 scheda da data center, o un Mac con molta memoriaragionamento discreto, buona conoscenza
400 G · grande800 GBun server intero, 8 schede collegatevicino alla frontiera; in locale solo a 4 bit, e piano
frontiera · MoE 1-2 T2-4 TBa 4 bit un server da 8 schede nuove; per servirlo, un armadio da 72tutto il resto
Il gradino basso non è inutile

Un modello da mezzo miliardo, addestrato bene su un compito preciso, batte un modello di frontiera generico su quel compito — e costa mille volte meno per chiamata. La domanda giusta non è «qual è il più capace» ma «qual è il più piccolo che risolve questo».

Perché la frontiera è MoE

Un denso da 2000 miliardi richiederebbe 4000 GFLOP per token: impraticabile. Con gli esperti si accende il 2-5% dei parametri, 30-100 G, quindi il calcolo e la velocità sono quelli di un modello denso di quella taglia. La memoria invece deve contenere tutti e 2000. Si compra qualità con la capacità, non con la velocità.

03
Macchina

Cosa c'è dentro un acceleratore

Una CPU ha una decina di core molto intelligenti. Un acceleratore ha decine di migliaia di unità stupide che fanno tutte la stessa cosa su dati diversi — e, accanto, circuiti dedicati a una sola operazione: moltiplicare matrici piccole.

Analogia

Un artigiano contro una catena di montaggio. L'artigiano (CPU) fa qualsiasi cosa, decide, si adatta. La catena (GPU) sa fare una sola operazione, ma diecimila volte in parallelo. Le reti neurali sono state adottate anche perché si riducono a quell'unica operazione.

Livello
Cosa contiene
Capacità
Banda
Registri e memoria locale
il riquadro su cui si sta lavorando adesso
KB
centinaia di TB/s
Cache
i blocchi riusati a breve
decine di MB
decine di TB/s
HBM · memoria della scheda
i pesi del modello e la cache KV
80-290 GB, fino a 432
3-8 TB/s, ~20 con HBM4
RAM del server
ciò che non ci sta sulla scheda
TB
~50-100 GB/s
Disco
i dati di addestramento
PB
~10 GB/s
Ogni gradino verso il basso è dieci-cento volte più lento e mille volte più capiente. Far scendere i pesi di un livello — dalla HBM alla RAM — significa rallentare la generazione di trenta volte o più: è la ragione per cui «basta scaricare sulla RAM» non è una soluzione praticabile.
I circuiti per le matrici

Accanto alle unità generiche ci sono blocchi che moltiplicano una matrice piccola in un colpo solo, in bassa precisione. Sono loro a produrre i numeri dichiarati: senza usarli, la stessa scheda va dieci volte più piano.

Le alternative

Non c'è solo un produttore: esistono acceleratori progettati dai grandi operatori cloud e schede concorrenti con memoria abbondante. La differenza principale non è il silicio ma l'ecosistema software — è lì che si è formato il vantaggio dominante.

04
Legge

La formula che spiega quasi tutto

Per generare un token bisogna leggere dalla memoria tutti i pesi che quel token usa. In un modello denso sono tutti; in un modello a esperti solo quelli attivi. Quindi la velocità massima di generazione non dipende dalla potenza di calcolo: dipende da quanto in fretta si legge la memoria.

token/s ≈ banda ÷ peso letto per token

Un tetto teorico che in pratica si raggiunge al 60-80%. Vale per un utente solo alla volta — con il batching dello stadio 08 il conto cambia radicalmente.

Nei modelli a esperti la velocità dipende dai parametri attivi, la memoria necessaria dai parametri totali. Un MoE da 120 G con 5 G attivi, a 4 bit, occupa ~65 GB ma ne legge ~3 per token: su una macchina da 270 GB/s ha un tetto di circa 90 token/s, contro i ~7 di un denso da 70 G sulla stessa macchina.

Tetto teorico, modello quantizzato a 4 bit, un solo utente
Macchina
Banda
Modello 8 G · 4,5 GB
Modello 70 G · 40 GB
Scheda da data center, HBM3e
4-8 TB/s
~900-1.800 tok/s
~100-200 tok/s
Scheda da data center, HBM4
~20 TB/s
~4.400 tok/s
~500 tok/s
Scheda da gioco
1-1,8 TB/s
~220-400 tok/s
non ci sta
Desktop a memoria unificata
800 GB/s
~180 tok/s
~20 tok/s
Mini-PC a memoria unificata
270 GB/s
~60 tok/s
~7 tok/s
PC desktop, solo CPU
50-100 GB/s
~11-22 tok/s
~1-2 tok/s
Come si sfonda il tetto

La decodifica speculativa. Un modello piccolo, o una testa aggiuntiva del modello stesso, indovina i prossimi 3-5 token. Il modello grande li verifica tutti insieme con una sola lettura dei pesi e tiene quelli giusti. Il risultato è identico e la velocità per utente cresce di 2-3 volte: si sfrutta il calcolo che durante la generazione resta inutilizzato.

Per riferimento: si legge a circa 5-8 token al secondo, si parla a 3-4. Sotto i 10 token/s l'attesa si sente; sopra i 40 la lettura non tiene il passo e la velocità in più serve solo a chi non legge — cioè al codice.
05
Conto

Il conto della memoria, per intero

I pesi sono solo il primo addendo. Chi dimensiona un sistema guardando solo quelli scopre in produzione che con dieci utenti e contesti lunghi la memoria finisce.

Modello 70 G, bf16, 16 utenti con 32.000 token di contesto ciascuno
Pesi
70 G × 2 byte
140 GB
Cache KV
≈ 320 KB/token × 32.000 × 16 utenti
164 GB
Attivazioni e spazio di lavoro
dipende dal batch
~10 GB
Frammentazione e margine
10% circa
~30 GB
Totale
2 schede da 288 GB (3 da 141), non 1
344 GB
La cache KV supera i pesi. Con 64 utenti invece di 16 li supererebbe di quattro volte: è la lunghezza di contesto, non la dimensione del modello, a determinare quanti utenti stanno su una macchina.
Come si contiene la cache

Condividere le teste di chiavi e valori fra più teste di query, quantizzare la cache a 8 bit, allocarla a pagine invece che in blocco per non sprecare spazio, e riusare il prefisso comune fra utenti diversi. Ognuna vale un fattore due o tre. I modelli più recenti vanno oltre: alcuni comprimono chiavi e valori in un vettore latente piccolo, un altro fattore cinque o dieci; altri alternano strati che guardano tutto il contesto a strati con una finestra corta, che tengono pochi token. La cache che non serve subito si sposta in RAM o su disco e si ricarica quando l'utente torna.

Il conto rapido

Regola pratica: memoria ≈ pesi × 1,2 + cache, dove la cache vale circa 0,1-0,3 GB per migliaio di token di contesto per utente su un modello medio (0,32 GB sul 70 G dell'esempio). Basta per capire in trenta secondi se un'idea sta in piedi.

06
Leva

Quantizzare: la leva più efficace

Usare meno bit per peso riduce la memoria e — poiché la generazione è limitata dalla banda — accelera nella stessa proporzione. È l'unica leva che migliora entrambi i vincoli insieme.

Analogia

Comprimere una fotografia. A qualità 90 nessuno vede la differenza e il file dimezza. A qualità 40 si vedono gli artefatti. La domanda non è se si perde qualcosa — si perde sempre — ma se si perde qualcosa che conta per l'uso che ne fai.

PrecisioneByte/pesoModello 8 GModello 70 GPerdita di qualità
bf16216 GB140 GBriferimento
fp8 / int818 GB70 GBquasi nulla, misurabile a fatica
int4 / fp4 (a gruppi)0,54,5 GB40 GBpiccola ma reale, si vede sui compiti difficili
sotto i 3 bit< 0,43 GB28 GBsensibile: da valutare caso per caso
Regola empirica solida: un modello grande quantizzato batte quasi sempre un modello piccolo a piena precisione, a parità di memoria. Un 70 G a 4 bit (40 GB) vale più di un 20 G a 16 bit (40 GB).
Il 4 bit diventa nativo

Le schede più recenti non si limitano a conservare i pesi in 4 bit: moltiplicano direttamente in un formato a virgola mobile da 4 bit, con un fattore di scala ogni 16 o 32 valori. Rispetto a 8 bit, la memoria si dimezza e il calcolo raddoppia. Sempre più modelli nascono già così, addestrati sapendo che verranno usati a 4 bit, e la perdita di qualità diventa trascurabile.

Come funziona

I pesi si dividono in gruppi di 64 o 128; per ogni gruppo si tiene un fattore di scala in alta precisione e i pesi si rappresentano con 16 livelli. Alcuni canali particolarmente sensibili si lasciano a precisione piena: costa poco e recupera gran parte della perdita.

Cosa non risolve

La cache KV va quantizzata a parte, e sui contesti lunghi è lei il problema. E la quantizzazione non rende un modello più capace: rende accessibile un modello che c'era già. Il tetto resta quello del modello a piena precisione.

07
Locale

Far girare un modello su hardware tuo

Quattro categorie di macchina, quattro regimi diversi. Il criterio è sempre lo stesso: prima verifica che ci stia, poi dividi la banda per il peso letto a ogni token, cioè i soli parametri attivi nei modelli a esperti, e sai già quanto andrà veloce.

Telefono e dispositivi

Fino a 1-3 G

8-16 GB condivisi con tutto il resto, banda 50-100 GB/s, e un limite che sul server non esiste: la batteria e il calore. Si usano acceleratori dedicati a basso consumo.

Realistico: 20-50 token/s su un modello da 1 G a 4 bit. Buono per correzione, riassunto, comandi vocali.

PC senza scheda dedicata

Fino a 8 G, con pazienza

Tanta RAM e pochissima banda: 50-100 GB/s sono il collo di bottiglia. Il modello ci sta ma striscia.

Realistico: 5-15 token/s su un 8 G a 4 bit. Utilizzabile per lavori in differita, faticoso in conversazione.

Scheda da gioco

Fino a 30-50 G a 4 bit (14 G in bf16), sopra non ci sta

24-32 GB di memoria molto veloce, 1-1,8 TB/s. Il rapporto qualità-prezzo migliore in assoluto per un singolo utente, se il modello entra.

Realistico: 150-250 token/s su un 8 G a 4 bit. Più veloce di quanto chiunque possa leggere.

Memoria unificata

Fino a 400 G, di più con i MoE

Le macchine con memoria condivisa fra processore e grafica vanno da 128 GB (mini-PC e workstation compatte) a 512 GB (desktop di fascia alta), e sono l'unico modo pratico di far girare un modello grande in casa. La banda varia molto, da 250 a oltre 800 GB/s, e decide tutto.

Realistico: su un 70 G a 4 bit circa 5 token/s sulle prime e 15 sulle seconde. Un MoE da 120 G con 5 G attivi va a 50-70. Completamente privato.

Perché si sceglie il locale

Quasi mai per il costo: ai volumi normali un'API costa meno dell'ammortamento dell'hardware. Le ragioni vere sono tre — dati che non devono uscire, funzionamento senza rete, e nessuna dipendenza da un fornitore che può cambiare prezzi o ritirare un modello.

08
Produzione

Servire molti utenti cambia tutto

Il tetto dello stadio 04 vale per un utente solo. Servendone sessantaquattro insieme si legge la memoria una volta e la si usa per sessantaquattro token: il lavoro utile si moltiplica quasi senza costo aggiuntivo.

Analogia

L'autobus contro il taxi. Il taxi arriva prima per te; l'autobus fa lo stesso viaggio per sessanta persone con lo stesso carburante. Un modello che gira solo per te sta viaggiando in taxi, ed è il motivo per cui l'hardware personale è inefficiente rispetto al cloud, non più lento.

Una scheda da ~4 TB/s, modello 8 G a 4 bit — cosa cambia con il batch
batch 1
~800 tok/s
latenza minima
batch 8
~5.000 tok/s
quasi uguale
batch 32
~16.000 tok/s
+20% di attesa
batch 128
~26.000 tok/s
si sente
Valori indicativi. Fino a un certo punto il throughput cresce quasi proporzionalmente e la latenza non peggiora — è memoria che stavi già leggendo. Oltre, si diventa limitati dal calcolo e ogni utente in più rallenta tutti.
Due fasi, due colli di bottiglia

Leggere il prompt è una grande moltiplicazione di matrici, limitata dal calcolo. Generare è una lettura continua dei pesi, limitata dalla banda. Sulla stessa scheda le due fasi si disturbano: un prompt lungo in arrivo blocca la generazione di tutti gli altri. Per questo i grandi servizi le separano su gruppi di schede diversi, che si passano la cache KV in rete, e dimensionano ognuno per il suo vincolo.

Il costo per milione di token

Con una scheda a circa 2 €/ora che produce 16.000 token/s: 2 ÷ (16.000 × 3600) ≈ 0,035 € per milione di token in uscita sul modello da 8 G. Il prezzo di listino delle API per quella taglia è qualche decimo di euro: il resto è margine, ridondanza, e il fatto che il carico non è mai pieno.

Il compromesso da dichiarare

Throughput e latenza si comprano a vicenda. Un servizio interattivo tiene batch piccoli e paga di più per token; un lavoro in differita accetta batch enormi. È esattamente la ragione tecnica per cui le API in modalità asincrona costano circa metà.

09
Distribuire

Quando il modello non ci sta su una scheda

Tre modi di spezzarlo, con costi di comunicazione molto diversi. La scelta dipende quasi interamente da dove passa il confine fra «dentro il dominio veloce» e «fuori». Fino al 2024 il dominio era un server da 8 schede; nel 2026 è un armadio da 72.

Per tensore

Ogni matrice tagliata a fette

Ogni scheda tiene un pezzo di ogni matrice e ne calcola una parte. Serve una sincronizzazione a ogni strato.

Solo dentro il dominio veloce, dove la connessione fra schede è quasi come la memoria locale. Riduce anche la latenza.

Per strati

Ogni scheda prende un tratto

I primi 20 strati qui, i successivi 20 là. Si comunica una volta sola per confine: pochissimo traffico.

Anche fra server. Difetto: se non si organizzano i dati in flusso continuo, metà delle schede aspetta.

Per esperti

Ogni scheda alcuni esperti

Nei modelli a esperti, ogni token va spedito alla scheda che ospita il suo esperto e il risultato torna indietro.

Molto traffico, a ogni strato. È il motivo per cui i modelli a esperti hanno bisogno di reti eccezionali, e oggi si servono dentro un armadio.

Dentro la scheda
3-22 TB/s
Dentro l'armadio
1,8-3,6 TB/s
Fra armadi
~100 GB/s
Il salto di venti-trenta volte fra la seconda e la terza colonna è il fatto architetturale più importante di tutto il calcolo distribuito per l'IA. Ogni scelta di come spezzare un modello nasce dal tenere il traffico più fitto dentro quel confine.
10
Training

Addestrare è un altro ordine di problema

Otto volte la memoria per parametro, e un numero di operazioni che si conta in unità che non compaiono altrove. Fra far girare un modello e crearlo ci sono quattro o cinque ordini di grandezza.

Memoria
≈ 16 byte per parametro

Pesi in bassa precisione, gradienti, una copia di riferimento in alta precisione e i due stati dell'ottimizzatore. Più le attivazioni conservate per il passaggio inverso.

Il modello da 8 G: 128 GB, più le attivazioni. Su una scheda da 80 GB non ci sta, su una da 288 ci sta a fatica. Ma su una scheda sola l'addestramento durerebbe circa cinquant'anni.

Calcolo
C ≈ 6 · N · D

Sei operazioni per parametro per token: due in avanti, quattro all'indietro. Moltiplicato per tutti i token del corpus, ripetuto per tutto l'addestramento.

Il modello da 8 G su 15.000 miliardi di token: 7,2 · 10²³ operazioni.

MFU: il numero che nessuno dichiara

La frazione della potenza nominale effettivamente usata. Fra il 30 e il 50% nei cluster ben fatti; il resto se ne va in attese, comunicazione e operazioni che non sono moltiplicazioni di matrici. Chi stima i tempi con i numeri di targa sbaglia di un fattore due o tre.

Distribuire l'ottimizzatore

Poiché gli stati sono il grosso della memoria, si spezzano fra tutte le schede invece di replicarli: ognuna ne custodisce una fetta e la condivide al momento dell'aggiornamento. È la tecnica che rende possibile addestrare modelli molto più grandi della singola scheda.

11
Edificio

Alla frontiera il vincolo è l'elettricità

Sopra le diecimila schede, il problema smette di essere informatico e diventa industriale: potenza allacciata, smaltimento del calore, e il fatto che qualcosa si rompe di continuo.

Analogia

Non è una sala server: è un impianto siderurgico. Si sceglie dove costruirlo in base a dove c'è corrente disponibile, si progetta il raffreddamento prima del calcolo, e si mette in conto che una parte della linea sia sempre ferma per manutenzione.

Consumo per scheda
1-2,3 kW a seconda della generazione, più raffreddamento e infrastruttura
1,5-2,5 kW reali
Un armadio
72 schede collegate strettamente, raffreddate interamente a liquido
120-230 kW
Un cluster di frontiera (2026)
200.000-500.000 schede
0,5-1,2 GW
Per confronto
il consumo medio di una regione italiana da circa 1,7 milioni di abitanti, circa il 3% della domanda elettrica media italiana
~1 GW
I guasti sono la norma

Con centinaia di migliaia di componenti, qualcosa si rompe ogni poche ore: memoria difettosa, cavi, alimentatori. L'addestramento è sincrono, quindi un guasto ferma tutti. Si salva lo stato di continuo e si riparte dall'ultimo salvataggio — la percentuale di tempo effettivamente produttivo è una delle metriche che i team guardano di più.

Il calore

Oltre i 50 kW per armadio l'aria non basta più: si passa al liquido, con tubazioni fino al singolo chip. È il motivo per cui i data center per l'IA non si ricavano in quelli esistenti ma si costruiscono nuovi, e per cui i tempi sono dettati dall'edilizia più che dalla disponibilità di silicio. Le generazioni nuove usano acqua a 45 °C, abbastanza calda da smaltire il calore senza refrigeratori.

12
Bilancio

Il conto completo, gradino per gradino

Ore-scheda, tempo, energia, spesa. Tutti stimati con 6ND su schede da ~10¹⁵ operazioni al secondo in bf16 (classe H100) con un rendimento effettivo del 40%, a circa 2 € l'ora e ~1,5 kW reali per scheda.

TagliaOperazioniOre-schedaCon quante schedeEnergiaOrdine di spesa
0,5 G1,5 · 10²²~10.00064 → 7 giorni~16 MWh10⁴ €
8 G7,2 · 10²³~500.000500 → 42 giorni~0,75 GWh10⁶ €
70 G6,3 · 10²⁴~4,4 M4.000 → 46 giorni~6,6 GWh10⁷ €
400 G~4 · 10²⁵~28 M16.000 → 72 giorni~42 GWh10⁸ €
frontiera~10²⁶~70 M50.000 → 58 giorni~100 GWh10⁸-10⁹ €
Solo l'addestramento finale. Non conta gli esperimenti falliti, i modelli di prova, la raccolta e la pulizia dei dati, il post-training, né le persone — voci che nei laboratori di frontiera valgono quanto o più del calcolo dichiarato. Per confronto, Llama 3.1 405B ha dichiarato 30,8 M ore H100. Per la frontiera, 6ND sui soli parametri attivi dà ~10²⁵: le stime pubbliche di 10²⁶ e oltre includono modelli con più parametri attivi e una fase di apprendimento per rinforzo che nel 2025-2026 è arrivata a costare quanto il pre-addestramento.
Perché il tempo resta simile

Salendo di taglia si aggiungono schede invece di aspettare: i grandi addestramenti durano tutti fra uno e tre mesi, per taglie che differiscono di cento volte. Il limite non è la pazienza ma il ciclo del prodotto — un modello che impiegasse un anno nascerebbe già vecchio.

Addestrare una volta, usare per sempre

Il costo di addestramento è fisso e si ammortizza su tutte le richieste. Su un modello molto usato, l'inferenza supera il training in pochi mesi e da lì in poi è la voce dominante: sul ciclo di vita, il rapporto tipico è circa 90 a 10 a favore dell'inferenza.

13
Via di mezzo

Adattare un modello costa quasi niente

Fra «uso quello che c'è» e «ne addestro uno mio» c'è una via di mezzo che quasi nessuno considera, e che sull'hardware si colloca cinque ordini di grandezza più in basso.

L'idea

Si congelano tutti i pesi e si aggiunge accanto a ogni matrice una correzione di rango basso: due matrici sottili il cui prodotto ha la forma dell'originale ma pochissimi parametri. Si addestrano solo quelle. Con lo 0,1-1% dei parametri si ottiene gran parte del beneficio di un adattamento completo.

Sul modello da 8 GMemoriaHardwareTempoSpesa
Addestramento da zero128 GB+500 schede42 giorni10⁶ €
Adattamento completo128 GB1-2 schede da data centerore10²-10³ €
Rango basso, base a 4 bit~12 GBuna scheda da gioco1-6 ore~10 €
L'ultima riga è la ragione per cui esistono migliaia di varianti specializzate di ogni modello aperto: chiunque abbia una scheda decente e qualche migliaio di esempi può produrne una in una serata.
Il vantaggio operativo

L'adattamento pesa poche decine di MB invece di decine di GB. Si possono tenere caricati sullo stesso modello base decine di adattamenti diversi e scambiarli per richiesta: un modello per cliente, senza moltiplicare la memoria.

Cosa non fa

Insegna stile, formato, gergo, comportamento. Non è il modo di insegnare fatti — quelli invecchiano, non si citano, e la stessa spesa in un buon sistema di recupero rende molto di più.

14
Decisione

Comprare hardware conviene molto più tardi di quanto si creda

La scheda va pagata ventiquattro ore al giorno; l'API si paga a consumo. Poiché nessun carico reale è costante, il confronto si decide sul fattore di utilizzo, non sul prezzo di listino.

Il punto di pareggio, modello da 8 G
Una scheda a noleggio
2 €/h × 24 × 30
~1.450 €/mese
Prezzo API per quella taglia
ordine di 0,2 € per milione di token
a consumo
Pareggio
1.450 € ÷ 0,2 € per milione
~7 miliardi
di token/mese
Sette miliardi di token al mese sono circa 250 milioni al giorno, il traffico di un prodotto con centinaia di migliaia di utenti attivi. A regime la scheda dello stadio 08 ne produrrebbe circa 40 miliardi, ma il traffico non è uniforme: bisogna dimensionare per il picco e tenere una scheda di riserva. Per questo nella pratica il pareggio arriva due o tre volte più in alto della soglia teorica.
Ragioni valide per l'hardware proprio

Dati che non possono uscire · latenza garantita e prevedibile · funzionamento senza rete · volumi davvero enormi e costanti · indipendenza da un fornitore che può cambiare modello, prezzi o condizioni.

Costi che si dimenticano

Le persone che lo mantengono · la ridondanza per i guasti · il sovradimensionamento per i picchi · l'aggiornamento a ogni nuova generazione di modelli · e il fatto che di notte la scheda continua a costare.

In una riga

Il limite è quasi sempre la memoria, non il calcolo.

Quanti GB per i pesi, quanti per la cache, e con che velocità si leggono. Da queste tre quantità discendono il modello che puoi far girare, quanti utenti servi, quanto ti costa e su quale macchina. La potenza di calcolo conta davvero in due momenti: quando il modello viene creato e quando legge prompt lunghi o serve molti utenti insieme. Per un utente solo che aspetta la risposta, conta la memoria.

Specifiche hardware, prezzi e consumi sono ordini di grandezza indicativi per il 2026 e variano rapidamente. I conti sono svolti con 6ND e un rendimento effettivo del 40% su schede classe H100. Settembre 2026