Introduzione
Negli ultimi anni la comparazione delle intelligenze artificiali si è basata quasi esclusivamente su metriche semplici: prezzo per token, numero di parametri, ampiezza della finestra di contesto e punteggi su benchmark standard. Queste informazioni sono facili da reperire, confrontabili e diventate il “linguaggio comune” per valutare prestazioni e costi. Tuttavia raccontano solo il prodotto, non il lavoro reale che un’organizzazione deve svolgere.
Perché il prezzo per token è una misura incompleta
Il token è l’unità di fatturazione dei fornitori di IA, ma non è l’unità di valore per chi utilizza la tecnologia. Un token indica quanto testo attraversa il modello, non quanto lavoro utile ne esce. Altri indicatori tradizionali presentano analoghi limiti:
- Numero di parametri: indica la dimensione del modello, non la sua capacità. Il modello Chinchilla (70 miliardi di parametri) superava Gopher (280 miliardi) grazie a un addestramento su dati più ampi.
- Finestra di contesto: mostra quanto materiale si può fornire in una singola chiamata, ma non quanto il modello lo utilizza efficacemente; ogni pagina aggiunta si paga come token in ingresso.
- Velocità di generazione: misura il tempo di risposta, non la correttezza della risposta.
- Punteggi sui benchmark: valutano compiti standard in condizioni controllate, raramente comparabili a processi reali come pratiche amministrative o revisioni contrattuali.
Il vero costo: risultato verificato
Per chi deve automatizzare l’assistenza clienti, riassumere cartelle cliniche, analizzare contratti o smistare istanze dei cittadini, la domanda cruciale è: quanto costa ottenere a fine mese mille pratiche trattate correttamente? La risposta richiede di spostare l’unità di misura da “token” a “risultato verificato”.
Un risultato verificato è quello che ha superato una soglia di qualità stabilita in anticipo, tenendo conto di:
- Ragionamento interno del modello, che può moltiplicare il consumo di token.
- Tentativi e rigenerazioni, perché il costo di un risultato è la somma dei costi di tutte le prove divisa per la probabilità di successo.
- Controlli umani, spesso la voce più pesante del conto finale.
- Errori non rilevati, con costi di correzione o di danni reputazionali.
- Integrazione con sistemi legacy, sicurezza, conformità e monitoraggio continuo.
Evoluzione dei prezzi dell’inferenza
Negli ultimi anni una quota crescente del calcolo è passata dall’addestramento all’inferenza, cioè al momento in cui il modello risponde. Già nel 2024 ricercatori hanno dimostrato che dedicando più potenza di calcolo alla risposta, un modello può battere uno fino a quattordici volte più grande. Il vantaggio è reale, ma non è gratuito: si paga in token di ragionamento che l’utente non vede, in tentativi ripetuti e in passaggi intermedi che la fattura conteggia comunque.
Dati recenti sulla riduzione dei costi
L’AI Index 2025 di Stanford segnava una riduzione di oltre 280 volte del costo per interrogare un modello con prestazioni pari a GPT‑3.5 tra novembre 2022 e ottobre 2024. Un aggiornamento del 22 settembre 2026 da Epoch AI, condotto da Luke Emberson e David Roodman, mostrava che, su cinque benchmark di matematica, scienze e giochi di abilità, il costo necessario per raggiungere un dato livello di prestazione era sceso in media del 47 % a trimestre, circa tredici volte l’anno.
Un caso emblematico riguarda GPQA Diamond, un test a scelta multipla di scienze avanzate. Epoch stima che OpenAI o3 (gennaio 2025) raggiungesse il 75 % di accuratezza a circa 0,30 USD per domanda, mentre, meno di diciotto mesi dopo, GPT‑5.6 Luna otteneva lo stesso risultato a 0,0004 USD, una riduzione di 725 volte. È importante sottolineare che questi numeri confrontano costi di inferenza per un livello di benchmark, non tariffe di API integrate in un flusso operativo.
Limiti della curva di efficienza storica
Gli autori di Epoch avvertono che la curva descrive un “utente ideale” che sceglie sempre il modello meno costoso capace di raggiungere la prestazione desiderata. Le organizzazioni reali, invece, tendono a mantenere lo stesso modello per più iterazioni, perché cambiare modello richiede tempi di integrazione e formazione.
Di conseguenza, il dato risponde alla domanda “quanto costa oggi una prestazione già raggiunta in passato?” ma non a “quanto costa spingere oggi la frontiera”. Trasformare un indicatore di efficienza storica in una promessa di risparmio per ogni acquirente può essere fuorviante.
Analisi del “Price of Progress”
Hans Gundlach, Jayson Lynch, Matthias Mertens e Neil Thompson (MIT FutureTech & CSAIL) hanno incrociato risultati di benchmark e prezzi storici provenienti da Artificial Analysis ed Epoch AI. Nel loro studio “The Price of Progress” stimano che, nel periodo analizzato, raggiungere un dato livello di prestazione è diventato da cinque a dieci volte meno costoso all’anno, con variazioni tra tipologie di prova e fasce di capacità.
Tuttavia, la stessa analisi rileva che il costo di eseguire i modelli migliori disponibili è aumentato, nelle prove considerate, di circa tre‑diciotto volte l’anno. La crescita della spesa di inferenza è stata una componente cruciale dei miglioramenti su GPQA Diamond: a costo di benchmark controllato, la prestazione è cresciuta circa la metà rispetto a quanto suggerito dalla curva di costo unitario.
Le due tendenze non si contraddicono
Il prezzo unitario per token può continuare a scendere, ma il numero di token o di operazioni necessarie per ottenere un miglioramento marginale può crescere. Se il costo per token diminuisce di dieci volte, ma il calcolo richiesto per guadagnare un punto di accuratezza aumenta di cento volte, il costo complessivo della prestazione cresce di dieci volte.
Per chi acquista, la conseguenza è concreta: i modelli meno costosi raggiungono capacità un tempo riservate a fascia alta, ma l’uso intensivo di un modello di punta con ragionamento avanzato può restare proibitivo se valutato solo in termini di token.