Introduzione

Negli ultimi anni la comparazione delle intelligenze artificiali si è basata quasi esclusivamente su metriche semplici: prezzo per token, numero di parametri, ampiezza della finestra di contesto e punteggi su benchmark standard. Queste informazioni sono facili da reperire, confrontabili e diventate il “linguaggio comune” per valutare prestazioni e costi. Tuttavia raccontano solo il prodotto, non il lavoro reale che un’organizzazione deve svolgere.

Perché il prezzo per token è una misura incompleta

Il token è l’unità di fatturazione dei fornitori di IA, ma non è l’unità di valore per chi utilizza la tecnologia. Un token indica quanto testo attraversa il modello, non quanto lavoro utile ne esce. Altri indicatori tradizionali presentano analoghi limiti:

Il vero costo: risultato verificato

Per chi deve automatizzare l’assistenza clienti, riassumere cartelle cliniche, analizzare contratti o smistare istanze dei cittadini, la domanda cruciale è: quanto costa ottenere a fine mese mille pratiche trattate correttamente? La risposta richiede di spostare l’unità di misura da “token” a “risultato verificato”.

Un risultato verificato è quello che ha superato una soglia di qualità stabilita in anticipo, tenendo conto di:

Evoluzione dei prezzi dell’inferenza

Negli ultimi anni una quota crescente del calcolo è passata dall’addestramento all’inferenza, cioè al momento in cui il modello risponde. Già nel 2024 ricercatori hanno dimostrato che dedicando più potenza di calcolo alla risposta, un modello può battere uno fino a quattordici volte più grande. Il vantaggio è reale, ma non è gratuito: si paga in token di ragionamento che l’utente non vede, in tentativi ripetuti e in passaggi intermedi che la fattura conteggia comunque.

Dati recenti sulla riduzione dei costi

L’AI Index 2025 di Stanford segnava una riduzione di oltre 280 volte del costo per interrogare un modello con prestazioni pari a GPT‑3.5 tra novembre 2022 e ottobre 2024. Un aggiornamento del 22 settembre 2026 da Epoch AI, condotto da Luke Emberson e David Roodman, mostrava che, su cinque benchmark di matematica, scienze e giochi di abilità, il costo necessario per raggiungere un dato livello di prestazione era sceso in media del 47 % a trimestre, circa tredici volte l’anno.

Un caso emblematico riguarda GPQA Diamond, un test a scelta multipla di scienze avanzate. Epoch stima che OpenAI o3 (gennaio 2025) raggiungesse il 75 % di accuratezza a circa 0,30 USD per domanda, mentre, meno di diciotto mesi dopo, GPT‑5.6 Luna otteneva lo stesso risultato a 0,0004 USD, una riduzione di 725 volte. È importante sottolineare che questi numeri confrontano costi di inferenza per un livello di benchmark, non tariffe di API integrate in un flusso operativo.

Limiti della curva di efficienza storica

Gli autori di Epoch avvertono che la curva descrive un “utente ideale” che sceglie sempre il modello meno costoso capace di raggiungere la prestazione desiderata. Le organizzazioni reali, invece, tendono a mantenere lo stesso modello per più iterazioni, perché cambiare modello richiede tempi di integrazione e formazione.

Di conseguenza, il dato risponde alla domanda “quanto costa oggi una prestazione già raggiunta in passato?” ma non a “quanto costa spingere oggi la frontiera”. Trasformare un indicatore di efficienza storica in una promessa di risparmio per ogni acquirente può essere fuorviante.

Analisi del “Price of Progress”

Hans Gundlach, Jayson Lynch, Matthias Mertens e Neil Thompson (MIT FutureTech & CSAIL) hanno incrociato risultati di benchmark e prezzi storici provenienti da Artificial Analysis ed Epoch AI. Nel loro studio “The Price of Progress” stimano che, nel periodo analizzato, raggiungere un dato livello di prestazione è diventato da cinque a dieci volte meno costoso all’anno, con variazioni tra tipologie di prova e fasce di capacità.

Tuttavia, la stessa analisi rileva che il costo di eseguire i modelli migliori disponibili è aumentato, nelle prove considerate, di circa tre‑diciotto volte l’anno. La crescita della spesa di inferenza è stata una componente cruciale dei miglioramenti su GPQA Diamond: a costo di benchmark controllato, la prestazione è cresciuta circa la metà rispetto a quanto suggerito dalla curva di costo unitario.

Le due tendenze non si contraddicono

Il prezzo unitario per token può continuare a scendere, ma il numero di token o di operazioni necessarie per ottenere un miglioramento marginale può crescere. Se il costo per token diminuisce di dieci volte, ma il calcolo richiesto per guadagnare un punto di accuratezza aumenta di cento volte, il costo complessivo della prestazione cresce di dieci volte.

Per chi acquista, la conseguenza è concreta: i modelli meno costosi raggiungono capacità un tempo riservate a fascia alta, ma l’uso intensivo di un modello di punta con ragionamento avanzato può restare proibitivo se valutato solo in termini di token.

Leggi l'articolo originale →