OpenAI API o Claude API: il token economico può costare di più per compito

|Autore: Redazione QUASA|7 min di lettura
OpenAI API o Claude API: il token economico può costare di più per compito

Tra OpenAI API e Claude API conviene scegliere in base al costo di un compito riuscito sul proprio carico di produzione, non alla sola tariffa di input. Un modello meno caro per chiamata può costare di più se richiede altri tentativi per ottenere una risposta valida. Anche i token di output, le letture dalla cache e l'elaborazione batch possono spostare il risultato.

Il confronto seguente applica gli stessi volumi ipotetici di token a GPT-5.4 Mini e Claude Haiku 4.5. I conti isolano l'effetto delle tariffe; non attribuiscono ai modelli differenze di qualità o velocità mai misurate su questi compiti. Nelle richieste reali, il numero di token fatturati può variare tra le API anche quando il contenuto inviato sembra identico.

Prezzi di input e output: cosa entra nel conto

Le tariffe di GPT-5.4 Mini sono 0,75 dollari per milione di token di input ordinario, 0,075 per l'input letto dalla cache e 4,50 per l'output. Una risposta lunga può quindi pesare sul conto più del testo inviato al modello. La scheda del modello indica anche la disponibilità del Batch API.

Per Claude Haiku 4.5, il listino Anthropic indica, sempre per milione di token, 1 dollaro di input, 5 di output, 1,25 per una scrittura nella cache di cinque minuti e 0,10 per una lettura. Indica inoltre un prezzo batch pari alla metà di quello ordinario per input e output. I calcoli qui sotto riguardano le API dei rispettivi fornitori alle tariffe standard: funzioni aggiuntive, condizioni contrattuali o percorsi di elaborazione diversi richiedono un conto distinto.

Il prezzo per milione di token permette di confrontare le voci di spesa, ma non dice quante chiamate serviranno. Per passare dal listino al costo di un lavoro completato bisogna conoscere almeno i token fatturati in ciascuna categoria, gli eventuali tentativi ripetuti e il criterio con cui una risposta viene accettata.

Chatbot: quanto valgono le letture dalla cache

Primo scenario ipotetico: venti chiamate condividono un prefisso identico di 5.120 token. Ciascuna aggiunge 1.000 token di input variabile e produce 500 token di output. Si assume che la prima chiamata memorizzi il prefisso e che le altre diciannove lo leggano dalla cache entro la durata utile, senza letture parziali.

La guida OpenAI alla cache spiega che il riuso riguarda un prefisso invariato e che l'input può essere fatturato alla tariffa ordinaria, a quella di lettura o, dove prevista, a quella di scrittura. Nel nostro scenario la prima elaborazione del prefisso di GPT-5.4 Mini usa la tariffa ordinaria; le successive usano quella ridotta. Per Claude Haiku 4.5 si applicano invece la tariffa di scrittura di cinque minuti alla prima chiamata e quella di lettura alle altre.

Il totale ipotetico è 0,071136 dollari per GPT-5.4 Mini: 0,00384 per il prefisso iniziale, 0,007296 per le diciannove letture, 0,015 per l'input variabile e 0,045 per l'output. Claude Haiku 4.5 arriva a 0,086128 dollari: 0,0064 per la scrittura, 0,009728 per le letture, 0,02 per l'input variabile e 0,05 per l'output. Il costo medio per chiamata è circa 0,00356 contro 0,00431 dollari.

Questa convenienza dipende dai colpi di cache assunti nel calcolo. Se il prefisso cambia, una parte dei token torna alla tariffa ordinaria e possono servire nuove scritture. Per un chatbot con istruzioni, strumenti o cronologia che cambiano spesso, il dato decisivo è quanti token risultano effettivamente letti dalla cache, oltre a quante risposte soddisfano il criterio di qualità del servizio.

Estrazione batch: il costo scende se il lavoro può attendere

Secondo scenario ipotetico: 1.000 documenti, ognuno con 2.000 token di input e 200 di output, senza cache. Il carico complessivo è di due milioni di token in ingresso e 200.000 in uscita. Applicando le tariffe batch ai prezzi indicati sopra, GPT-5.4 Mini costerebbe 1,20 dollari e Claude Haiku 4.5 costerebbe 1,50 dollari: rispettivamente 0,0012 e 0,0015 dollari per documento elaborato.

La guida OpenAI al Batch API prevede uno sconto del 50% sulle chiamate sincrone e una finestra di completamento di 24 ore. Lo sconto è utile per un'estrazione differibile, ma la scadenza richiesta dal progetto resta parte del confronto. Un record con campi mancanti o in un formato inutilizzabile può richiedere una nuova chiamata: il costo per documento elaborato, in quel caso, è inferiore al costo per documento accettato.

Il calcolo presume inoltre che tutti i documenti abbiano la stessa lunghezza e generino la stessa quantità di output. Se alcuni producono risposte molto più estese, la tariffa di output può incidere più dello sconto sull'input. La distribuzione dei token nei documenti reali è quindi più informativa della sola dimensione media del lotto.

Agente con output lungo: la soglia che può invertire la scelta

Terzo scenario ipotetico: un compito richiede quattro chiamate, ciascuna con 8.000 token di input non letti dalla cache e 4.000 di output. Sono 32.000 token in ingresso e 16.000 in uscita per esecuzione. Alle tariffe ordinarie già indicate, il costo è 0,096 dollari con GPT-5.4 Mini e 0,112 con Claude Haiku 4.5. Il conteggio assume che tutti i token fatturabili di queste chiamate rientrino nei volumi dichiarati e non include eventuali costi separati di strumenti esterni.

Il costo per compito riuscito dipende anche dalla quota di esecuzioni accettate. In un esempio puramente ipotetico, supponiamo che GPT-5.4 Mini completi correttamente il 60% dei compiti e Claude Haiku 4.5 il 75%. Dividendo il costo di un'esecuzione per la rispettiva probabilità di successo, si ottengono 0,160 dollari contro circa 0,149 dollari per compito riuscito. In queste condizioni, la chiamata più cara produce il risultato valido a un costo atteso inferiore. Le percentuali servono solo a mostrare il meccanismo: non sono risultati di un benchmark sui due modelli.

Con il 60% di successo assunto per GPT-5.4 Mini, Claude Haiku 4.5 dovrebbe superare il 70% per compensare il suo maggiore costo per esecuzione in questo scenario. Se le percentuali fossero uguali, GPT-5.4 Mini resterebbe più economico. La soglia vale per tentativi indipendenti e di costo costante; un agente reale può invece allungare il contesto dopo un errore o aggiungere chiamate e token nei tentativi successivi.

Il volume di output merita attenzione particolare. Nello scenario dell'agente rappresenta metà dei token, ma pesa per la maggior parte del costo di entrambe le esecuzioni. Ridurre l'input senza cambiare la lunghezza delle risposte avrebbe quindi un effetto limitato sul totale; una differenza nella quantità di output fatturato cambierebbe invece direttamente il confronto.

Velocità e qualità sul carico effettivo

Un costo basso serve poco a una funzione interattiva se la risposta arriva dopo il tempo utile. La metodologia di Artificial Analysis distingue, tra le altre misure, il tempo al primo token, la velocità di generazione e il tempo necessario a ricevere l'intera risposta. Una misura di velocità ha senso per questa scelta solo se il tipo e la lunghezza delle richieste somigliano al carico che l'applicazione invierà davvero.

Per confrontare la qualità, lo stesso insieme di compiti deve avere criteri di accettazione definiti prima di osservare i risultati: per il chatbot può contare la correttezza della risposta, per l'estrazione la validità dei campi, per l'agente il completamento dell'obiettivo. Da quegli esiti si ricavano il costo totale dei tentativi diviso per i compiti accettati e il tempo necessario a completarli. Sono questi valori, insieme ai token fatturati per input, cache e output, a stabilire quale delle due API conviene per quel lavoro.

Leggi anche:

Condividi:

Iscriviti alla nostra newsletter

Ricevi le ultime notizie su Web3, IA e cripto direttamente nella tua casella di posta.

0