
OpenAI, Claude sau Gemini API: modelul ieftin se schimbă cu sarcina

În comparația dintre OpenAI API, Claude API și Gemini API, cel mai mic cost pentru aceeași aplicație depinde de sarcina executată. Cu volumele presupuse aici, Gemini 2.5 Pro este cel mai ieftin pentru suport scurt, Claude Sonnet 5.5 pentru un document lung, iar la un agent cu istoric durata cache-ului poate schimba din nou ordinea.
Factura lunară se estimează din costul sarcinii complete înmulțit cu numărul de sarcini: intrarea nouă, intrarea reutilizată din cache, ieșirea facturată și, unde există, stocarea contextului. Prețul pe milion de tokeni de intrare nu surprinde singur efectul unui răspuns lung sau al unui prag de context.
Tarifele care intră în calcul
Comparația folosește tarifele plătite Standard pentru text, în USD per milion de tokeni. Grila GPT-5.4 indică 2,50 USD pentru intrare, 0,25 USD pentru intrarea din cache și 15 USD pentru ieșire. La peste 272.000 de tokeni de intrare într-o cerere, tariful de intrare se dublează, iar cel de ieșire crește de 1,5 ori pentru întreaga cerere. Endpointurile eligibile pentru procesare regională au un adaos de 10%.
În grila Gemini 2.5 Pro, intrarea costă 1,25 USD și ieșirea 10 USD până la 200.000 de tokeni în cerere; peste prag, costă 2,50 și 15 USD. Citirea din cache costă 0,125 sau 0,25 USD, în funcție de mărimea cererii, iar stocarea explicită adaugă 4,50 USD per milion de tokeni pe oră. Ieșirea facturată include și tokenii de raționament; nivelul gratuit al modelului nu intră în calculele pentru utilizare plătită.
Grila Claude Sonnet 5.5 indică 2 USD pentru intrare și 10 USD pentru ieșire, cu 4 USD pentru scrierea în cache valabilă o oră și 0,20 USD pentru citire. Tariful standard se aplică pe întregul context acceptat de model. Tokenizatorul generațiilor Claude mai noi produce, în medie aproximativă, cu 30% mai mulți tokeni pentru același text decât tokenizatorul Claude precedent; cifra nu descrie o diferență măsurată față de GPT sau Gemini.
Trei sarcini, aceleași volume presupuse
Scenariile sunt exemple condiționale de cost, nu teste de calitate sau facturi observate. Pentru a izola efectul tarifelor, fiecare pornește de la același număr presupus de tokeni facturați la toate cele trei modele. Într-o aplicație reală, textul poate fi împărțit diferit în tokeni, iar un model poate genera mai multă ieșire decât altul; acestea schimbă atât factura, cât și comparația.
Suport scurt
Presupune o solicitare cu 1.000 de tokeni de intrare și 200 de ieșire, fără cache. Formula este intrare × tarif de intrare / 1.000.000 + ieșire × tarif de ieșire / 1.000.000. Costul rezultat per solicitare este 0,0055 USD la GPT-5.4, 0,004 USD la Claude Sonnet 5.5 și 0,00325 USD la Gemini 2.5 Pro.
La 10.000 de solicitări lunare identice, estimarea devine 55 USD, 40 USD și, respectiv, 32,50 USD. În acest exemplu, Gemini are atât intrarea mai ieftină decât Claude, cât și același tarif de ieșire, astfel că răspunsul scurt nu inversează avantajul. Dacă suportul produce răspunsuri mai lungi sau tokeni de raționament suplimentari, în formulă intră volumul de ieșire facturat efectiv, nu doar textul afișat utilizatorului.
Analiza unui document lung
Presupune 250.000 de tokeni de intrare și 2.000 de ieșire per document, fără cache. GPT-5.4 rămâne sub pragul său de context lung și costă 0,625 USD pentru intrare plus 0,030 USD pentru ieșire, adică 0,655 USD. Claude Sonnet 5.5 costă 0,500 + 0,020 = 0,520 USD. Cererea Gemini 2.5 Pro depășește pragul său, așa că totalul este tot 0,625 + 0,030 = 0,655 USD.
Pentru 100 de documente pe lună, aceleași ipoteze dau 65,50 USD la OpenAI, 52 USD la Claude și 65,50 USD la Gemini. Pragurile se aplică fiecărei cereri, nu totalului lunar: împărțirea unui document în cereri mai mici ar modifica structura costului, dar ar modifica și contextul disponibil modelului. Alegerea trebuie judecată împreună cu cerința de a analiza documentul ca întreg.
Tokenizarea poate răsturna chiar și acest rezultat. Dacă, strict ipotetic, Claude ar factura cu 30% mai mulți tokeni de intrare și ieșire decât volumele presupuse aici, costul său ar deveni 0,676 USD per document, peste 0,655 USD. Acesta este un calcul de sensibilitate, nu o afirmație că diferența dintre furnizori este de 30%.
Agent cu istoric reutilizat
Presupune zece cereri într-o conversație: fiecare conține același prefix de 100.000 de tokeni, încă 1.000 de tokeni noi și 200 de tokeni de ieșire. Prefixul este plătit la prima cerere și citit din cache la următoarele nouă. Pentru Claude presupunem o scriere în cache valabilă o oră; calculul cere ca toate citirile ulterioare să atingă cache-ul.
La GPT-5.4, componentele sunt 0,250 USD pentru prefixul inițial, 0,225 USD pentru cele nouă citiri, 0,025 USD pentru intrarea nouă și 0,030 USD pentru ieșire: 0,530 USD pe conversație. La Claude Sonnet 5.5, scrierea de o oră costă 0,400 USD, citirile 0,180 USD, intrarea nouă 0,020 USD și ieșirea 0,020 USD, pentru un total de 0,620 USD.
La Gemini 2.5 Pro, intrarea inițială, citirile, intrarea nouă și ieșirea însumează 0,270 USD înainte de stocare. Pentru prefixul de 100.000 de tokeni, stocarea explicită adaugă 0,45 USD pe oră: totalul este 0,345 USD dacă durata facturată este de zece minute și 0,720 USD dacă este de o oră. Astfel, Gemini este cel mai ieftin în prima variantă, iar GPT-5.4 în a doua. Durata necesară reutilizării și rata reală de reușită a cache-ului contează mai mult aici decât prețul intrării noi.
Când ajută procesarea batch
Dacă analiza documentelor poate rula asincron, tarifele batch pentru intrare și ieșire înjumătățesc costurile acelui scenariu: 0,3275 USD per document la GPT-5.4, 0,260 USD la Claude Sonnet 5.5 și 0,3275 USD la Gemini 2.5 Pro, fără cache. Documentația Batch API de la OpenAI precizează reducerea de 50% și o fereastră de procesare de până la 24 de ore; grilele Claude și Gemini afișează și ele tarife batch înjumătățite pentru aceste modele.
La 100 de documente, costurile batch calculate sunt 32,75 USD, 26 USD și 32,75 USD. Procesarea în fundal se potrivește unui lot de documente pentru care răspunsul imediat nu este necesar. Pentru suportul interactiv sau un agent care continuă conversația după fiecare răspuns, timpul de așteptare poate exclude această opțiune chiar dacă tariful este mai mic.
Factura lunară exprimată în lei
Tarifele API sunt în USD. Pentru o conversie reproductibilă, ratele Băncii Naționale a Moldovei din 6 octombrie 2026 indică 17,9297 MDL pentru un USD și 3,7654 MDL pentru un RON; raportul lor dă aproximativ 4,7617 RON pentru un USD. Solicitarea scurtă de 0,00325 USD la Gemini reprezintă astfel circa 0,0155 RON sau 0,0583 MDL, iar documentul de 0,520 USD la Claude circa 2,48 RON sau 9,32 MDL.
La volumul lunar din primul scenariu, cei 32,50 USD estimați pentru Gemini înseamnă aproximativ 154,76 RON sau 582,72 MDL la aceleași rate. Conversia este un reper de buget: cursul folosit la plata facturii poate fi diferit. Pentru orice volum lunar, păstrează separat intrarea nouă, citirile și scrierile în cache, ieșirea și stocarea, apoi aplică tariful corespunzător fiecărei cereri și adună costurile; apelurile către instrumente și alte servicii folosite de aplicație se adaugă separat.
Citește și:
Articole similare


Cloudflare R2 sau Backblaze B2: egressul gratuit nu decide singur

Claude Sonnet 5.5 păstrează tariful, dar schimbă cinci reguli API

GPT-6.1 Sol se apropie de Astra, dar efortul maxim nu câștigă mereu

LangGraph sau CrewAI: 107 sarcini arată prețul controlului

Google Workspace sau Microsoft 365: desktopul și AI-ul schimbă alegerea
Abonează-te la newsletter
Primește cele mai noi știri despre Web3, IA și cripto direct în inbox.