
Claude Sonnet 5.5 ul koston për detyrë, por jo çdo matje e favorizon

Në njoftimin e 28 shtatorit 2026, Anthropic lançoi Claude Sonnet 5.5 me të njëjtin çmim si Sonnet 5: 2 dollarë për një milion tokenë hyrës dhe 10 dollarë për një milion tokenë dalës; kompania thotë se gjenerimi është mbi 30% më i shpejtë dhe se në testet e saj disa detyra kushtojnë deri në 30% më pak. Për blerësit e API-së, kursimi i pretenduar vjen nga tokenët që konsumon një detyrë, jo nga ulja e tarifës për token.
Në analizën e BitsMinds të 29 shtatorit për Indeksin e Inteligjencës të Artificial Analysis, Sonnet 5.5 në Medium merr 41 pikë me 0,59 dollarë për detyrë, kundrejt 38 pikëve dhe 5,09 dollarëve të Sonnet 5 në Max; Sonnet 5.5 në Max dhe Opus 5.5 në Xhigh marrin nga 56 pikë, por kushtojnë përkatësisht 7,60 dhe 3,46 dollarë për detyrë. Pra, konfigurimi më ekonomik i modelit të ri e kalon rezultatin më të mirë të paraardhësit me një pjesë të vogël të kostos, ndërsa në skajin tjetër të matjes një model tjetër arrin të njëjtin rezultat me faturë më të ulët.
Çmimi për token dhe kufijtë e kontekstit
Karta e modelit në Amazon Bedrock shënon statusin aktiv, dritaren e kontekstit prej një milion tokenësh, kufirin prej 128 mijë tokenësh në dalje dhe nivelin High si zgjedhje të paracaktuar të effort-it; ajo sqaron gjithashtu se përdorimi përmes Bedrock faturohet në AWS Marketplace. Dritarja e kontekstit tregon sa material mund të hyjë në një kërkesë, jo sa material përpunohet pa pagesë. Edhe kur një detyrë përdor vetëm një pjesë të saj, hyrja dhe dalja vazhdojnë të faturohen sipas tokenëve të konsumuar.
Tarifa e pandryshuar mund të sjellë faturë më të ulët nëse modeli mbyll të njëjtën punë me më pak dalje, thirrje mjetesh ose përsëritje. Kjo lidhje varet nga detyra: një kërkesë e shkurtër për kod mund të përfitojë nga më pak hapa, kurse një kërkesë që ridërgon shumë dokumente vazhdon të paguajë për hyrjen e gjatë. Shpejtësia e gjenerimit është një matje tjetër nga koha e plotë e përfundimit, e cila përfshin edhe arsyetimin dhe punën me mjete.
Pse niveli i effort-it ndryshon krahasimin
Medium dhe Max nuk janë dy çmime të ndryshme për të njëjtën sasi tokenësh. Në një nivel më të lartë effort-i, modeli mund të arsyetojë më gjatë, të prodhojë më shumë tokenë dhe të kryejë hapa shtesë. Rezultati mund të përmirësohet, por kostoja për të arritur atë rezultat mund të rritet më shpejt. Prandaj epërsia e Medium ndaj Sonnet 5 dhe humbja e Max ndaj Opus në matjen e mësipërme mund të jenë të dyja të vërteta.
Indeksi bashkon detyra të ndryshme dhe llogarit koston mesatare për detyrat e tij. Ai mat sjelljen e konfigurimeve të testuara, përfshirë nivelin e effort-it, dhe nuk është tarifë fikse për çdo kërkesë API. Edhe pretendimi i Anthropic për uljen e kostos në testet e veta dhe diferenca shumë më e madhe në krahasimin e indeksit përdorin grupe detyrash e pika krahasimi të ndryshme. Një ekip që kalon nga High në Medium mund të ndryshojë faturën dhe cilësinë njëkohësisht; kursimi ka kuptim vetëm për detyrën që përfundon me cilësi të pranueshme.
Tre profile pune, tri fatura të mundshme
Kod rutinë. Në një shembull hipotetik, një kërkesë përdor 20 mijë tokenë hyrës dhe prodhon 4 mijë tokenë dalës, pa cache, mjete ose riprovim. Me tarifat bazë të shpallura, hyrja kushton 0,04 dollarë dhe dalja po 0,04 dollarë: gjithsej 0,08 dollarë. Nëse arsyetimi më i gjatë dyfishon tokenët dalës, totali bëhet 0,12 dollarë. Nëse ai arsyetim shmang një kërkesë të dytë për korrigjim, megjithatë, krahasimi mes faturave të kërkesave të veçanta nuk tregon më koston e plotë të punës.
Analizë dokumentesh. Një shembull tjetër hipotetik me 200 mijë tokenë hyrës dhe 8 mijë dalës kushton 0,40 dollarë për hyrjen dhe 0,08 dollarë për daljen, ose 0,48 dollarë gjithsej me tarifat bazë. Këtu pesha kryesore e faturës është materiali i dërguar, ndaj kursimi nga një përgjigje më e shkurtër ka kufi. Nëse i njëjti material dërgohet sërish për një pyetje pasuese, tokenët e hyrjes faturohen sërish sipas mënyrës së përdorimit; cache-i, kur zbatohet, ndryshon llogarinë.
Agjent afatgjatë. Supozojmë se disa thirrje grumbullojnë gjithsej një milion tokenë hyrës dhe 100 mijë dalës. Llogaria teorike me tarifat bazë është 2 dollarë për hyrjen dhe 1 dollar për daljen, pra 3 dollarë, pa përfshirë zëra të tjerë të rrjedhës së punës. Ky është konsum i mbledhur gjatë disa thirrjeve, jo një kërkesë e vetme në kufirin e kontekstit. Kur agjenti rikthen historinë, thërret mjete ose përsërit hapa, sasia e tokenëve rritet; një model që kryen më pak hapa mund të ulë koston për detyrë edhe pa ndryshuar çmimin në listë.
Çfarë ndryshon për blerësit e API-së
Modeli është i lançuar dhe i disponueshëm për përdorim përmes rrugëve të përshkruara më sipër. Për ekipet në Shqipëri dhe Kosovë, kushtet e faturimit varen nga platforma ku e thërrasin modelin: çmimi bazë i publikuar nga Anthropic dhe fatura e një shërbimi cloud duhen lexuar në kontekstin e tyre. Kufiri i kontekstit përcakton madhësinë e kërkesës; niveli i effort-it ndikon te puna që modeli kryen brenda saj.
Pasojë e drejtpërdrejtë për një buxhet API është se çmimi për token nuk mjafton për të parashikuar çmimin e një rezultati. Te kodi peshojnë hapat dhe ripunimi; te dokumentet, hyrja që dërgohet; te agjentët, historia dhe veprimet e përsëritura. I njëjti model mund të jetë zgjedhja më e lirë në një konfigurim dhe të humbasë atë përparësi në një tjetër.
Lexoni gjithashtu:
Artikuj të ngjashëm


GPT-6 Sol dhe Luna përgjysmojnë koston, por rezidenca në BE ka kufi

ChatGPT apo Claude: shtatë prova nuk japin fitues për çdo punë

Codex apo Claude Code: 108 prova nxjerrin fitues, jo përgjigje universale

Leonardo AI apo Midjourney: plani falas përballet me cilësinë vizuale

n8n apo Make për agjentë AI: vetëhostimi ndryshon faturën
Abonohuni në buletinin tonë
Merrni lajmet më të fundit për Web3, AI dhe kripto direkt në kutinë tuaj postare.