
OpenAI ar Claude talpykla: mažesnė kaina ne visada reiškia greitį

OpenAI ir Claude API talpyklos gali sumažinti pakartotinai siunčiamos užklausos pradžios kainą, tačiau pigesnė įvestis negarantuoja greitesnio atsakymo. Jei agentas kaupia ir nuolat kintančius įrankių rezultatus, jis gali mokėti už naujus įrašus, o pirmojo žetono laukti ilgiau. Abiem atvejais naudingiausia pradėti nuo ilgos, tikrai stabilios instrukcijų dalies ir kainą vertinti atskirai nuo delsos.
Pasirinkimą lemia srauto sandara. Vienoda sistemos instrukcija tinka abiem paslaugoms; nauji paieškos rezultatai turėtų eiti po stabilios talpyklos ribos; nuosekliai augančią pokalbio istoriją verta kaupti tada, kai vėlesnės užklausos ją pakartoja nepakeistą. OpenAI naujesniuose modeliuose leidžia nurodyti ribą arba palikti ją automatiniam režimui, o Claude API talpyklą įjungia per cache_control ir taip pat leidžia pasirinkti ribos vietą.
Kur baigiasi kaupiama užklausos dalis
OpenAI API dokumentacijoje nurodyta, kad palaikomiems modeliams talpykla veikia automatiškai, o GPT-5.6 ir naujesniuose modeliuose galima rinktis automatinį arba tik aiškiai pažymėtų ribų režimą; pastarųjų modelių kaupiamas matomas prefiksas turi siekti bent 1 024 žetonus, įrašymas kainuoja 1,25 įprastos įvesties kainos, o skaitymas daugumoje jų – 0,1 tos kainos. Tik aiškių ribų režimu turinys po paskutinės pažymėtos ribos apdorojamas įprastu tarifu ir nėra papildomai įrašomas į talpyklą. Ankstesni OpenAI modeliai palaiko tik automatinį režimą, o jų kainodara skiriasi.
Claude API dokumentacijoje aprašyti du cache_control naudojimo būdai: užklausos lygmens žyma perkelia ribą augant pokalbiui, o konkretaus turinio bloko žyma ją palieka pasirinktoje vietoje; įprastas įrašo galiojimas yra penkios minutės, valandos įrašymas kainuoja daugiau, penkių minučių įrašymo daugiklis yra 1,25, o skaitymo – 0,1 daugumai modelių. Talpykla atnaujinama ją perskaičius. Mažiausias tinkamas prefiksas priklauso nuo Claude modelio, todėl trumpai, nors ir identiškai, instrukcijai lengvata gali būti netaikoma.
Abiejose API svarbus visas prefiksas iki ribos, įskaitant ankstesnius įrankių aprašus ir instrukcijas. Pakeitus ankstyvą jo dalį, vėliau einantis toks pat tekstas ankstesnio įrašo neatkuria. Claude atveju vien žymos ant kintančio paskutinio bloko nepakanka: jei anksčiau nebuvo įrašyta stabili riba, kiekvienas kvietimas gali sukurti naują įrašą be naudingo perskaitymo.
Ta pati užklausos apimtis, trys kainos scenarijai
Toliau pateikiamas sąlyginis įvesties kainos perskaičiavimas, o ne atliktas API bandymas. Tarkime, kad sesijoje yra dešimt kvietimų, bendra instrukcijų pradžia sudaro 10 000 žetonų, o kiekvienas žingsnis prideda 1 000 žetonų. Įprastą įvesties žetoną laikykime vienu kainos vienetu, talpyklos įrašymą – 1,25, skaitymą – 0,1 vieneto. Tai parodo daugelio Claude modelių penkių minučių talpyklos ir daugumos naujesnių OpenAI modelių tarifų logiką, bet nelygina jų tikrųjų kainų eurais. Daroma prielaida, kad kiekvienas numatytas įrašas randamas ir galioja; išvesties kaina neįskaičiuota.
Ilga, nekintanti instrukcija
Jei visi dešimt kvietimų gauna tą pačią 10 000 žetonų pradžią ir po naują 1 000 žetonų užduotį, be talpyklos įvestis kainuotų 110 000 santykinių vienetų. Kartą įrašius bendrą dalį ir devynis kartus ją perskaičius, suma būtų 31 500: 12 500 už pirmą įrašą, 9 000 už skaitymus ir 10 000 už naujas užduotis. Tai vienodos įvesties kainos modelis, o ne teiginys, kad OpenAI ir Claude atsakymą pradės per vienodą laiką.
Kaskart naujas įrankio rezultatas
Jei kiekvieno kvietimo papildomi 1 000 žetonų yra vis kitas paieškos rezultatas, tik stabilios instrukcijos kaupimas duotų tą pačią 31 500 vienetų sumą. Jeigu greta stabilios ribos kiekvienas naujas rezultatas dar būtų įrašomas į talpyklą, bet vėliau nė karto neperskaitomas, suma pakiltų iki 34 000 vienetų. Šis skirtumas atsiranda vien dėl papildomo įrašymo tarifo: naujo rezultato talpykla niekam nepadeda, kol tas pats prefiksas nepasikartoja. Todėl kintamą rezultatą verta palikti po aiškiai pažymėtos stabilios ribos, kai pasirinkta API konfigūracija tai leidžia.
Nuosekliai ilgėjantis pokalbis
Dabar tarkime, kad kiekvienas naujas 1 000 žetonų posūkis prisideda prie ankstesnės, nepakeistos istorijos. Per dešimt žingsnių be talpyklos būtų apdorota 155 000 įvesties žetonų. Kaupiant vien pradinę instrukciją, sąlyginė kaina būtų 76 500 vienetų: ankstesnių posūkių žetonai kiekvieną kartą liktų įprasta įvestimi. Jei kiekvienas naujas istorijos prefiksas sėkmingai įrašomas ir perskaitomas kitame žingsnyje, kaina sumažėtų iki 38 500 vienetų. Šis rezultatas priklauso nuo nenutrūkusios prefiksų sekos ir galiojančių įrašų; perrašius ar sutrumpinus senas žinutes, sąlyga nebeišsipildo.
Pastarasis srautas paaiškina, kodėl judanti riba kartais verta papildomų įrašymų, nors pavieniai įrankio rezultatai jos neverti. Jei agentas vėlesniame žingsnyje iš tiesų siunčia visą ankstesnę istoriją, naujai įrašyta dalis tampa kito kvietimo skaitoma dalimi. Jei rezultatai pakeičiami naujomis versijomis, šis ryšys nutrūksta. Tokios sesijos kainos negalima spręsti vien iš bendro išsiųstų žetonų skaičiaus.
Ką apie greitį rodo agentų sesijos
Daugiau kaip 500 agentų sesijų tyrime su 10 000 žetonų sistemos instrukcijomis ir žiniatinklio paieškos kvietimais GPT-4o viso konteksto kaupimas sumažino API sąnaudas 47,8 %, tačiau pirmojo žetono laukimą pailgino 8,8 %; kaupiant tik sistemos instrukciją laukimas sutrumpėjo 30,9 %, o Claude Sonnet 4.5 viso konteksto kaupimas jį sutrumpino 21,8 %. Taigi to paties tipo riba skirtinguose modeliuose davė skirtingą delsos rezultatą, nors kainos mažėjo. Tyrimo GPT-4o matavimų nereikia perkelti į naujesnių OpenAI modelių kainos pavyzdį: skiriasi ir modelis, ir taikyti tarifai.
Šiame bandyme matuotas laikas iki pirmojo atsakymo žetono, o ne visos užduoties pabaiga. Kintančio konteksto įrašymas gali pridėti darbo prieš pradedant atsakymą, tačiau vien iš mažesnės žetonų sąskaitos šio laiko apskaičiuoti neįmanoma. Tyrimo skirtumai apibūdina konkrečias agentų sesijas ir jų talpyklos strategijas, o ne universalų vienos paslaugos greičio pranašumą.
Ankstesniame Claude talpyklos pristatyme Anthropic nurodė iki 90 % mažesnę kainą ir iki 85 % mažesnę ilgų užklausų delsą. Tai viršutinės naudos ribos, taikomos palankioms sąlygoms, o ne pažadas kiekvienam agento žingsniui. Jos taip pat nėra tiesiogiai palyginamos su tyrimo pirmojo žetono matavimu, todėl vien pagal tokius procentus negalima pasirinkti ribos konkrečiam srautui.
Kaip pasirinkti ribą savo srautui
Jei vyrauja ilga bendra instrukcija, laikykite jos pradžią ir įrankių aprašus vienodus, o naują užduotį dėkite po stabilios ribos. Nuolat besikeičiančių paieškos radinių atveju tinka aiški riba prieš juos: Claude ją galima pažymėti turinio bloke, o OpenAI GPT-5.6 ir naujesniuose modeliuose – naudoti tik aiškių ribų režimą. Kai pokalbis auga nepakeičiamas, judanti riba gali perskaityti daugiau ankstesnės istorijos ir papildomai sumažinti įvesties kainą.
Kainai įvertinti atskirkite įprastus, įrašytus ir perskaitytus įvesties žetonus. Delsai atskirai matuokite pirmojo žetono laukimą tai pačiai užduočiai, nes talpyklos skaitymų gausa pati savaime greičio neparodo. Dažni nauji įrašai be vėlesnių skaitymų rodo per plačią arba kintamoje vietoje esančią ribą; ilgoje nuoseklioje sesijoje tie patys įrašai gali būti pagrįsti, jei kitas žingsnis juos perskaito.
Taip pat skaitykite:
Susiję straipsniai


RPA ar DI agentas: greitesnis sukūrimas dar nereiškia patikimesnio proceso

Make ar Zapier: pigi automatizacija priklauso nuo skaičiuojamo veiksmo

OpenAI ar Claude Structured Outputs: tinkamas JSON dar negarantuoja tiesos

„Vercel“ ar „Cloudflare Pages“: panašus greitis slepia skirtingas ribas

„GitHub Actions“ ar „GitLab CI“: pigesnę minutę nustelbia komandos planas
Prenumeruokite mūsų naujienlaiškį
Gaukite naujausias Web3, DI ir kriptovaliutų naujienas tiesiai į savo el. pašto dėžutę.