OpenAI API или Claude API: токенот не ја кажува целата цена

|Автор: Уредувачки тим на QUASA|6 мин. читање| 1
OpenAI API или Claude API: токенот не ја кажува целата цена

За продукциска задача, изборот меѓу OpenAI API и Claude API зависи од целиот обем на наплатени токени, начинот на обработка и потребното време до одговор. Ценовникот на OpenAI наведува 2 долари за милион влезни и 10 долари за милион излезни токени за GPT-6.1 Sol при стандардна обработка; ценовникот на Claude ги наведува истите тарифи за Claude Sonnet 5.5. Двата ценовника наведуваат и преполовени тарифи за batch-обработка, но различни цени за повторно читање од кеш: 0,10 долари кај GPT-6.1 Sol и 0,20 долари кај Claude Sonnet 5.5 за милион токени.

Тоа значи дека еднаква основна тарифа може да даде еднаква сметка за обичен разговор, а различна сметка за документ што се испраќа повеќепати. Кај интерактивна задача, цената е само еден дел од изборот: модел што почнува побрзо да одговара може да постигне различен резултат на сложена задача. Затоа брзината и успешноста треба да се разгледуваат заедно со наплатениот излез, вклучително и токените потрошени за расудување.

Иста должина на барањето во три сценарија

Следните пресметки се условни примери, а не резултати од испратени API-барања. Во секое сценарио има по 100 барања со 10.000 влезни и вкупно 1.000 наплатени излезни токени по барање. Тоа дава еден милион влезни и 100.000 излезни токени по сценарио; се менува само начинот на обработка на истиот обем.

За двата модели се претпоставува краток контекст, без дополнителни алатки, регионални доплати, даноци и договорни попусти. Еднаквиот број токени служи за споредба на тарифите и не значи дека идентичен текст нужно ќе се претвори во ист број токени кај двата провајдера. Не значи ни дека моделите ќе дадат одговор со ист квалитет или ќе потрошат исто време за него.

Интерактивен разговор: колку тежи излезот

Ако нема читање од кеш, секој модел во условниот разговор чини 3 долари: 2 долари за влезот и 1 долар за излезот. Излезните токени се само една десеттина од бројот влезни токени, но носат една третина од сметката. Ако разговорот бара пократок влез и подолг одговор, нивниот удел во трошокот расте и без промена на тарифата.

Примерот подразбира дека сите 1.000 излезни токени по барање веќе се вклучени во наплатениот обем. Тоа е важно кај задачи што бараат расудување: должината на видливиот одговор не е сигурна замена за бројот наплатени излезни токени. Поради тоа, споредбата направена само од текстот што го гледа корисникот може да ја потцени сметката, дури и кога влезната должина е добро позната.

Batch-обработка: пониска тарифа со поинаков рок

Ако истите барања може да се обработат асинхроно, условната сметка паѓа на 1,50 долари кај секој модел: 1 долар за влез и 0,50 долари за излез. Документите, нивниот број и претпоставениот наплатен излез остануваат исти. Попустот произлегува од batch-тарифата, а не од претпоставка дека моделот ќе употреби помалку токени.

Овој начин на обработка има смисла за збир документи чии резултати може да пристигнат подоцна. За разговор во кој корисникот чека непосреден одговор, асинхрониот рок е суштинско ограничување. Ако само дел од работата може да се стави во batch, пресметката мора да ги задржи стандардната и batch-потрошувачката како одделни ставки; попустот не се пренесува автоматски на преостанатите интерактивни барања.

Повторлив документ: каде се раздвојуваат сметките

Во третото сценарио, првите 8.000 од 10.000 влезни токени се непроменет документ или стабилни инструкции, а последните 2.000 се менуваат. Првото барање го запишува заедничкиот префикс во кеш, а преостанатите 99 го читаат од него. Со целосно успешни читања, условната сметка е 1,4992 долари за GPT-6.1 Sol и 1,5784 долари за Claude Sonnet 5.5.

Пресметката вклучува 0,02 долари за првото запишување, 0,40 долари за променливиот влез и 1 долар за излезот кај секој модел. Повторните читања додаваат 0,0792 долари кај GPT-6.1 Sol, односно 0,1584 долари кај Claude Sonnet 5.5. Разликата во овој конкретен пример доаѓа од цената на читањето; таа не е општа прогноза за сите задачи со документи.

Условот е префиксот навистина да се совпадне и записот да остане достапен кога ќе пристигнат следните барања. Правилата за кеширање на OpenAI објаснуваат дека повторната употреба бара совпаѓање на целиот зачуван префикс и дека границата за кеширање може експлицитно да се постави кај поновите модели. Ако променливата содржина дојде пред таа граница, очекуваното читање може да изостане; редоследот на динамичната содржина затоа е директно поврзан со сметката.

За Claude примерот претпоставува краткотрајно запишување, со повторувања додека кешот важи. Ако документот се менува често или повиците се оддалечени еден од друг, ќе има повеќе запишувања и помалку евтини читања. Затоа реалната потрошувачка треба да ги разликува обичниот влез, запишаните токени и прочитаните токени; една збирна бројка за „влез“ го крие механизмот што ја создава разликата.

Расудувањето ги менува цената и чекањето

Кај GPT-6.1 Sol, документацијата за reasoning-моделите наведува дека невидливите токени за расудување се наплатуваат како излезни токени. Така, одговор што изгледа краток може да има поголем наплатен излез од видливиот текст. Условните сметки погоре важат само ако претпоставениот излез го опфаќа целиот наплатен обем.

Повеќе време за расудување може да го продолжи и чекањето до првиот дел од одговорот. Тоа е особено важно за chatbot, каде што корисникот го чувствува застојот пред да почне испишувањето. Кај долга асинхрона задача, вкупното време до завршување и успешноста на резултатот може да имаат поголема тежина од првото појавување на текст.

Независните мерења не даваат еден победник

Споредбата на Artificial Analysis за GPT-6.1 Sol со средно ниво на расудување и Claude Sonnet 5.5 со адаптивно расудување и средно ниво на напор наведува 5,50 наспроти 1,34 секунди до првиот токен, во корист на Claude. За брзината на испишување табелата дава приближно 61 наспроти 91 токен во секунда. Во истата конфигурациска споредба, индексот на способности е 48 за GPT-6.1 Sol и 41 за Claude Sonnet 5.5.

Бројките опишуваат конкретни конфигурации и методика на мерење. Побрзото започнување на одговорот во оваа табела не значи повисока оценка на сложените задачи опфатени со индексот. За продукциски избор, тоа ја раздвојува одлуката: разговор со кратки прашања може да даде предност на ниското доцнење, додека задача што бара точен сложен одговор може да вреднува поинаков однос меѓу време, потрошени токени и успешност.

Оперативните правила ја дополнуваат пресметката

Регионалната обработка и алатките може да додадат трошоци над основната токенска пресметка. Начинот на наплата зависи и од платформата преку која се користи Claude: кај Claude Platform on AWS и Claude во Microsoft Foundry, стандардно пресметаната потрошувачка се претвора во Claude Consumption Units за сметката преку соодветниот marketplace. Таа единица го менува приказот на сметката, а не бројот токени што моделот ги обработил.

За тим во Северна Македонија, местото на регистрација на компанијата само по себе не ја одредува географијата на обработката. Изборот на регион или платформа е посебен дел од продукциската одлука, заедно со рокот за одговор и можноста за повторно користење на кешот. Трите условни сметки ја покажуваат цената при зададен обем; конечниот избор зависи од тоа кој од тие облици на работа навистина преовладува.

Прочитајте и:

Сподели:

Претплатете се на нашиот билтен

Добивајте ги најновите вести за Web3, AI и крипто директно во вашето сандаче.

0