
AI-агентите трошат петпати повеќе токени, но тоа не значи петпати повеќе работа

На 3 октомври 2026 Tom’s Hardware објави анализа на податоците од OpenRouter: во август седумдневниот подвижен просек достигнал околу 7,3 билиони токени во агентската категорија, наспроти околу 1,4 билиони во категоријата директна човечка употреба — приближно петпати повеќе. Во написот е пренесена и оценката на Даниел Њуман од Futurum Group: „AI is currently used by AI 5x more than it is used by humans“. Бројките го опишуваат токенскиот сообраќај преку OpenRouter, а не бројот на корисници или завршени задачи на целиот пазар.
Разликата е важна за секој што го пресметува капацитетот или буџетот на AI-агент. Еден човечки налог може да предизвика низа повици до моделот, повторно внесување на ист контекст и нови обиди по неуспешен чекор. Секој од тие повици додава токени во сообраќајот, но графиката не покажува колку чинеле повиците, колку задачи биле започнати и дали конечните резултати биле прифатени.
Седумдневниот просек мери обем, не работа по агент
Прикажаните вредности се подвижен просек на дневниот сообраќај, пресметан врз седум дена. Затоа односот меѓу двете линии не кажува дека поединечен агент троши петпати повеќе токени од поединечен човек за иста задача. Тој споредува две категории барања што минале низ една платформа во ист период. И бројот на барања и нивната должина можат да го сменат вкупниот обем, без да се смени бројот на успешно завршени задачи.
Во објаснувањето на Питер Вокер од OpenRouter стои дека платформата ги класифицира API-клучевите како агентски, човечки или мешани со оценка составена од седум сигнали, меѓу кои повиците кон алатки, времето меѓу одговорите и бројот на чекори. Оттука, „човечки“ и „агентски“ се ознаки за препознаени обрасци на сообраќај, а не попис на луѓето што побарале работа. Мешаната категорија останува посебна; нејзиното произволно додавање кон која било од двете линии би ја сменило споредбата.
OpenRouter ги гледа барањата насочени преку сопствената услуга. Повиците испратени директно до добавувач на модел или извршени во приватна инфраструктура не влегуваат во таа графика. Петкратниот однос затоа е корисен опис на сообраќајот на платформата во прикажаниот период, но не е мерка за вкупната глобална употреба на AI-агенти.
Кешираниот контекст ја менува цената на токенот
Агентските циклуси често го испраќаат претходниот контекст во следниот повик: упатства, опис на достапните алатки, делови од разговорот и резултати од веќе извршени чекори. Тоа му помага на моделот да продолжи од каде што застанал, но ги зголемува изброените влезни токени. Ако повторениот дел е достапен во кеш, неговото читање обично има поинаква цена од обработката на нов влез; излезните токени се наплатуваат одделно.
Во анализата на a16z заснована на OpenRouter се наведува дека повеќе од 85% од вкупниот агентски токенски обем биле кеширани промптови и дека тие го носеле речиси целиот релативен раст на сообраќајот во категоријата. Таа бројка се однесува на збирниот обем. Вокер, пак, опишува близу 70% кеширан промпт во просечно агентско барање. Различните основи на пресметка значат дека двата процента не треба да се претставуваат како исто мерење; од објавените податоци не може да се утврди колкав дел од разликата доаѓа од должината на барањата или од други детали во методиката.
Затоа петпати повеќе токени не даваат основа за процена на петпати поголема фактура. За парична пресметка треба да се знае колку имало нов влез, читање од кеш и генериран излез, како и цената за секоја категорија кај користениот модел. Ист вкупен број токени може да даде различна сметка ако се промени уделот на кешот. А ако агентот го повторува неуспешниот чекор, сметката може да расте и без нов употреблив резултат.
Повеќе кеширани токени сè уште бараат меморија
Пониската цена за читање од кеш не значи дека повторениот контекст исчезнува од инфраструктурната сметка. За следниот повик моделот треба да има пристап до зачуваната состојба, а таа зафаќа меморија. Кога голем број агенти истовремено продолжуваат долги задачи, капацитетот за чување и брзо читање на таа состојба станува посебно прашање од цената што ја гледа корисникот за еден токен.
Тука се гледаат две различни последици од истиот сообраќај. Кешот може да ја намали цената на повторениот влез за корисникот, додека големиот број истовремени циклуси ја зголемува потребата за достапна меморија кај давателот на услугата. Графиката не содржи податоци за зафатена меморија, времетраење на задачите или истовремен број активни агенти. Таа го покажува обемот што ја отвора инфраструктурната тема, но не дозволува од токените да се пресмета потребниот капацитет.
Прифатениот резултат е посебна мерка
За да се поврзе сообраќајот со деловна вредност, задачата мора да има јасен критериум за прифаќање. Цената по прифатен резултат го дели вкупниот трошок на извршувањата со бројот резултати што го исполнуваат тој критериум. Во трошокот припаѓаат повиците до моделот, другите платени алатки и човечкото време потребно за поправка или одобрување. Ознаката „завршено“ во дневникот на агентот сама по себе не кажува дали корисникот добил употреблива работа.
Стапката на човечка интервенција додава уште еден дел од сликата: покажува во колкав дел од задачите некој морал да го насочи, поправи или преземе процесот. Бројот на повторни обиди по задача открива дали дополнителните токени биле потрошени за напредување или за враќање на ист чекор. Уделот на кеширани токени, разгледан покрај тие две мерки, помага да се разликува корисно продолжување на контекстот од циклус што постојано го препрочитува без да стигне до прифатлив исход.
Ограничувањето на повторувањата има смисла кога е врзано за условот за запирање на конкретната задача: дали новиот обид добил нови информации или само ја повторил претходната грешка. Податоци за трошок, интервенции и прифатени исходи по задача би покажале дали растечкиот агентски сообраќај носи поголема корист. Додека тие податоци недостигаат во јавната споредба, за корисникот останува реална можноста да плаќа за дополнителни циклуси што не ја подобруваат испорачаната работа.
Прочитајте и:
Поврзани статии


OpenAI API или Claude API: токенот не ја кажува целата цена

Claude Sonnet 5.5 е побрз, но пет промени можат да го скршат кодот

Claude API враќа 429: retry не помага ако го погодите погрешниот лимит

Restate собра 20 милиони долари: AI-агентите го поскапеа надежното извршување

Beam има 501 милијарда параметри, но само 23 милијарди работат одеднаш
Претплатете се на нашиот билтен
Добивајте ги најновите вести за Web3, AI и крипто директно во вашето сандаче.