
Prompt caching во OpenAI или Claude: динамичната содржина ја јаде заштедата

За долг агентски разговор, изберете граница на кешот според делот од барањето што навистина се повторува, а не според вкупната должина на контекстот. Кај GPT-5.6 и поновите модели, водичот на OpenAI за кеширање промпт опишува експлицитен режим: стабилниот почеток се кешира, а променливата содржина по последната граница се обработува без нов запис во кешот.
Claude дозволува рачно да се означи стабилен блок или автоматски да се поместува границата низ растечки разговор, според правилата за кеширање на Claude. Автоматската поставка е корисна кога претходните пораки повторно влегуваат во следните барања. Ако секој нов резултат од алатка создава запис што никогаш нема да се прочита, експлицитна граница пред него дава попредвидлив трошок.
Како се активира кешот кај двата API-ја
И двата API-ја повторно користат идентичен почетен дел од барањето, односно префикс. Измена пред границата го менува префиксот и може да го спречи читањето на претходниот запис. Поставките се разликуваат по начинот на кој ја избираат границата, рокот на чување и цената на нов запис.
- Активирање: кај GPT-5.6 и поновите модели OpenAI стандардно поставува имплицитна граница на крајот од последната соодветна порака. Со prompt_cache_options.mode: explicit се користат само границите означени со prompt_cache_breakpoint. Кај Claude, cache_control на ниво на барање ја поставува границата автоматски, а истото поле на блок означува експлицитна граница.
- Точки на прекин: OpenAI може да создаде најмногу четири записи во едно барање; имплицитната граница зазема едно од тие места. Claude дозволува најмногу четири граници, а при барање претходен запис проверува ограничен прозорец од дваесет блокови зад секоја граница.
- Рок на чување: за GPT-5.6 и поновите модели, prompt_cache_options.ttl има само вредност 30m, која е и стандардна. Кај Claude стандардниот рок е пет минути, со опција за еден час. Повторното читање го освежува рокот; постарите модели на OpenAI имаат поинакви поставки за чување.
- Праг и наплата: кај GPT-5.6 и поновите модели на OpenAI префиксот мора да има најмалку 1.024 видливи влезни токени. Записот се наплаќа 1,25 пати, а читањето 0,1 пати од редовната цена на влез. Кај Claude минималната должина зависи од моделот; петминутен запис чини 1,25 пати, а едночасовен запис двапати од основната цена.
Множителите не ја покажуваат конечната цена на еден API во однос на другиот: моделите имаат различни основни цени, а важно е и колку од префиксот навистина ќе се прочита повторно. Краток стабилен дел под прагот на избраниот модел нема да донесе читање од кешот, дури и кога границата е правилно означена.
Статичен системски промпт
За агент со долги, непроменливи инструкции, условната шема е стабилни дефиниции на алатки → стабилни инструкции → граница на кешот → податоци за тековната задача. Дефинициите на алатките се пред инструкциите во префиксот кај двата API-ја. Истите дефиниции, шеми и редослед мора да се задржат меѓу барањата што треба да делат кеш.
Во OpenAI, експлицитната граница може да стои на крајот од блок со стабилни инструкции во developer-порака; полето instructions на највисоко ниво не прима таква ознака. Кај Claude, границата може да се стави на последниот стабилен блок од system. Потоа новото корисничко барање останува надвор од тој запис, додека истиот почеток може да се чита повторно.
Ако разговорот редовно ги повторува и старите пораки, границата може да се поместува подалеку од системските инструкции. Тоа носи корист само додека претходниот разговор останува ист и новозапишаниот дел добива следни читања. Затоа статичен системски промпт е сигурна почетна граница, а кеширањето на историјата е одделна одлука.
Кога се менуваат алатките
Промената на име, опис, параметри или редослед на алатка може да го прекине совпаѓањето пред системските инструкции. Условната шема е постојан сет алатки → стабилни инструкции → граница → избор на задача во подоцнежна порака. Поместувањето на корисничкото прашање по границата не помага ако самите дефиниции на алатките се менуваат на почетокот од секое барање.
Кај OpenAI, изборот на повикливи алатки може да се ограничи со allowed_tools, а притоа испратениот список tools да остане стабилен. Ако задачата бара сосема други дефиниции, тие создаваат нов префикс; истото важи и кај Claude. Ова е архитектурен компромис: голем непроменлив сет троши повеќе контекст, па нема смисла да се додаваат алатки што агентот ретко ги користи само заради кешот.
Кај Claude, промената на дефинициите на алатките го поништува и кешот за системските инструкции и пораките што следуваат по нив. Кај OpenAI, совпаѓањето исто така зависи од целиот претходен прикажан префикс. Затоа верзионирањето на сетовите алатки по тип задача е поразумно од градење нов список за секој чекор во иста сесија.
Кога се менуваат резултатите од алатките
Резултат од пребарување или повик до база обично се однесува на конкретен чекор. Условната шема е стабилни алатки и инструкции → граница → историја на разговорот → нов резултат. Експлицитниот режим на поновите модели на OpenAI не наплаќа нов запис за делот по последната означена граница; кај Claude, експлицитната граница пред променливите пораки го задржува истиот стабилен префикс.
Постои и причина да се кешира дел од историјата: агентот често го испраќа претходниот резултат повторно во следниот повик. Тогаш нов запис може да добие читање. Но ако резултатот се заменува брзо, се појавува при крајот на сесијата или следниот повик го менува претходниот контекст, записот може да се плати без таква корист. Кај Claude автоматската граница се поместува до последниот соодветен блок, па таа разлика меѓу повторно користен и еднократен резултат е особено важна.
Рокот на чување влијае врз истата одлука. Петминутен кеш на Claude се освежува кога ќе се прочита; поскапиот едночасовен запис има повеќе смисла ако паузите меѓу повиците се подолги. Кај поновите модели на OpenAI, стандардниот рок е подолг, но ни тој не создава заштеда ако следното барање нема идентичен префикс.
Што покажуваат независните мерења
Во студијата за долги агентски задачи биле опфатени над 500 сесии со веб-пребарување и системски промптови од 10.000 токени. Кај тестираниот GPT-4o, кеширањето на целиот контекст го зголемило времето до првиот токен за 8,8% во однос на поставката без кеш, додека кеширањето само на системскиот промпт го намалило за 30,9%. Двете стратегии сепак го намалиле API-трошокот, за 47,8% и 45,9% соодветно.
Кај Claude Sonnet 4.5 во истата студија, кеширањето само на системскиот промпт донело заштеда од 78,5%, а кеширањето на целиот контекст 77,8%; времето до првиот токен се подобрило и со двете поставки. Тоа покажува дека дополнителните записи може да изедат дел од паричната заштеда, но влијанието врз латентноста зависи од моделот и стратегијата. Мерењето ги опфатило и GPT-5.2 и Gemini 2.5 Pro, а не експлицитниот режим на GPT-5.6 и поновите модели.
Која поставка одговара на разговорот
Ако стабилниот почеток е долг, а остатокот често се менува, експлицитна граница пред променливиот дел е најјасната поставка кај двата API-ја. Поновите модели на OpenAI дополнително дозволуваат со експлицитниот режим да се запре запишувањето на променливиот крај. Кај Claude, автоматската поставка е погодна кога историјата постепено расте и претходните блокови навистина ќе се користат повторно.
За избор меѓу конкретни модели, споредете ги токените прочитани од кеш, токените запишани во него, вкупниот трошок и времето до првиот токен за истиот тип задача. OpenAI ги прикажува cached_tokens и cache_write_tokens, а Claude ги раздвојува cache_read_input_tokens, cache_creation_input_tokens и обичните влезни токени. Таквата споредба ќе покаже дали подолгиот кеширан разговор се исплаќа или стабилниот почеток носи поголем дел од користа.
Поврзани статии


Leonardo AI или Midjourney: бесплатниот план менува повеќе од цената

OpenAI запре моќни агенти: DNS-пропуст ја проби изолацијата

AI-агент пред испраќање е-пошта: паузата мора да ја зачува состојбата

AI-агент со root API-клуч: една погодена инструкција станува целосен пристап
Претплатете се на нашиот билтен
Добивајте ги најновите вести за Web3, AI и крипто директно во вашето сандаче.