Claude API или OpenAI API: кеш и длина ответа меняют итоговый счёт

|Автор: Редакция QUASA|6 мин чтения| 8
Claude API или OpenAI API: кеш и длина ответа меняют итоговый счёт

У Claude API и OpenAI API нельзя определить более дешёвый вариант по одной ставке за входные токены. Для выбранной пары моделей базовые цены совпадают, но длинный документ обходится дешевле у Claude: у GPT-6.1 Sol после порога контекста дорожает весь запрос. В коротком чате счёт сильнее меняет длина ответа, а в серии запросов с общими инструкциями — число успешных чтений кеша.

Скорость тоже зависит от того, что измерять. Время до первого токена определяет ожидание начала ответа, а темп выдачи влияет на завершение длинной генерации. Для заданий без требования немедленного ответа обе платформы предлагают пакетную обработку со скидкой; географию обработки и её надбавку нужно учитывать отдельно.

Ставки для сравниваемых моделей

В расчёте используются Claude Sonnet 5.5 и GPT-6.1 Sol в стандартном режиме, без региональной надбавки. Тарифы Claude Sonnet 5.5 составляют $2 за миллион обычных входных токенов, $10 за миллион выходных, $2,50 за пятиминутную запись в кеш и $0,10 за чтение. Часовая запись стоит $4 за миллион токенов. Для этой модели длинный контекст сохраняет стандартную ставку; пакетная обработка даёт скидку 50% на ввод и вывод, а обработка только в США увеличивает стоимость токенов в 1,1 раза.

Карточка GPT-6.1 Sol указывает те же ставки для короткого контекста: $2 за обычный ввод, $10 за вывод, $2,50 за запись в кеш и $0,10 за чтение на миллион токенов. Если вход превышает 272 тысячи токенов, ввод и операции с кешем стоят вдвое дороже, а вывод — в полтора раза дороже для всего запроса. Пакетный режим снижает стандартную цену наполовину; там, где доступна региональная обработка, к ней добавляется 10%.

Это сопоставление ставок, а не обещание одинакового счёта за один текст. Токенизаторы моделей могут по-разному разбить одинаковые слова, а объём оплачиваемого вывода зависит в том числе от настройки рассуждения. Для прогноза расходов нужны фактические счётчики входа, вывода, записей и чтений из ответов API.

Формула фактической стоимости

Сначала входные токены разделяют на обычный ввод, первую запись повторно используемого префикса и успешные чтения этого префикса. Каждую величину умножают на её ставку, добавляют выходные токены по ставке вывода и делят сумму на миллион. Для длинного запроса сначала выбирают соответствующую тарифную колонку; затем учитывают пакетный режим и надбавку за место обработки.

Для серии запросов расчёт удобнее вести по всей серии, а не умножать стоимость одного запроса на их количество. Общий префикс оплачивается как запись при создании кеша и как чтение лишь при успешном повторном использовании. Если изменились инструкции, определения инструментов или ранняя часть истории, совпадение префикса может прерваться; тогда вместо дешёвого чтения возникнет новая запись либо обычный ввод.

Три условные нагрузки

Короткий чат. Допустим, запрос содержит 800 входных токенов и создаёт ответ в 200 выходных. По базовым ставкам каждой из выбранных моделей стоимость без кеша равна $0,0036. Если тот же вход приводит к ответу в 2000 токенов, счёт вырастает до $0,0216. В этом примере дополнительный вывод стоит больше всего исходного запроса; ограничение длины ответа заметно меняет бюджет.

Длинный документ. Допустим, вход содержит 300 тысяч токенов, а оплачиваемый вывод — 3000. Для Claude Sonnet 5.5 получается $0,63: $0,60 за вход и $0,03 за выход. У GPT-6.1 Sol порог длинного контекста уже превышен, поэтому расчёт даёт $1,245: $1,20 за вход и $0,045 за выход. Это арифметика по тарифам при одинаковом условном числе токенов, а не измерение качества ответов или фактического расхода токенов на одном документе.

Агент с общими инструкциями. Допустим, десять запросов проходят за время действия пятиминутной записи. В каждом есть неизменный префикс в 20 тысяч токенов, 2000 новых входных токенов и 1000 выходных. При одной записи префикса и девяти успешных чтениях обе выбранные модели стоят $0,208 за серию: $0,05 за запись, $0,018 за чтения, $0,04 за новый ввод и $0,10 за вывод. Без кеша счёт составил бы $0,54. Если попаданий не будет, повторные записи способны сделать кеш дороже обычного ввода.

Во всех трёх примерах объём оплачиваемого вывода задан заранее. В реальном приложении ответы моделей могут различаться по длине даже при одинаковом ограничении, поэтому расход следует считать по возвращённым токенам, сохраняя одинаковую цель по качеству для сравнения.

Условия кеша и пакетной обработки

Правила кеширования OpenAI требуют для GPT-5.6 и более новых моделей повторяющегося видимого префикса не короче 1024 токенов; запись остаётся пригодной для повторного использования не менее 30 минут после записи или последнего чтения. Короткий чат из условного примера до этого порога не дотягивает. Для агента важно разместить стабильные инструкции до изменяемых данных и явно ограничить записываемый фрагмент, если меняющуюся часть сохранять не требуется.

У Claude пятиминутная запись стоит меньше часовой, поэтому срок жизни общего контекста влияет на цену первого обращения. Если запросы разнесены во времени, более дорогая часовая запись может избавить от повторного создания префикса. При любом сроке расчёт экономии зависит от фактических попаданий, а не от числа запросов, которые теоретически могли прочитать кеш.

Пакетная скидка меняет абсолютную стоимость, но сохраняет разницу длинного документа из условного расчёта: $0,315 у Claude и $0,6225 у GPT-6.1 Sol. Для серии с общим префиксом нельзя заранее прибавить к этой скидке всю ожидаемую выгоду от кеша. В расчёт должны попасть фактические записи и чтения, поскольку отправка заданий пакетом сама по себе не гарантирует повторного использования одной записи.

Скорость: ожидание и выдача ответа

Замеры Artificial Analysis для GPT-6.1 Sol со средним усилием рассуждения и Claude Sonnet 5.5 со средним усилием и стандартным режимом возврата показывают соответственно 6,43 и 2,05 секунды до первого токена. После начала ответа измеренный темп составляет 49,6 и 101,9 токена в секунду. Эти значения относятся к указанным конфигурациям и могут меняться по мере обновления измерений.

Время до первого токена включает обработку входа и работу модели до начала видимого ответа; его нельзя считать только сетевой задержкой. Для короткой реплики пользователь прежде всего замечает начало ответа. При длинной генерации значение приобретает и темп выдачи: даже одинаковое время старта не означало бы одинаковое время получения полного текста.

Расход и задержку стоит сопоставлять на запросах с одной задачей и сопоставимым требованием к результату. Более короткий ответ может одновременно снизить счёт и ускорить завершение, но изменить полезность результата. Показатели независимого измерения помогают выбрать кандидатов; прогноз для приложения зависит также от длины его входа и настроек рассуждения.

География обработки и итоговый выбор

Таблица тарифов OpenAI разделяет стандартный, пакетный, гибкий и ускоренный режимы и указывает надбавку 10% для подходящих региональных точек обработки. GPT-6.1 Sol поддерживает обработку данных в США и ЕС; для Claude Sonnet 5.5 в прямом API описан глобальный маршрут и вариант обработки только в США. Поэтому местоположение команды в СНГ само по себе не задаёт ни маршрут данных, ни окончательную цену запроса.

Если проект требует определённого места обработки, модель, режим и надбавку нужно зафиксировать до сравнения расходов. Для короткого запроса выбранная пара даёт одинаковую цену при одинаковом числе токенов; в условном длинном документе дешевле Claude Sonnet 5.5 из-за тарифа GPT-6.1 Sol после порога контекста. В повторяющейся агентской нагрузке решающим становится то, какая часть общего префикса действительно читается из кеша.

Читайте также:

Поделиться:

Подпишитесь на рассылку

Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.

0