Claude Sonnet 5 сохраняет цену за токен, но тот же текст может стоить дороже

Стандартный тариф Claude Sonnet 5 составляет $3 за миллион входных и $15 за миллион выходных токенов — столько же, сколько у Sonnet 4.6. До 31 августа 2026 года включительно действуют вводные ставки $2 и $10 соответственно: эти условия указаны в анонсе Claude Sonnet 5.
Однако одинаковый текст создаёт примерно на 30% больше токенов. Поэтому после окончания вводного периода задание с тем же объёмом входа и ответа может обойтись примерно на 30% дороже, хотя ставка за миллион токенов не изменилась. Перед переходом нужно заново измерить расход, проверить предел ответа и удалить несовместимый ручной бюджет рассуждения.
Почему прежняя ставка не сохраняет стоимость задания
Тариф определяет цену миллиона токенов, но не объём текста, который помещается в этот миллион. Согласно описанию изменений токенизации, новая модель создаёт для того же текста примерно на 30% больше токенов, чем Sonnet 4.6. Там же разработчикам рекомендовано повторно проверить ограничение max_tokens.
Коэффициент 1,3 подходит для предварительной сметы, но не заменяет измерение. Фактическая разница зависит от языка, программного кода, разметки, системных инструкций и схем инструментов. Кроме того, модель может сформировать ответ другой длины, поэтому число выходных токенов нельзя заранее увеличивать механически на те же 30%.
Вводная цена временно компенсирует рост количества токенов. Снижение ставки с $3 до $2 для входа и с $15 до $10 для выхода равно одной трети. Если расход обеих категорий увеличится ровно в 1,3 раза, стоимость задания во вводный период окажется примерно на 13% ниже прежней; после перехода на стандартный тариф она будет на 30% выше.
Формула и расчёт для одинакового текста

Для одного обращения без дополнительных тарифных категорий расчёт выглядит так: стоимость = входные токены × ставка входа / 1 000 000 + выходные токены × ставка выхода / 1 000 000. В цепочке из нескольких обращений отдельно рассчитайте каждый вызов и сложите результаты.
Условный пример: задание в прежней модели использовало 100 000 входных и 20 000 выходных токенов. При ставках $3 и $15 вход стоит $0,30, выход — ещё $0,30, а всё обращение — $0,60.
Предположим, что после перехода одинаковые вход и ответ дают ровно на 30% больше токенов: 130 000 входных и 26 000 выходных. По вводным ставкам расчёт составит $0,26 + $0,26 = $0,52. Это примерно на 13% меньше прежних $0,60.
После завершения вводного периода тот же условный объём будет стоить $0,39 за вход и $0,39 за выход — всего $0,78. Разница с исходными $0,60 составляет 30%. Это не прогноз для любого приложения, а демонстрация того, как изменение единицы расчёта влияет на счёт при неизменной ставке.
Как пересмотреть предел ответа и контекст
Параметр max_tokens остаётся частью запроса, но прежнее значение может оказаться слишком низким. Он ограничивает весь выход модели, включая рассуждение и видимый ответ. Если раньше лимит был установлен почти без запаса, более подробная токенизация повышает риск преждевременной остановки.
Проверяйте не только наличие текста в ответе, но и причину завершения. Если модель регулярно достигает заданного предела, увеличивайте его по результатам измерений для конкретного типа заданий. Автоматическая надбавка в 30% не учитывает возможное изменение длины ответа и расход на рассуждение.
Тот же принцип действует для контекстного окна. Его предел выражен в токенах, поэтому документ или длинная история диалога, ранее находившиеся близко к границе, могут перестать помещаться целиком. Повторный подсчёт должен охватывать системные инструкции, сообщения, вложенные материалы, описания инструментов и возвращённые ими данные.
Как проверить совместимость запросов API
Главная несовместимость касается ручного бюджета рассуждения. Согласно руководству Anthropic по переходу, Claude Sonnet 5 использует адаптивное рассуждение, а запрос с ручным параметром budget_tokens возвращает ошибку 400.
- Замените идентификатор модели на claude-sonnet-5 в испытательной среде, не меняя одновременно остальные условия сравнения.
- Удалите ручную настройку thinking с полем budget_tokens. Фиксированный бюджет рассуждения для новой модели больше не поддерживается.
- Повторно посчитайте токены всех частей запроса, включая системное сообщение, историю, документы и описания инструментов.
- Пересмотрите max_tokens и проверьте ответы, которые раньше приближались к пределу.
- Сравните полную стоимость завершённого задания: все вызовы модели, повторные попытки, передачу истории и результаты инструментов.
Проверка только первого обращения может дать неверную оценку для агентного сервиса. Более длинная история повышает стоимость следующих вызовов, а ошибка или повторная попытка добавляет ещё одно обращение. Единицей сравнения должен быть завершённый пользовательский результат, а не отдельный запрос.
Как заложить переход в бюджет
Соберите выборку типичных заданий разных размеров и измерьте их уже с новым токенизатором. Для каждого задания зафиксируйте входные и выходные токены, число обращений, достижение предела ответа, повторные попытки и данные инструментов. Затем примените к одной выборке два тарифа: вводный $2/$10 и стандартный $3/$15.
Основной бюджет лучше рассчитывать по стандартным ставкам, поскольку вводные условия ограничены сроком. Скидку можно учитывать отдельно как временное уменьшение расходов. Так смета не окажется заниженной после 31 августа, а решение о переходе будет учитывать реальную стоимость успешного задания, а не только цену миллиона токенов.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.