Claude Opus 5.5 дешевле на 40% — максимум усилий съедает экономию

|Автор: Редакция QUASA|5 мин чтения
Claude Opus 5.5 дешевле на 40% — максимум усилий съедает экономию

Claude Opus 5.5 стоит оценивать по цене завершённой задачи и выбранному режиму усилий: снижение тарифа само по себе не гарантирует меньший счёт. По публикации Anthropic, на типичных задачах при настройках по умолчанию модель обходится на 40% дешевле Opus 5, входные и выходные токены стоят $4 и $20 за миллион, а в собственной оценке Terminal-Bench 4.0 модель набрала 66,4% при уровне усилий xhigh.

При выборе между Claude Opus 5.5 и GPT-6 Astra более низкая ставка Claude даёт преимущество лишь при сопоставимом расходе токенов и приемлемом качестве результата. В материале OpenAI об Astra стандартные ставки API указаны как $10 за миллион входных и $50 за миллион выходных токенов, а собственный результат модели на Terminal-Bench 4.0 — 57,9%. Независимые измерения и тесты готовых программных агентов показывают, почему одной этой разницы в тарифах недостаточно для выбора.

Откуда берётся заявленная экономия

Снижение типичной стоимости складывается из тарифа и поведения модели. Anthropic оценивает расход при настройках по умолчанию на выбранных ею нагрузках. Если модель завершает такую задачу за меньшее число обращений и производит меньше оплачиваемого вывода, счёт снижается сильнее, чем ставка отдельного токена. Это оценка для конкретных условий испытания, а не обещание одинаковой экономии в любом программном агенте.

В длинной сессии агент снова передаёт модели инструкции, фрагменты файлов, результаты команд и историю работы. Часть входа может обслуживаться из кеша по отдельной ставке; часть приходится оплачивать как новый ввод. Режим усилий влияет прежде всего на объём работы модели и число генерируемых токенов, поэтому его повышение способно перекрыть выгоду от более дешёвого ввода. Для счёта важны также повторные попытки и то, сколько шагов агент делает до результата, который можно принять.

Сравнение только по выходной ставке тоже неполно. Два агента могут получить верный ответ, но один сделает это за короткую последовательность вызовов, а другой несколько раз перечитает контекст и перепроверит решение. Оба сценария оплачиваются по тарифу выбранной модели, однако итоговая стоимость различается. Именно поэтому процент экономии из сообщения разработчика нельзя напрямую переносить в бюджет команды.

Что измерено в одинаковых тестах

Опубликованные цифры полезно читать вместе с происхождением результата, уровнем усилий и единицей стоимости. В одних строках оценивают модель через испытательную оболочку, в других — готовую связку модели и программного агента. Следующая сводка сохраняет эти различия: стоимость задания в индексе нельзя выдавать за цену отдельной задачи Terminal-Bench.

  • Независимый разбор Artificial Analysis приводит для Opus 5.5 результат 59,6% на Terminal-Bench 4.0; при максимальном усилии средний вывод на задание индекса составляет около 119 тысяч токенов против примерно 73 тысяч у Opus 5, а стоимость задания оказывается примерно одинаковой. Результат Terminal-Bench ниже оценки разработчика из лида, но разность баллов нельзя целиком приписать модели без учёта условий запуска.
  • В парном сравнении моделей Artificial Analysis Opus 5.5 с усилием xhigh и стандартным переключением защитных механизмов получает округлённые 60% на Terminal-Bench 4.0 против 59% у GPT-6 Astra на максимальном усилии; средняя стоимость задания всего индекса составляет $3,46 против $3,26, а расход выходных токенов — около 66 тысяч против 27 тысяч. Результаты терминального теста стоят рядом, тогда как суммы относятся к более широкому набору испытаний.
  • Сравнение программных агентов Artificial Analysis даёт связке Claude Code и Opus 5.5 на максимальном усилии 66 баллов индекса, $13,04 и 15,6 млн токенов на задание; для Claude Code с Opus 5 в том же режиме — 60 баллов, $10,79 и 11,4 млн токенов, а для Codex с GPT-6 Astra — 62 балла, $7,47 и 3,3 млн токенов. Внутри Claude Code новая модель результативнее, но среднее задание обходится дороже прежней.

Эта сводка не является единой турнирной таблицей стоимости моделей. Первый замер говорит о поведении Opus в индексе независимой лаборатории, второй сопоставляет две модели в её испытаниях, третий оценивает работающих агентов. Различаются состав задач, оболочка, управление инструментами и учёт контекста. Сопоставимы строки внутри одного испытания; перенос цены из одной строки в другую требует оговорки об этих различиях.

Почему максимум меняет вывод о цене

Самая прямая проверка обещанной экономии — сравнение двух версий Opus внутри Claude Code при одном уровне усилий. Там более дешёвая новая модель расходует больше токенов и стоит дороже на среднее задание, одновременно показывая лучший результат. Это не опровержение оценки Anthropic для настроек по умолчанию: изменились режим и нагрузка. Зато пример подтверждает ограничение из заголовка — при максимальном усилии снижение тарифа может перестать давать экономию за выполненную работу.

Сравнение с Astra требует ещё большей осторожности. В тесте готовых агентов меньший счёт связки Codex и Astra нельзя считать свойством одной Astra: Codex и Claude Code по-разному выбирают действия, передают контекст и обращаются к инструментам. Даже одинаковое название испытания не превращает их в опыт с заменой только модели. Для команды, уже работающей в одной оболочке, сравнение версий Opus отвечает на более узкий и надёжный вопрос, чем прямое сопоставление двух агентных продуктов.

Есть и разница между платой за API и полной ценой результата. Показатели стоимости в независимом индексе считают оплачиваемые токены, включая разные ставки для нового и кешированного контекста. В них не входят время разработчика на постановку задачи, проверку изменений и исправление результата. Если более дорогой прогон снижает эту дополнительную работу, он может быть выгодным для проекта; опубликованные цифры сами по себе этого не доказывают.

Какой вывод полезен при выборе модели

Для коротких и повторяемых задач разумной исходной точкой остаётся Opus 5.5 с настройками по умолчанию: именно для такого режима Anthropic заявляет снижение типичной стоимости. Если качество такого результата устраивает, повышение усилий добавит расход без очевидной пользы. Для сложного программирования, где неудачная попытка означает ещё один длинный прогон, сравнивать нужно стоимость принятого результата, а не только отдельного вызова API.

Команде, выбирающей между Claude и Astra, нужны одинаковые задания и одинаковый критерий готовности. В расход следует включать все попытки, входные и выходные токены, кеширование и действия агента до завершения работы. Если используются Claude Code и Codex, итог следует называть сравнением этих связок. Независимые данные показывают близкие результаты моделей в одном терминальном испытании, но разные расходы в иных конфигурациях; универсального победителя по цене завершённой задачи из них не следует.

Читайте также:

Поделиться:

Подпишитесь на рассылку

Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.

0