
Claude Sonnet 5.5 е побрз, но пет промени можат да го скршат кодот

Во објавата од 28 септември 2026 година, Anthropic го претстави Claude Sonnet 5.5 со тврдење дека генерира излез над 30% побрзо од Sonnet 5 и дека трошокот по задача може да биде до 30% понизок за најголемиот дел од работата; инженерот на Slack Кертис Ален за нивните проверки на Slackbot наведува „about 14% fewer output tokens“. Брзината и заштедата се резултати што компанијата ги наведува за своите тестови, а не гаранција за секоја продукциска задача.
За тим што го користи Messages API, смената на идентификаторот на моделот е само дел од миграцијата. Техничкиот преглед на Claude Platform го означува моделот како активен и наведува пет некомпатибилни промени за код што работи со Sonnet 5, тарифа од 2 долари за милион влезни и 10 долари за милион излезни токени, контекстен прозорец од еден милион токени и најмногу 128.000 излезни токени во стандарден повик. Идентификаторот во Claude API е claude-sonnet-5-5; дали постојниот повик ќе успее зависи и од поставките за размислување, алатките и зачуваната историја.
Побрз одговор не значи пониска цена по токен
Разликата во цената е во количината потрошени токени по завршена задача. Tom’s Guide го бележи лансирањето и посочува дека тарифите за влез и излез се исти како кај Sonnet 5; тврдењето за понизок трошок се потпира на помала потрошувачка на токени, не на попуст во тарифата. Долг влез со краток одговор затоа има поинаква можност за заштеда од задача што создава многу текст или код.
Условна задача со 10.000 влезни и 1.000 излезни токени чини 0,03 долари според наведената тарифа, без кеш или дополнителни услуги. Ако истиот влез доведе до 700 излезни токени, пресметката паѓа на 0,027 долари; со непроменет број токени останува 0,03 долари. За условен преглед на поголем код, 100.000 влезни и 10.000 излезни токени чинат 0,30 долари, а 7.000 излезни токени го намалуваат износот на 0,27 долари. Тоа е аритметички пример, не измерена потрошувачка на двата модели.
Кога ист долг влез се користи повторно, кешираните токени имаат посебна цена и ја менуваат споредбата. Динамичен дел ставен пред содржината што треба да се кешира може да ја намали очекуваната заштеда; тоа е важно и при пресметка на трошокот со кеширање. За споредба по задача треба одделно да се гледаат обичниот влез, кешираниот влез и излезот, заедно со поставеното ниво на напор.
Пет места каде што постојниот повик може да откаже
Промените не го погодуваат секој повик: едноставно текстуално барање можеби нема да користи ниту една од спорните поставки. Кај интеграција со алатки или зачувана историја, сепак, успешно повикување на стариот модел не е доказ дека истото барање ќе помине и со новиот. Следните ставки ги поврзуваат претходната поставка, потребната измена и можната последица.
- Размислување: Sonnet 5 прифаќа thinking: {"type": "disabled"}, но Sonnet 5.5 го одбива. За работа без размислување пред првиот одговор се користи between_tools. Таа вредност се прифаќа до нивото high; комбинација со xhigh или max повторно завршува со грешка.
- Избор на алатка: tool_choice со any или со присилно избрана tool се одбива. Поставката auto дозволува моделот да одговори и без повик на алатка, што ја менува претпоставката на апликација која секогаш очекува таков резултат. Каде што платформата го поддржува, strict служи за проверка на структурата на аргументите, а не за присилување повик.
- Зачувана историја: блоковите thinking се врзани за моделот и разговорот. Кај сметки за кои се спроведува проверка на потписот, менување на претходните пораки пред повторно испраќање зачуван блок може да предизвика грешка; историјата треба да се дополнува без препишување. При префрлување меѓу модели, некомпатибилен постар блок може и тивко да биде отфрлен.
- Управување со компјутер: на Claude API и Google Cloud постарата алатка computer_20251124 се одбива со новиот модел; таму се користи computer_toolset_20260801. На Amazon Bedrock важи различна комбинација, па измената мора да одговара на платформата преку која навистина се испраќа барањето.
- Советничка алатка: Sonnet 5 како советник за извршувачот Sonnet 5.5 повеќе не е поддржана комбинација и повикот завршува со грешка. Потребен е поддржан советнички модел. Неговиот резултат пристигнува како шифриран блок advisor_redacted_result, па код што очекува читлив текст од советникот исто така треба да се измени.
Одговорот може да се смени и кога повикот успева
Меѓу повици на алатки, подолгите белешки од Sonnet 5.5 може да пристигнат како блокови thinking наместо како text. Барањето тогаш успева, но интерфејс што прикажува само текстуални блокови може да остане без видливи ажурирања додека обработката продолжува. Оваа промена во обликот на одговорот бара посебна проверка: тест што го следи само статусот на барањето нема да ја открие.
И почетната поставка за размислување е важна за споредбата. Sonnet 5.5 користи адаптивно размислување кога полето thinking е изоставено. Затоа идентичен текст на барањето може да произведе различна должина на одговор, траење и трошок ако двата модели не работат со споредливи поставки за напор.
Кои резултати се потребни пред продукциска замена
Пробата треба да опфати вистински видови барања од апликацијата: обичен текст, циклуси со алатки, продолжени разговори и, ако се користат, управување со компјутер и советничка алатка. За секој вид се споредуваат статусот на одговорот, типовите блокови, бројот на влезни и излезни токени, траењето и исходот од задачата. Така може да се види дали побрзото генерирање го скратува и времето што корисникот навистина го чека.
Тим што мигрира од Sonnet 4.6 или постар модел има дополнителни поставки за преглед, меѓу нив фиксни буџети за размислување и нестандардни вредности за temperature, top_p и top_k. Истиот текст може да се брои со различен број токени, па споредба заснована само на старата фактура може да ја потцени новата потрошувачка. Пред продукциска промена, најодлучувачки се успешните повици со зачувана историја и алатки, како и цената и траењето измерени на сопствените задачи.
Прочитајте и:
Поврзани статии


Prompt caching во OpenAI или Claude: динамичната содржина ја јаде заштедата

Claude API враќа 429: retry не помага ако го погодите погрешниот лимит

AI-агентите трошат петпати повеќе токени, но тоа не значи петпати повеќе работа

Beam има 501 милијарда параметри, но само 23 милијарди работат одеднаш

GitHub воведе доверливи коментари, но еднаш избраниот режим не се менува
Претплатете се на нашиот билтен
Добивајте ги најновите вести за Web3, AI и крипто директно во вашето сандаче.