Claude ці Gemini для кода: 57,57% супраць 32,03% не паказваюць кошт

|Аўтар: Рэдакцыя QUASA|5 хв чытання
Claude ці Gemini для кода: 57,57% супраць 32,03% не паказваюць кошт

У табліцы Vibe Code Bench v1.1 ад 6 кастрычніка 2026 года Claude Opus 4.6 без thinking у звязцы з OpenHands атрымаў 57,57% і кошт $8,69 за тэст, а Gemini 3.1 Pro Preview (02/26) з OpenHands — 32,03% і $3,83 за тэст. Першая канфігурацыя лепш выканала аўтаматычныя праверкі створаных вэбпраграм. Самі працэнты, аднак, не паказваюць, колькі будзе каштаваць задача, прынятая вашай камандай.

Для працы, падобнай да стварэння вэбпраграмы з нуля, вынік дае падставу пачаць з Claude Opus 4.6. Калі галоўнае — кошт вялікай колькасці запытаў, Gemini 3.1 Pro Preview мае ніжэйшыя стаўкі за токены. Канчатковы выбар залежыць ад таго, колькі зваротаў, выпраўленняў і праверак спатрэбіцца для прымальнага выніку.

Што вымярае розніца ў балах

Vibe Code Bench дае мадэлі апісанне вэбпраграмы, пасля чаго правярае, ці працуе створаны дадатак ў карыстальніцкіх сцэнарыях. Бал праграмы залежыць ад праходжання аўтаматычных тэстаў, а агульны бал усёй канфігурацыі — гэта сярэдняе па праграмах. Таму розніца ў працэнтах найбольш дарэчная для задач, дзе агенту даручаюць стварыць працаздольны дадатак, разам з наладкай асяроддзя і адладкай.

У абедзвюх параўноўваных канфігурацыях выкарыстоўваўся OpenHands. Вынік Opus адносіцца менавіта да рэжыму без thinking, а радок Gemini пазначаны як версія Preview (02/26). Іншы агент, рэжым разважання або выпуск мадэлі можа змяніць вынік; бал Opus таксама нельга пераносіць на таннейшы Claude Sonnet. Для аўтадапаўнення радка, тлумачэння памылкі ці змены кода ў існым рэпазіторыі гэты тэст служыць толькі ўскосным арыенцірам.

Калонка з коштам тэсту ўжо паказвае, што мацнейшы вынік тут суправаджаўся большым рахункам у асяроддзі бенчмарка. Але тэст уключае працу агента з некалькімі зваротамі і інструментамі; яго кошт нельга прыраўняць да цаны аднаго выкліку API. Працэнт праходжання сцэнарыяў таксама не з'яўляецца доляй задач, якія канкрэтная каманда прыме без пераробкі.

Стаўкі API і рэжым абслугоўвання

Прайс-ліст Anthropic, які дзейнічае з 27 мая 2026 года, задае для стандартнага глабальнага Claude API цэны за мільён токенаў: $5 за ўваход і $25 за выхад у Opus 4.6, $3 і $15 у Sonnet 4.6. Гэта цэны прамога API пры названых умовах, а не тарыф падпіскі. Sonnet карысны як таннейшы варыянт для разліку, але вынік тэсту Opus не апісвае яго якасць.

Тарыфы Gemini Developer API для Gemini 3.1 Pro Preview у рэжыме Standard складаюць $2 за мільён уваходных і $12 за мільён выходных токенаў пры запыце да 200 тысяч уваходных токенаў; вышэй за гэты парог — $4 і $18. У Flex адпаведныя пары — $1 і $6 ды $2 і $9. Google таксама прапануе Priority з вышэйшымі стаўкамі, таму назва мадэлі без рэжыму абслугоўвання не вызначае поўную цану. У аплачваны выхад Gemini ўваходзяць і токены разважання: аб'ём бачнага адказу можа быць меншым за аб'ём у рахунку.

Ніжэй прыведзены ўмоўныя разлікі для аднаго звароту без кэшавання, дадатковых інструментаў і пакетнай апрацоўкі. Кожны раз мадэлям зададзена аднолькавая колькасць уваходных і аплачаных выходных токенаў. Аднолькавы тэкст на практыцы можа токенізавацца па-рознаму, а агент можа шматразова перасылаць файлы, гісторыю дыялогу і вынікі каманд.

Тры аб'ёмы аднаго запыту

Кароткі ўмоўны запыт з 20 тысячамі ўваходных і 2 тысячамі выходных токенаў каштуе $0,15 у Opus 4.6 і $0,09 у Sonnet 4.6. Для Gemini 3.1 Pro Preview гэта $0,064 у Standard або $0,032 у Flex. Так параўноўваецца толькі плата за токены аднаго звароту: мадэлі могуць запатрабаваць рознай колькасці зваротаў, каб скончыць адно заданне.

Пры 100 тысячах токенаў уваходу і 10 тысячах выхаду кошт складзе $0,75 для Opus, $0,45 для Sonnet, $0,32 для Gemini Standard і $0,16 для Gemini Flex. Калі агент зноў дасылае амаль увесь рэпазіторый або доўгую гісторыю размовы, уваходныя токены аплачваюцца зноў. Таму нават кароткі фінальны адказ можа мець значны кошт.

Вялікі ўмоўны запыт з 250 тысячамі ўваходных і 10 тысячамі выходных токенаў каштуе $1,50 у Opus, $0,90 у Sonnet, $1,18 у Gemini Standard і $0,59 у Gemini Flex. Для Gemini тут дзейнічае даражэйшая пара ставак, бо ўваход перавышае парог тарыфу. Пры такім аб'ёме адзін зварот Gemini Standard ужо даражэйшы за адзін зварот Sonnet з той жа ўмоўнай колькасцю токенаў. Параўнанне з Sonnet датычыцца цаны; якасць у названым радку бенчмарка належыць Opus.

Калі аб'ём кантэксту змяняе разлік

Дакументацыя Claude Platform указвае, што мадэлі Claude 4.6 падтрымліваюць кантэкст да мільёна токенаў па стандартнай стаўцы. Гэта дазваляе перадаваць вялікія наборы файлаў без асобнага даражэйшага тарыфу за доўгі кантэкст. Плата ўсё роўна расце разам з фактычнай колькасцю токенаў, а змяшчэнне файла ў кантэкст само па сабе не гарантуе, што мадэль дакладна выкарыстае кожную яго частку.

Картка Gemini 3.1 Pro Preview указвае ліміт 1 048 576 токенаў на ўваход і 65 536 на выхад. Такім чынам, абедзве параўноўваныя лінейкі маюць вельмі вялікі дапушчальны ўваход, але для Gemini цэнавы парог надыходзіць раней за мяжу кантэксту. Калі задача патрабуе шмат файлаў, істотна адрозніваць тэхнічную магчымасць змясціць іх у запыт ад цаны гэтага запыту і наступных паўтораў.

Кошт прынятай задачы

Кошт прынятай задачы атрымліваецца, калі ўсе выдаткі на спробы падзяліць на колькасць вынікаў, якія прайшлі праверкі каманды. Гэтая мера ўлічвае і танныя запыты, пасля якіх патрабуецца шмат выпраўленняў, і даражэйшыя запыты, якія часцей даюць прыдатны код. У рахунок варта ўключаць усе выклікі агента, а не толькі яго апошні адказ.

Для ўмоўнага прыкладу возьмем дзесяць задач, па два запыты на кожную, з профілем 20 тысяч токенаў уваходу і 2 тысячы аплачаных токенаў выхаду на запыт. Токены Opus тады каштуюць $3, а Gemini Standard — $1,28. Калі каманда прыме восем вынікаў Opus і чатыры вынікі Gemini, кошт аднаго прынятага выніку складзе $0,375 супраць $0,32: Gemini застанецца таннейшым. Калі пры тым жа расходзе будуць прынятыя восем вынікаў Opus і толькі тры вынікі Gemini, атрымаецца $0,375 супраць прыблізна $0,427, і перавага ў цане пяройдзе да Opus. Колькасці прынятых задач у абодвух выпадках выдуманыя выключна для тлумачэння разліку.

Працэнты бенчмарка нельга падставіць у гэтую формулу замест колькасці прынятых задач: яны апісваюць праходжанне тэстаў створаных вэбпраграм, а не праверкі вашага праекта. Для выбару паміж двума API вырашальныя тып задач каманды, патрэбны кантэкст, аплачаныя токены за ўсе спробы і тое, колькі вынікаў праходзіць прынятыя ў камандзе праверкі.

Чытайце таксама:

Падзяліцца:

Падпішыцеся на нашу рассылку

Атрымлівайце свежыя навіны пра Web3, ШІ і крыптавалюты проста на пошту.

0