Claude Code թե Gemini CLI․ harness-ը կարող է փոխել արդյունքը 20.8 կետով

|Հեղինակ: QUASA-ի խմբագրական թիմ|6 րոպե ընթերցանություն
Claude Code թե Gemini CLI․ harness-ը կարող է փոխել արդյունքը 20.8 կետով

Terminal-Bench 2.0-ի հրապարակված վերլուծությունում Gemini 3.1 Pro-ն Gemini CLI-ով ստացել է 59.4%, իսկ TongAgents-ով՝ 80.2%․ տարբերությունը 20.8 տոկոսային կետ է։ Նույն վերլուծությունում Claude Opus 4.6-ի և Claude Code-ի զույգը ստացել է 58.0%, իսկ նույն մոդելի և Meta-Harness-ի զույգը՝ 76.4%։ Սրանք առանձին ներկայացումների դիտողական արդյունքներ են․ տարբերությունը ամբողջությամբ միայն harness-ին վերագրել հնարավոր չէ, քանի որ կարող էին տարբերվել նաև հրահանգները, հաշվարկային բյուջեն և այլ պայմաններ։

Claude Code-ի և Gemini CLI-ի միջև գործնական ընտրությունը, հետևաբար, չի լուծվում երկու տողերի միավորները համեմատելով։ Անվճար փորձարկման համար Gemini CLI-ն ունի մուտքի տարբերակներ, իսկ Claude Code-ը հարմար է, եթե արդեն օգտագործում եք այն ներառող վճարովի Claude պլան։ Երկար աշխատանքների դեպքում որոշիչ կարող են դառնալ հարցումների սահմանը, ընդհանուր բաժանորդագրական ծավալը և այն, թե երբ է սկսվում առանձին API վճարումը։

Ի՞նչ է չափվում տերմինալային առաջադրանքում

Terminal-Bench-ի հեղինակների նկարագրությամբ՝ Terminal-Bench 2.0-ը ներառում է տերմինալային միջավայրում կատարվող 89 առաջադրանք։ Յուրաքանչյուրն ունի իր միջավայրը, մարդու գրած լուծումը և արդյունքը ստուգող թեստեր։ Գործակալին բավարար չէ համոզիչ պատասխան գրել․ այն պետք է ուսումնասիրի միջավայրը, կատարի անհրաժեշտ գործողությունները և հասնի ստուգումն անցնող վիճակի։ Այդ պատճառով չափված հաջողությունը վերաբերում է աշխատող ամբողջ համակարգին։

Միավորը չի պատկանում միայն հիմքային մոդելին։ Նույն մոդելը կարող է գործել տարբեր հրահանգներով, գործիքներով, քայլերի կառավարմամբ և սխալից վերականգնվելու կանոններով։ Եվ հակառակը՝ Claude Code-ի ու Gemini CLI-ի արդյունքները կողք կողքի դնելիս փոխվում է նաև մոդելը։ Ուղիղ համեմատությունը ցույց է տալիս տվյալ կոնֆիգուրացիաների կատարումը նշված առաջադրանքներում, բայց չի մեկուսացնում, թե առավելության որ մասը մոդելինն է, որը՝ գործակալային շերտինը։

Հրապարակված արդյունքի համար նշանակություն ունի նաև ներկայացման ժամանակը։ Համակարգերն ու նրանց կարգավորումները թարմացվում են, իսկ հրապարակային աղյուսակները կարող են համալրվել նոր ներկայացումներով։ Այստեղ բերված տարբերությունը վերաբերում է վերլուծության մեջ հավաքված կոնկրետ զույգերին. այն չի խոստանում, որ նույն մոդելի ցանկացած նոր թողարկում կամ տեղային գործարկում կստանա նույն միավորը։

Որտե՞ղ է ավարտվում մոդելը, և սկսվում harness-ը

Հիմքային մոդելը մեկնաբանում է խնդիրը, առաջարկում փոփոխություն և որոշում հաջորդ գործողությունը։ Harness-ը կազմակերպում է աշխատանքի ընթացքը՝ ինչ ֆայլեր ու հրամանների պատասխաններ են հասնում մոդելին, ինչ գործիքներ կարող է այն կանչել, ինչպես է պահպանվում առաջադրանքի վիճակը և երբ է ստուգվում արդյունքը։ Եթե գործակալը մոդելին չի փոխանցում կարևոր սխալի հաղորդագրությունը, մոդելը չի կարող դրա հիման վրա ուղղել լուծումը՝ անկախ իր կարողությունից։

Այս բաժանումը բացատրում է, թե ինչու նույն մոդելի երկու արդյունք կարող են հեռու լինել իրարից։ Ավելի լավ ընտրված համատեքստը կարող է օգնել գտնել անհրաժեշտ ֆայլը, իսկ ստուգման փուլը՝ նկատել ձախողված թեստը և նորից փորձել։ Բայց ավելի երկար գործարկումը կամ ավելի մեծ համատեքստը կարող են նաև մեծացնել ծախսը։ Միայն լուծված առաջադրանքների տոկոսը չի ցույց տալիս, թե այդ հաջողության համար որքան ժամանակ, հաշվարկ կամ միջամտություն է պահանջվել։

Ծրագրավորման սովորական աշխատանքում տարբերությունը երևում է վերջնական փոփոխության որակից։ Գործակալը կարող է ճիշտ ախտորոշել սխալը, բայց չփոփոխել հարակից ֆայլը. կարող է նաև գործարկել թեստերը և ժամանակին ուղղել իր առաջին սխալ ենթադրությունը։ Սրանք հնարավոր ընթացքներ են, ոչ թե պնդում, որ դրանցից մեկը բնորոշ է հատկապես Claude Code-ին կամ Gemini CLI-ին։ Ընտրելիս արժե առանձին դիտել մոդելի առաջարկած լուծումը և գործակալի՝ այն իրականացնելու ընթացքը։

Gemini CLI-ի սահմանը փոխվում է մուտքի եղանակով

Google-ի Gemini CLI-ի սահմանաչափերի էջում անհատական Google հաշվով անվճար մուտքի համար նշված է օրական 1000 մոդելային հարցում, անվճար Gemini API բանալիով՝ 250 հարցում և միայն Flash մոդելներ, Gemini Code Assist Standard-ի համար՝ 1500, իսկ Enterprise-ի համար՝ 2000 հարցում մեկ օգտվողի հաշվով օրական։ Սրանք մոդելին ուղղված հարցումներ են, ոչ թե ավարտված ծրագրավորման խնդիրներ։ Մեկ առաջադրանքը կարող է բազմաթիվ հարցումներ պահանջել, ուստի օրական թիվը չի վերածվում նույնքան պատրաստ լուծման։

Անվճար տարբերակներն էլ համարժեք փորձեր չեն։ API բանալիով անվճար մուտքի Flash սահմանափակումը նշանակում է, որ այդ ճանապարհով ստացված տպավորությունը չի նկարագրում Gemini 3.1 Pro-ով հրապարակված կոնֆիգուրացիայի աշխատանքը։ Google հաշվով մուտքի դեպքում մոդելի ընտրությունը կատարվում է Gemini ընտանիքի ներսում՝ Gemini CLI-ի կանոններով։ Անվճար օգտագործումը հարմար է գործակալի ընթացքը և սեփական նախագծում դրա վարքը տեսնելու համար, եթե հստակ գիտեք, թե որ մուտքի եղանակով եք աշխատել։

Վճարովի Code Assist լիցենզիան տալիս է սահմանված օրական ծավալ, իսկ վճարովի API բանալիով կամ Vertex AI-ով օգտագործման արժեքը կախված է մոդելից և token-ների ծավալից։ Կարճ, պարբերական առաջադրանքների դեպքում օրական սահմանը հեշտ է համադրել աշխատանքային ռիթմի հետ։ Երկար և անկանոն գործարկումների համար կարևոր է նաև մեկ առաջադրանքի ընթացքում կատարվող հարցումների քանակը. նույն quota-ն տարբեր նախագծերում կարող է սպառվել շատ տարբեր արագությամբ։

Claude Code-ի բաժանորդագրությունն ու ընդհանուր ծավալը

Anthropic-ի պլանների նկարագրության համաձայն՝ Claude Code-ը ներառված է Pro և Max պլաններում, բայց հասանելի չէ Free պլանով։ Օգտագործումը կիսում է Claude-ի վեբ, համակարգչային և բջջային միջավայրերի ընդհանուր սահմանը։ Այդ սահմանը վերականգնվում է շարժական հինգժամյա պատուհանով, իսկ վճարովի պլաններն ունեն նաև շաբաթական սահմաններ։ Ընկերությունը չի խոստանում ավարտված առաջադրանքների հաստատուն քանակ. ծավալի սպառումը կախված է ընտրված մոդելից, խոսակցության երկարությունից և աշխատանքի բարդությունից։

Այստեղ բաժանորդագրության կանխատեսելի գինը և հասանելի աշխատանքի ծավալը տարբեր հարցեր են։ Եթե նույն հաշիվը ակտիվորեն օգտագործվում է նաև Claude-ի այլ միջավայրերում, տերմինալի համար մնացող ծավալը պակասում է։ Max-ի ավելի բարձր սահմանն օգնում է հաճախ աշխատողին, սակայն պլանի ծավալի բազմապատկիչը չի նշանակում նույն չափով ավելի շատ լուծված խնդիրներ. բարդ առաջադրանքը կարող է զգալիորեն ավելի շատ ռեսուրս պահանջել, քան կարճ ուղղումը։

Մուտքի ձևը կարող է փոխել նաև վճարումը։ Anthropic-ի Claude Code-ի մուտքի հրահանգը նշում է, որ համակարգում սահմանված ANTHROPIC_API_KEY փոփոխականի դեպքում գործիքը կարող է օգտագործել API բանալին բաժանորդագրության փոխարեն, և օգտագործումը կհաշվարկվի API սակագնով։ Սահմանին հասնելուց հետո API կրեդիտներով շարունակելն էլ առանձին վճարման որոշում է։ Ուստի վճարովի պլան ունենալը դեռ չի ասում, թե կոնկրետ տերմինալային նիստը որ հաշվարկային եղանակն է օգտագործում։

Ո՞ր տարբերակն է համապատասխանում աշխատանքին

Անվճար փորձարկման համար Gemini CLI-ն տրամաբանական մեկնարկ է։ Դրանով կարելի է տեսնել՝ ինչպես է գործակալը ուսումնասիրում նախագիծը, փոփոխում ֆայլերը և արձագանքում ստուգումների արդյունքին։ Ստացված գնահատականը կապեք օգտագործված մոդելի և մուտքի եղանակի հետ. անվճար փորձը ինքնաբերաբար չի վերարտադրում հրապարակված benchmark-ի կարգավորումը։

Կանխատեսելի բաժանորդագրության դեպքում Claude Code-ը հատկապես իմաստ ունի այն մշակողի համար, ով արդեն վճարում է Claude Pro-ի կամ Max-ի համար և կարողանում է տեղավորվել ընդհանուր սահմանում։ Gemini Code Assist-ի վճարովի տարբերակներն ավելի հստակ օրական հարցումների չափ են տալիս։ Տարբերությունը գնահատելիս հաշվի առեք աշխատանքի ռիթմը՝ հազվադեպ երկար գործարկումներ եք անում, թե օրվա ընթացքում բազմաթիվ կարճ փոփոխություններ։

Ըստ օգտագործման վճարելու դեպքում երկու գործիքի ծախսն էլ կապվում է ընտրված մոդելի և իրական սպառման հետ։ Եթե գործակալը շատ քայլերով է լուծում խնդիրը, միայն մուտքային գինը կամ օրական quota-ն բավարար համեմատություն չեն։ Վերջնական ընտրության համար առավել օգտակար է նույն բնորոշ առաջադրանքների վրա դիտել անցած ստուգումները, ձեռքով պահանջված ուղղումները, ծախսը և տևողությունը։ Այդ արդյունքը վերաբերում է հենց ձեր նախագծին ու աշխատանքային պայմաններին։

Կարդացեք նաև:

Կիսվել:

Բաժանորդագրվեք մեր տեղեկագրին

Ստացեք Web3-ի, ԱԲ-ի և կրիպտոյի վերջին լուրերն անմիջապես ձեր էլ. փոստին։

0