
Codex apo Claude Code: 108 prova nxjerrin fitues, jo përgjigje universale

Në testin e kontrolluar me 108 ekzekutime, konfigurimi me Codex përfundoi me sukses 47 nga 54 prova, kundrejt 33 nga 54 për konfigurimin me Claude Code. Koha mediane e përfundimit ishte përkatësisht 83,5 dhe 357,6 sekonda. Rezultati i përket një prove të punës autonome në CLI, me versione dhe modele të përcaktuara, prandaj nuk shpall fitues për çdo depo apo mënyrë përdorimi.
Për një programues që i jep agjentit një detyrë të qartë në terminal dhe pret një ndryshim që kalon testet pa ndërhyrje, Codex është pika e nisjes më e mbështetur nga kjo provë. Claude Code mund të përshtatet më mirë kur puna kërkon udhëzim të vazhdueshëm gjatë ekzekutimit ose kur rrjedha e ekipit mbështetet te kontrollet e tij në terminal. Përzgjedhja për një depo reale duhet të marrë parasysh edhe ndërprerjet e shërbimit dhe mënyrën si llogaritet përdorimi.
Çfarë u mat në provën e kontrolluar?
Matja përfshiu 18 detyra të papublikuara në TypeScript, Python dhe Go. Secili mjet e provoi çdo detyrë tri herë, duke nisur nga një kopje e pastër e depos. Kërkesat, testet publike, vlerësuesit e fshehtë, burimet e makinës dhe kufijtë kohorë ishin të njëjtë; pas dorëzimit të kërkesës nuk pati ndërhyrje njerëzore.
Konfigurimet ishin Codex CLI 0.144.6 me gpt-5.6-sol dhe Claude Code 2.1.215 me claude-opus-4-8 në nivelin maksimal të përpjekjes. Një ekzekutim quhej i suksesshëm vetëm kur agjenti përfundonte pa ndihmë, prodhonte ndryshim kodi që ndërtohej dhe kalonte si testet publike, ashtu edhe të gjitha testet e fshehta të pranuara. Kjo mat të gjithë zinxhirin e punës — modelin, CLI-në dhe shërbimin — jo aftësinë e modelit të shkëputur prej tyre.
Rregulli i publikuar për suksesin ishte më i rreptë se pragu i ponderuar i parashikuar fillimisht për testet e fshehta. Gjatë vlerësimit u sqaruan edhe disa supozime të testeve; të njëjtat rregulla u zbatuan për të dy mjetet. Codex ruajti përparësinë edhe kur rezultatet u llogaritën pa këto sqarime. Krahasimi përdori interval pasigurie të grupuar sipas detyrës, që përsëritjet e së njëjtës detyrë të mos trajtoheshin si raste krejt të pavarura.
Pse kanë rëndësi koha dhe ndërprerjet?
Në një ekzekutim pa mbikëqyrje, shpejtësia vlen kur agjenti arrin te një ndryshim i përdorshëm. Në provën e matur, Codex bashkoi më shumë përfundime të suksesshme me kohë mediane më të shkurtër. Për një rregullim të kufizuar, me kërkesë dhe teste të qarta, kjo ul kohën që zhvilluesi kalon duke pritur përpara se të shqyrtojë kodin e propozuar.
Prova regjistroi asnjë gabim të ofruesit ose të CLI-së për Codex dhe 10 për Claude Code. Gabimi që ndal ekzekutimin është problem praktik për automatizimin, por nuk tregon vetvetiu se modeli nuk ishte në gjendje të shkruante kodin. Kufijtë e përdorimit ndikuan te Claude Code gjatë periudhës së testimit dhe u numëruan si rezultat, sipas rregullave të provës. Kjo e bën besueshmërinë e shërbimit pjesë të rezultatit, krahas saktësisë së ndryshimit.
Kur ndryshon pesha e rezultatit?
Përparësia e matur është më e rëndësishme kur puna i ngjan detyrave të provës: një depo e përgatitur, kërkesë e përcaktuar dhe teste që tregojnë qartë nëse ndryshimi funksionon. Për hetim të hapur në kod, vendime që kërkojnë ndërhyrje të shpeshtë të zhvilluesit ose bashkëpunim mes mjeteve, kushtet ndryshojnë. Në provë ishin çaktivizuar kërkimi në internet, shtesat e posaçme të ofruesve, udhëzimet e projektit dhe nënagjentët.
Dokumentacioni i Codex paraqet përdorimin e tij në CLI, në editor dhe në rrjedha të shqyrtimit të kodit. Këto mënyra pune mund të kenë vlerë për një ekip që kalon nga terminali te rishikimi i ndryshimeve, por rezultati i provës së kontrolluar nuk i vlerëson ato. Po kështu, përshtatja e Claude Code me një punë ku zhvilluesi drejton agjentin gjatë rrugës kërkon gjykim të veçantë nga suksesi i një ekzekutimi plotësisht autonom.
Versioni dhe instalimi janë pjesë e krahasimit
Një rezultat mund të ndryshojë kur ndryshon CLI-ja, modeli ose mënyra e hyrjes në shërbim. Prandaj, versionet e përdorura në provë kanë kuptim po aq sa emrat e produkteve. Një ekip që krahason mjetet në depon e vet duhet t’u japë të njëjtën detyrë dhe të njëjtën gjendje fillestare të kodit, pastaj të dallojë dështimin e testeve nga ndërprerja e komandës apo shterimi i kuotës.
Udhëzimet e instalimit të Claude Code përshkruajnë instalimin vendas dhe atë përmes npm, kontrollin e versionit, si edhe verifikimin e integritetit përmes manifestit të nënshkruar dhe vlerës SHA256. Paketa npm instalon të njëjtin binar vendas. Këto hollësi ndihmojnë të kuptohet nëse një ndryshim në sjelljen e mjetit lidhet me detyrën apo me instalimin dhe versionin që po përdoret.
Si hyn pagesa në vendim?
Prova nuk dha të dhëna të krahasueshme për koston e dy CLI-ve me abonim, ndaj fituesi për shpenzimin mbetet i papërcaktuar. Sipas shpjegimit të OpenAI për Codex, përdorimi përfshihet në planet ChatGPT, ndërsa kufijtë ndryshojnë sipas planit. Një depo më e madhe ose një detyrë më e gjatë mund të konsumojë më shumë nga hapësira e përdorimit; çmimi i abonimit, i marrë veçmas, nuk tregon sa punë autonome mund të përfundohet.
Për Claude Code, udhëzimi i Anthropic për planet Pro dhe Max sqaron se Claude dhe Claude Code ndajnë kufijtë e abonimit. Nëse mjedisi ka të vendosur ANTHROPIC_API_KEY, Claude Code përdor çelësin e API-së dhe sjell tarifa API në vend të përdorimit të përfshirë në abonim. Për një ekip që kryen shumë ekzekutime, kjo mënyrë hyrjeje mund ta ndryshojë llogaritjen e kostos po aq sa plani i zgjedhur.
Vendimi më i mbështetur për detyra të qarta dhe plotësisht autonome është të nisësh me Codex. Kur puna varet nga ndërhyrjet gjatë ekzekutimit, kontrollet e terminalit ose një kufi i caktuar buxheti, të dy mjetet duhen krahasuar me detyrat e depos përkatëse: ndryshimin që kalon testet, kohën deri te përfundimi dhe ndërprerjet që kërkojnë rikthimin e zhvilluesit.
Artikuj të ngjashëm


GitHub Codespaces apo Ona: integrimi i lehtë përballet me kontrollin e cloud-it

OpenAI ndal GPT-6.1 Astra: bindja e tepruar kaloi kufirin e sigurisë

Ollama nis me një komandë, por madhësia e modelit vendos kufirin

GLM-5.3 shkruan shfrytëzime funksionale: dritarja e mbrojtjes tkurret

Robotët prekin 34% të punës, por vetëm 0,3% del ekonomikisht
Abonohuni në buletinin tonë
Merrni lajmet më të fundit për Web3, AI dhe kripto direkt në kutinë tuaj postare.