
Claude Code czy Codex? Ten sam wynik może kosztować o 40% mniej

Według pomiaru Artificial Analysis Claude Code z Fable 5.1 (max, z fallbackiem) i Codex z GPT-6 Astra (max) uzyskały zaokrąglony indeks 62; średni koszt API wyniósł odpowiednio 12,39 i 7,47 USD za zadanie, czyli po stronie Codexa około 40% mniej. Równość dotyczy wyniku po zaokrągleniu, a koszt — prób w benchmarku, nie gotowych zmian przyjętych przez zespół.
Przy wyborze agenta terminalowego do repozytorium Codex ma więc mocny argument kosztowy w tej parze, ale sam indeks nie rozstrzyga wyboru. Trzeba zestawić rodzaj wykonywanych zadań, czas pracy agenta i odsetek zmian, które przechodzą przegląd. Znaczenie ma również zakres poleceń, które agent może wykonać bez zgody: częste zatrzymania przebiegu wpływają na czas pracy człowieka.
Co kryje remis w benchmarku?
Indeks łączy zadania o różnych celach. W analizie wyników trzech składowych Codex prowadził w DeepSWE v1.1, uzyskując 68% wobec 64% Claude Code, natomiast Claude Code prowadził w Terminal-Bench 4.0 (58% do 56%) i SWE-Atlas-QnA (65% do 62%). Ta sama analiza podaje średnie zużycie 3,3 mln tokenów na zadanie dla Codexa i 5,7 mln dla Claude Code oraz czas pracy odpowiednio 29,4 i 34,8 minuty.
DeepSWE dotyczy dłuższych zmian w istniejącym repozytorium, Terminal-Bench obejmuje wykonywanie zadań w terminalu, a SWE-Atlas-QnA — pytania wymagające prześledzenia kodu i wyjaśnienia jego działania. Zespół naprawiający błędy w wielu plikach będzie inaczej ważył te wyniki niż zespół, który często poznaje obce projekty lub automatyzuje pracę w terminalu. Średnia daje punkt odniesienia, lecz zaciera różnicę między tymi rodzajami pracy.
Wynik należy do całej konfiguracji: agenta, modelu i ustawień. W pierwszej parze wariant Claude Code dopuszczał model zapasowy; sam remis nie izoluje więc jakości modeli ani wpływu mechanizmów agentów. Również niewielka przewaga Claude Code widoczna przed zaokrągleniem nie zmienia faktu, że opublikowany indeks pokazuje oba warianty jako 62. Ocena samego mechanizmu wymagałaby utrzymania tego samego modelu, zadania, środowiska i uprawnień.
Ta sama skala wysiłku zmienia obraz kosztu i czasu
W późniejszym porównaniu TechRepublic reprezentatywne warianty Claude Code z Sonnet 5.5 (max) i Codexa z GPT-6.1 Sol (xhigh) miały indeksy 68 i 63; po ustawieniu xhigh także dla Sonnet 5.5 oba osiągnęły 63. W tej drugiej parze średni koszt API wyniósł 3,33 USD dla Claude Code i 1,04 USD dla Codexa, a czas pracy agenta — 27 i 15,5 minuty. Różnica między zestawieniami wynika z doboru modeli i ustawień, a nie ze zmiany wyniku jednej niezmiennej konfiguracji.
Nawet wspólna etykieta xhigh nie gwarantuje identycznego nakładu obliczeń u dwóch dostawców. Porównanie mówi, ile kosztowały i jak długo działały gotowe warianty w tych samych kategoriach zadań; nie przypisuje całej przewagi cenowej samemu Codexowi jako mechanizmowi. Dla kupującego gotowe narzędzie to użyteczna informacja, pod warunkiem że wybiera wariant dostępny w swoim sposobie rozliczania.
Czas w tabeli oznacza aktywną pracę procesu agenta. Nie obejmuje przeglądu zmian przez programistę ani pełnej drogi od zgłoszenia zadania do połączenia kodu. Podobnie kwoty odzwierciedlają zużycie rozliczane według cen API, z uwzględnieniem zasad wyceny pamięci podręcznej; nie są miesięczną ceną abonamentu. Dlatego niższy koszt próby może mieć inne znaczenie w zespole płacącym za API niż w zespole pracującym w granicach planu.
Ile kosztuje zaakceptowane zadanie?
Do decyzji zakupowej przydaje się prostszy mianownik: łączny koszt prób podzielony przez liczbę zaakceptowanych zadań. W liczniku uwzględnij wszystkie uruchomienia, także nieudane i ponowione, oraz czas przeglądu i poprawek. W mianowniku licz tylko zadania spełniające tę samą definicję ukończenia, na przykład zmiany przechodzące testy i przyjęte do repozytorium.
Warunkowy rachunek pokazuje różnicę. Gdyby każde narzędzie wykonało 100 prób po średnich cenach pierwszej pary, koszt samego API wyniósłby 1239 USD dla Claude Code i 747 USD dla Codexa. Jeśli z każdej grupy przyjęto by po 80 zmian, koszt wyniósłby około 15,49 i 9,34 USD za zaakceptowane zadanie, przed doliczeniem pracy człowieka. Liczba 80 jest tu założeniem rachunkowym, a nie odsetkiem skuteczności wyprowadzonym z benchmarku.
Przy różnych odsetkach akceptacji trzeba podzielić koszt każdego agenta przez jego własną liczbę przyjętych zmian. Tańsza próba nie przesądza o tańszym wyniku, jeśli częściej wymaga ponowienia lub dłuższego przeglądu. Warto zapisywać osobno czas działania agenta, czas oczekiwania na zgodę i czas programisty: ich suma odpowiada na pytanie o koszt dostarczenia zmiany lepiej niż sama cena miliona tokenów.
W abonamencie podstawą rachunku jest opłata za plan w wybranym okresie, ewentualne dopłaty i liczba zadań mieszczących się w limitach. Nie należy przenosić kwot z tabeli API wprost na taki plan. Jeśli limit zatrzymuje pracę przed końcem okresu, rzeczywista przepustowość zespołu staje się równie ważna jak koszt pojedynczego przebiegu.
Jaką kontrolę nad poleceniami daje każdy agent?
Dokumentacja Claude Code CLI opisuje tryby uprawnień, reguły dopuszczania i blokowania narzędzi, konfigurację serwerów MCP oraz limity tur i wydatków dla uruchomień w trybie print. Limit wydatków opiera się na szacunku klienta, który może różnić się od końcowego rachunku. Przy automatycznym przebiegu istotne jest, czy ograniczenie dotyczy właśnie używanego trybu uruchomienia i co dzieje się po jego osiągnięciu.
Dokumentacja poleceń Codex wymienia tryby izolacji read-only, workspace-write i danger-full-access, ustawienia zatwierdzania poleceń, nieinteraktywne uruchomienia przez codex exec oraz zarządzanie serwerami MCP. Zakres zapisu i reguły zgody warto oceniać razem: agent z prawem edycji repozytorium, ale zatrzymujący się przed potrzebnym poleceniem, daje inną przepustowość niż agent kończący przebieg bez udziału człowieka.
Przy porównaniu na własnych zadaniach sprawdź:
- które pliki i katalogi agent może odczytywać oraz zmieniać;
- jakie polecenia wymagają zgody, a jakie są blokowane;
- czy dostęp do sieci i serwerów MCP odpowiada polityce zespołu;
- jak przebieg automatyczny reaguje na limit oraz jak liczone są ponowienia.
Jeśli w pracy przeważają długie zmiany w repozytorium, tańszy wariant Codexa ma mocne uzasadnienie do próby na rzeczywistych zadaniach. Przy zadaniach terminalowych i objaśnianiu kodu przewaga Claude Code w odpowiednich częściach benchmarku jest równie istotna. Porównanie warto zakończyć dopiero po przyjęciu tych samych kryteriów ukończenia i takich uprawnień, z jakimi zespół zamierza pracować na co dzień.
Przeczytaj także:
Powiązane artykuły


NIST nada agentom AI własną tożsamość — DevSecOps będzie pierwszym testem

Zscaler łączy tarczę z Lightwell — łatka nie musi być pierwszą obroną

Pakiet npm ma zielony znacznik? To dopiero początek weryfikacji

C2PA nie mówi, czy obraz jest prawdziwy — czytaj podpis, nie plakietkę

1,46 mld zł na technologie dual-use — pierwszy nabór już trwa
Zapisz się do naszego newslettera
Otrzymuj najnowsze wiadomości o Web3, AI i kryptowalutach prosto na swoją skrzynkę.