
GPT-6.1 Sol se apropie de Astra, dar efortul maxim nu câștigă mereu

OpenAI a prezentat GPT-6.1 Sol la DevDay, în San Francisco, pe 29 septembrie 2026, drept o variantă mai ieftină pentru sarcini complexe, cu performanțe apropiate de GPT-6 Astra. Pentru dezvoltatori, comparația privește atât rezultatul obținut, cât și factura API. Documentația modelului indică un tarif standard de 2 dolari pentru un milion de tokenuri de intrare și 10 dolari pentru un milion de tokenuri de ieșire, o fereastră de context de 1.050.000 de tokenuri și un plafon de 128.000 de tokenuri de ieșire.
Sinteza Endue publicată pe 30 septembrie 2026 prezintă măsurătorile Artificial Analysis: în indicele general, Sol la efort max a obținut 51,8 față de 52,7 pentru Astra, la un cost estimat de 0,72 dolari față de 3,26 dolari pe sarcină; în indicele agenților de codare, Codex cu Sol la xhigh a obținut 62,9 și a costat 1,04 dolari pe sarcină, față de 60,1 și 1,55 dolari la max. Sunt două evaluări cu sarcini diferite. Rezultatul din codare arată concret de ce alegerea automată a efortului maxim poate aduce un cost mai mare fără un scor mai bun.
În ce sens se apropie Sol de Astra
Apropierea este vizibilă în indicele general Artificial Analysis, unde diferența de scor este mică, iar costul mediu pe sarcină este considerabil mai redus pentru Sol. Indicele combină însă tipuri de lucru diferite, de la sarcini agentice și operarea terminalului până la raționament pe documente și întrebări de cunoștințe. Scorul agregat descrie rezultatul pe acel amestec de probe, nu o distanță constantă față de Astra în orice aplicație.
Costul pe sarcină adaugă o informație pe care tariful unitar nu o poate oferi singur: câți tokenuri au fost consumați pentru a termina lucrul. Un model poate avea un preț atractiv pe milion de tokenuri, dar poate produce ieșiri mai lungi ori poate avea nevoie de mai multe apeluri. În evaluarea generală, diferența de cost față de Astra reflectă volumul de tokenuri folosit în probele respective, împreună cu tarifele aplicate. Pentru un flux care trimite alt tip de context sau cere altă lungime a răspunsului, nota de plată se poate schimba.
De ce xhigh a depășit max în testul de codare
Comparația dintre nivelurile de efort privește aceeași combinație de agent și model: Codex cu GPT-6.1 Sol. Indicele de codare reunește sarcini de modificare a codului, lucru în terminal și răspunsuri la întrebări tehnice despre depozite de cod. Agentul decide cum folosește instrumentele și ce informații aduce din nou în context; rezultatul măsoară întregul flux de lucru, nu doar răspunsul modelului la un mesaj izolat.
În probele publicate, xhigh a avut atât scorul mai bun, cât și costul mai mic pe sarcină. Efortul suplimentar de la max poate mări consumul de tokenuri și durata rulării fără să rezolve mai multe sarcini dintr-un anumit set. Aceasta este o observație despre configurațiile evaluate, nu o regulă potrivit căreia xhigh va câștiga în orice proiect. Un agent cu alte instrumente, alte instrucțiuni sau altă distribuție a sarcinilor poate schimba ordinea rezultatelor.
Diferența dintre cele două niveluri face utilă separarea prețului modelului de eficiența configurației. Când agentul revizitează un depozit de cod, fiecare pas poate adăuga intrare nouă, intrare servită din cache și ieșire generată. Un nivel de efort mai ridicat influențează această combinație, astfel că un tarif identic pe token poate produce costuri diferite pentru finalizarea aceleiași clase de sarcini.
Contextul mare poate schimba factura
Fereastra amplă permite includerea multor fișiere, instrucțiuni și rezultate intermediare într-o cerere. Capacitatea tehnică și tariful obișnuit au însă praguri diferite: pentru o cerere cu peste 272.000 de tokenuri de intrare, prețurile pentru intrare și cache se dublează, iar prețul ieșirii crește de 1,5 ori pentru întreaga cerere. Un flux poate rămâne în limita de context a modelului și totuși să intre în categoria tarifară mai scumpă.
Intrarea reutilizată din cache are un tarif separat de intrarea obișnuită, iar scrierea în cache este facturată distinct. Aceste categorii contează mai ales când un agent păstrează un prefix mare de instrucțiuni și îl folosește în apeluri repetate. Plafonul de ieșire arată cât poate genera modelul într-un răspuns, fără să indice cât va consuma într-o sarcină reală. Pentru un agent, numărul de apeluri și lungimea fiecărui pas pot conta mai mult decât dimensiunea maximă afișată în fișa modelului.
Limitele de trafic sunt separate de fereastra de context. La nivelul Build, fișa API indică 5.000 de cereri și un milion de tokenuri pe minut. Aceste plafoane descriu capacitatea de acces pentru acel nivel, nu costul unei cereri și nici viteza cu care se încheie o sarcină complexă. Un flux cu multe apeluri scurte și unul cu puține cereri foarte mari vor pune presiune pe limite diferite.
Ce înseamnă rezultatele pentru un flux existent
Sol oferă o combinație atractivă pentru sarcini complexe al căror cost cu Astra este greu de susținut: scorul general este apropiat, iar costul măsurat pe sarcină este mai mic. Datele de codare adaugă o distincție decisivă. Alegerea modelului și alegerea nivelului de efort sunt două decizii economice legate între ele; setarea cea mai intensă nu a fost cea mai eficientă în evaluarea publicată.
Valoarea acestor rezultate depinde de asemănarea dintre probe și fluxul în care modelul ar urma să fie folosit. Pentru sarcini dominate de lucru într-un depozit de cod, comparația dintre configurațiile Codex este mai relevantă decât scorul general. Pentru cereri cu un context foarte mare, pragul de tarifare poate cântări mai mult decât diferența mică dintre scorurile agregate. Modelul are astfel un argument clar pentru evaluare, dar costul unei sarcini reale va fi stabilit de volumul de tokenuri și de comportamentul agentului în acel flux.
Citește și:
Articole similare


Claude Sonnet 5.5 păstrează tariful, dar schimbă cinci reguli API

HomeBody curăță o bucătărie necunoscută, dar se oprește să „gândească”

OBS sau Streamlabs: widgeturile pot costa mai mult decât editorul simplu

Cloudflare R2 sau Backblaze B2: egressul gratuit nu decide singur

Claude Code sau Codex: studiul nu găsește un câștigător absolut
Abonează-te la newsletter
Primește cele mai noi știri despre Web3, IA și cripto direct în inbox.