
A GPT-6.1 Sol ötödáron közelít az Astrához – de lassabb a gyakorlatban

Az OpenAI szeptember 29-i bejelentése szerint a GPT-6.1 Sol elérhető az API-ban és a Codexben. Egymillió normál bemeneti token ára 2 dollár, a kimenetié 10 dollár, szemben a GPT-6 Astra 10 és 50 dolláros árával; a gyorsítótárból olvasott bemenet 0,10, illetve 1 dollárba kerül. A normál tokenár tehát valóban az Astra ötöde, de egy kész feladat költsége a felhasznált tokenektől is függ.
Park Joon szeptember 30-i Codex-mérése 3527 hívást fogott össze ChatGPT Pro előfizetéssel. A Sol látható szövegkiadásának mediánja 31,1 token volt másodpercenként az Astra 33,0 tokenjével szemben; egy maximális következtetési beállításon futtatott feladat teljes ideje 53,5, illetve 44,0 másodperc volt. A vizsgált pontossági feladatokban a csúcsmodellek eredményei nem váltak el érdemben, ám sok próba elérte a teszt felső határát. Ez közeli eredményre és az adott feladatban hosszabb várakozásra utal, nem minden munkára érvényes sebességi sorrendre.
Mit jelent az Astra-közeli eredmény?
Az OrcaRouter által feldolgozott Artificial Analysis-adatok szerint maximális következtetési beállításon a Sol intelligenciaindexe 51,8, az Astráé 52,7 pont volt. Az index feladatainak átlagos futtatási költsége ugyanebben az összevetésben 0,72, illetve 3,26 dollár. A résztesztekből hatot az Astra, kettőt a Sol nyert, kettő döntetlen lett. Az összesített közelség így nem jelenti azt, hogy minden feladattípusban felcserélhető a két modell.
Az indexköltség egy meghatározott tesztcsomag futtatásának költsége, nem egy vállalati kérés listaára. A részfeladatok eltérő mennyiségű kimenetet és következtetést igényelnek, ezért az indexben mért költségarány sem szükségszerűen egyezik a normál tokenárak közötti ötszörös különbséggel. A Sol az összesített pontszámban közel került az Astrához, miközben az egyes munkák eredménye továbbra is a feladat jellegétől függ.
A sebességnél a mérési környezet és a választott mutató is számít. Az Artificial Analysis adataiban a Sol szövegkiadása gyorsabb az Astráénál, míg Park Joon Codex-tesztjében valamivel lassabb volt. A hosszú bemenetű kérés teljes ideje ráadásul más sorrendet adhat, mint a már megkezdett válasz tokenenkénti kiadása. Egy több lépésből álló kódolási munkában a teljes várakozás számít; párhuzamos feldolgozásnál inkább az, hogy a feladatok mikorra készülnek el.
Három feltételezett terhelés forintban
Az alábbi példák a normál API-listaárból és egy kizárólag a számításhoz feltételezett, dolláronként 320 forintos árfolyamból indulnak ki. A tokenmennyiségek feltételezések, nem mért ügyfélforgalom. Mindkét modellnél azonos mennyiségű bemenetet és kimenetet vesznek alapul, így az árkülönbséget szemléltetik; a valós számla a válasz hosszától, az újrapróbálkozásoktól és az elszámolás feltételeitől is függ.
Ismétlődő hosszú kontextus
Feltételezzünk tíz kérést, amelyek mindegyike százezer gyorsítótárból olvasott, tízezer új bemeneti és ötezer kimeneti tokent használ. A Sol összesen 0,80 dollárba, azaz 256 forintba kerülne; az Astra 4,50 dollárba, azaz 1440 forintba. Itt a különbség nagyobb, mint a normál tokenáraknál, mert a Sol gyorsítótáras bemenete az Astra megfelelő árának tizede. A példa már rendelkezésre álló, valóban gyorsítótáras bemenetet feltételez; annak létrehozási költségét nem tartalmazza.
Ez a terhelés akkor jellemző, ha egymást követő kérések ugyanarra a nagy anyagra támaszkodnak, de más választ kérnek belőle. Ha az ismételt rész normál bemenetként számlázódik, a megtakarítás csökken. A gyorsítótáras ár ezért a ténylegesen újrahasznált kontextus arányával együtt értelmezhető, a várakozási időt pedig külön kell számításba venni.
Többlépéses kódolás
Száz feltételezett kódolási feladatnál, feladatonként tízezer új bemeneti és ötezer kimeneti tokennel a Sol költsége 7 dollár, vagyis 2240 forint. Ugyanez az Astrával 35 dollár, vagyis 11 200 forint lenne. A 8960 forintos eltérés azonos tokenfogyasztás mellett áll fenn: ha egy nehezebb javításhoz több próbálkozás és hosszabb válasz kell, a különbség módosul. A benchmarkok összesített pontszáma önmagában nem mondja meg, melyik modell oldja meg előbb az adott kódbázis feladatát.
Az egymásra épülő lépésekben a várakozás is a munka része. Ha a következő módosítás csak az előző eredmény után kezdődhet, a drágább modell rövidebb teljes válaszideje ellensúlyozhatja a tokenárat. Egymástól független feladatok párhuzamos futtatásakor a Sol alacsonyabb ára könnyebben érvényesül, mert az egyes válaszok késése kevésbé adódik össze.
Egyszerű tömeges feldolgozás
Ezer rövid, feltételezett feladat összesen egymillió új bemeneti és százezer kimeneti tokennel a Solnál 3 dollár, azaz 960 forint; az Astránál 15 dollár, azaz 4800 forint lenne. Az ötödár ebben a példában is kijön, de az Astra-közeli képesség itt kisebb értéket adhat. Egyszerű osztályozásnál vagy kötött formátumú átalakításnál a feladat minőségi követelménye és az átfutási idő döntheti el, hogy egyáltalán szükség van-e ilyen erős modellre.
A három számítás a feladatok eltérő költségszerkezetét mutatja: a hosszú, újrahasznált bemenetnél a gyorsítótár ára, a kódolásnál a kimenet és az esetleges ismétlés, a tömeges feldolgozásnál a feladatok száma kerül előtérbe. Egyik forintösszeg sem tartalmazza a fejlesztői várakozás vagy a hibás eredmény javításának értékét. Ezek hatása különösen akkor nő, ha a kérések eredményei egymástól függenek.
Hol fordulhat meg a költségelőny?
A Sol normál tokenára kiszámítható előnyt ad az Astrával szemben, ha a két modell hasonló mennyiségű számlázható tokent használ és hasonló arányban fejezi be a feladatot. A kódolási példában az Astra ötszörös ára mellett a Solnak jelentős tér jutna további tokenekre, de minden újrapróbálkozás időt is igényel. Egy megszakítás nélkül futó kötegben ez kezelhetőbb, mint egy olyan fejlesztési folyamatban, ahol minden válaszra várni kell.
Az első független eredmények a Solt összesítve az Astra közelébe helyezik, a feladatok és a sebességmérők között viszont látható az eltérés. A magyar API-használó számára a kedvezőbb számla leginkább az ismétlődő kontextusnál és a párhuzamos, összetett munkáknál ígéretes. Ahol a következő lépést egyetlen válasz tartja fel, ott a teljes válaszidő gyorsabban fogyaszthatja el az árkülönbség gyakorlati értékét.
Kapcsolódó cikkek


A Gemini 4 Argon erős benchmarkokat hozott, de még alig érhető el

Ollama vagy LM Studio: ugyanaz a modell, mégis más munkafolyamat

A Falcon már OpenAI-keretből is megvehető – csak jogosult cégeknek

Claude Code vagy Codex: 7156 pull request szerint nincs abszolút győztes

RAG vagy finomhangolás: a változó tudást nem érdemes a modellbe égetni
Iratkozzon fel hírlevelünkre
A legfrissebb Web3-, MI- és kriptohírek egyenesen a postafiókjába.