GPT-6.1 Sol koster 2 dollar ind – cacheprisen er halveret

|Forfatter: QUASA's redaktion|4 min. læsning| 1
GPT-6.1 Sol koster 2 dollar ind – cacheprisen er halveret

Ifølge OpenAI’s API-changelog frigav selskabet GPT-6.1 Sol den 29. september 2026 med standardpriser på 2 dollar pr. million almindelige inputtokens, 0,10 dollar for cache-input og 10 dollar for output; GPT-6 Sol kostede henholdsvis 2, 0,20 og 10 dollar. Kun prisen for genbrugt input er dermed halveret. GPT-6.1 Sol er frigivet til API’et, mens funktionen Multi-agent stadig er i beta.

Axios’ DevDay-referat beskriver lanceringen som en opgradering rettet mod blandt andet kodning og computerbrug. For en indkøber, der sammenligner modellen med GPT-6 Sol, er prisændringen snævrere: Den samlede regning falder kun i det omfang, input faktisk afregnes som cache-input. Hverken nyt input eller modellens svar har fået en lavere standardpris.

Prisændringen ligger i genbrugt input

Et API-forbrug består typisk af nye instruktioner og data, eventuel genbrugt kontekst og de tokens, modellen skriver som svar. De dele afregnes hver for sig. Når en arbejdsgang sender en tidligere kontekst igen, og den registreres som cache-input, koster den del mindre med GPT-6.1 Sol. Et kald uden genbrug påvirkes derfor ikke af den nye cachepris, selv om det udføres med den nye model.

Det gør forskellen særlig relevant for forløb med mange beslægtede kald. En kodeagent kan eksempelvis vende tilbage til den samme projektkontekst, mens opgaven ændrer sig fra kald til kald. De nye instruktioner betales til den almindelige inputpris, den registrerede genbrugte kontekst til cacheprisen, og svaret til outputprisen. To arbejdsgange kan dermed bruge lige mange tokens i alt og alligevel få forskellige regninger, hvis fordelingen mellem de tre kategorier er forskellig.

Standardpriserne gælder for prompts med højst 272.000 inputtokens. OpenAI angiver også en særskilt pris på 2,50 dollar pr. million tokens for at skrive til cachen. Den udgift er forskellig fra prisen for senere at læse cache-input. Ved større prompts eller andre behandlingsniveauer kan satserne ændre sig, så standardpriserne alene beskriver den afgrænsede sammenligning her.

Tre regneeksempler viser den samlede forskel

Et hypotetisk API-forbrug med meget genbrugt input koster 2,20 dollar med GPT-6.1 Sol mod 3 dollar med GPT-6 Sol.

Eksemplerne er hypotetiske forbrug opgjort i dollar ved standardpriserne. Hvert eksempel holder mængden af almindeligt input, cache-input og output ens for de to modeller. De isolerer derfor prisændringen og siger ikke noget om, hvor mange kald eller tokens en virkelig opgave kræver. Eventuelle cache writes og særskilte værktøjsudgifter er ikke medregnet.

Uden cache: En arbejdsgang bruger 1 million almindelige inputtokens, ingen cache-inputtokens og 100.000 outputtokens. Inputdelen koster 2 dollar og outputdelen 1 dollar. Regningen bliver 3 dollar med både GPT-6 Sol og GPT-6.1 Sol. Her giver den halverede cachepris ingen besparelse, fordi ingen tokens afregnes som genbrugt input.

Med moderat genbrug: En arbejdsgang bruger 200.000 almindelige inputtokens, 800.000 cache-inputtokens og 100.000 outputtokens. Med GPT-6.1 Sol koster de tre dele 0,40, 0,08 og 1 dollar, i alt 1,48 dollar. Med GPT-6 Sol koster cache-input 0,16 dollar, og totalen bliver 1,56 dollar. Besparelsen er 0,08 dollar eller cirka 5,1 procent af forgængerens samlede pris, selv om selve cacheprisen er halveret.

Med meget genbrug: Fordelt på mange kald bruger en arbejdsgang 200.000 almindelige inputtokens, 8 millioner cache-inputtokens og 100.000 outputtokens. Med GPT-6.1 Sol bliver beløbene 0,40, 0,80 og 1 dollar, samlet 2,20 dollar. Samme forbrug koster 3 dollar med GPT-6 Sol. Forskellen er 0,80 dollar eller cirka 26,7 procent. De 8 millioner cachetokens er et samlet forbrug på tværs af kald, ikke størrelsen på én prompt.

Cacheandel og svarlængde afgør besparelsen

Regnestykkerne forudsætter, at det angivne genbrug faktisk registreres som cache-input. Hvis en mindre del rammer cachen, bliver den direkte besparelse mindre. Længere svar trækker i den anden retning, fordi output fortsat afregnes til samme pris for begge modeller. Den væsentlige forskel på en brugsopgørelse er derfor fordelingen mellem nye inputtokens, cache-inputtokens og outputtokens.

En lavere tokenregning er heller ikke automatisk en lavere omkostning pr. færdig opgave. En opgave kan kræve flere kald, andre svarlængder eller ekstra værktøjskald, og et nyt cacheforløb kan udløse udgifter til cache writes. Eksemplerne holder netop disse forhold udenfor for at vise effekten af den ændrede læsepris. De giver et sammenligneligt budgettal for samme tokenmængder, mens omkostningen ved et faktisk arbejdsforløb afhænger af dets forbrug.

Modellen er frigivet, Multi-agent er i beta

API-modellen hedder gpt-6.1-sol og kan bruges gennem både Responses API og Chat Completions. Værktøjskald kræver Responses API. Det gælder også Multi-agent, hvor modellen kan uddelegere arbejde til underagenter i en Responses API-anmodning. Betastatussen vedrører denne funktion; den ændrer ikke ved, at selve modellen er frigivet til API-brug.

Ifølge OpenAI’s lanceringsartikel fik brugere på Plus, Pro, Business, Enterprise og Edu adgang til GPT-6.1 Sol i ChatGPT Work og Codex ved lanceringen, mens modellen endnu ikke var tilgængelig i almindelig Chat. Den adgang er adskilt fra API’ets tokenafregning. For professionelle API-arbejdsgange er den umiddelbare konsekvens en lavere pris på gentagne kald med registreret cache-genbrug, mens uddelegering til underagenter fortsat sker gennem en betafunktion.

Læs også:

Del:

Tilmeld dig vores nyhedsbrev

Få de seneste nyheder om Web3, AI og krypto direkte i din indbakke.

0