
GPT-6 Sol en Luna halveren API-kosten, maar EU-opslag kent een grens

OpenAI bracht GPT-6 Sol en GPT-6 Luna op 22 september 2026 uit in zijn API, zoals TechCrunch die dag berichtte. OpenAI spreekt in de productaankondiging van ‘reducing API prices for Sol and Luna by 50%’ tegenover de promotietarieven van GPT-5.6.
De actuele prijstabel van OpenAI rekent bij korte Standard-verzoeken per miljoen tokens $2 voor input en $10 voor output van Sol, tegenover $0,10 en $0,50 voor Luna; EU-dataresidentie is voor beide modellen alleen met Standard-verwerking beschikbaar en regionale verwerking kost waar beschikbaar 10% extra. Daardoor is het laagste gepubliceerde tarief niet automatisch de prijs voor een Europese toepassing met eisen aan de locatie van gegevensverwerking.
Wat de gehalveerde tarieven wel en niet zeggen
De introductievergelijking gebruikt dezelfde tariefcategorieën voor de oude en nieuwe modellen. Sol gaat daarbij van $4 naar $2 per miljoen inputtokens en van $20 naar $10 per miljoen outputtokens. Voor Luna halveert de inputprijs van $0,20 naar $0,10, maar de outputprijs daalt van $1,20 naar $0,50. Dat laatste is een daling van ongeveer 58,3%, zodat de algemene formulering van 50% geen exact percentage voor elke afzonderlijke prijsregel is.
Ook de totale rekening hangt af van de verhouding tussen input en output. Sol is gericht op complexere taken zoals programmeren; Luna op afgebakend werk met grote aantallen verzoeken, waaronder samenvatten en informatie uit documenten halen. Een lager tarief per token zegt op zichzelf niet hoeveel tokens een model voor dezelfde taak zal gebruiken of of het resultaat aan de gewenste kwaliteit voldoet.
Bij korte Standard-verzoeken zijn er bovendien vier relevante posten: nieuwe input, hergebruikte input uit de cache, het vullen van die cache en output. Een miljoen hergebruikte inputtokens kost $0,01 bij Luna en $0,20 bij Sol; een miljoen cache writes kost respectievelijk $0,125 en $2,50. Een cache hit verlaagt dus de prijs van hergebruik, terwijl het opslaan van invoer een eigen kostenpost blijft. De berekeningen hieronder zijn voorwaardelijke voorbeelden met vaste tokenaantallen, zonder eventuele kosten van aanvullende API-tools.
Drie rekenvoorbeelden voor de nieuwe modellen
Samenvatten zonder cache
Stel dat een dienst 1.000 afzonderlijke teksten samenvat met per tekst 20.000 inputtokens en 1.000 outputtokens. Dat zijn samen 20 miljoen inputtokens en 1 miljoen outputtokens. Zonder cache kost die reeks met Luna $2 voor input plus $0,50 voor output, samen $2,50. Met Sol wordt het $40 plus $10, samen $50.
Bij precies dezelfde tokenaantallen zouden de genoemde GPT-5.6-promotietarieven voor Luna uitkomen op $5,20 en voor Sol op $100. Sol halveert in dit voorbeeld dus exact in prijs; Luna wordt iets meer dan half zo duur doordat haar outputtarief sterker daalt. Het voorbeeld veronderstelt dat beide modelgeneraties evenveel tokens verwerken en produceren. Als een model langere antwoorden geeft of meer redeneertokens gebruikt, verandert de uitkomst per samenvatting.
Documentextractie met hergebruikte instructies
Neem een voorwaardelijke reeks extractieverzoeken met in totaal 10 miljoen nieuwe inputtokens, 20 miljoen hergebruikte inputtokens, 1 miljoen cache writes en 0,5 miljoen outputtokens. Luna rekent voor die posten achtereenvolgens $1, $0,20, $0,125 en $0,25: samen $1,575. Bij Sol zijn de bedragen $20, $4, $2,50 en $5, samen $31,50. De volumes beschrijven de hele reeks; ze veronderstellen niet dat ieder afzonderlijk verzoek dezelfde cache hit oplevert.
Zonder cachehergebruik zouden dezelfde 31 miljoen inputtokens tegen het gewone inputtarief vallen. Met dezelfde output zou de reeks dan $3,35 bij Luna en $67 bij Sol kosten. De besparing ontstaat hier doordat 20 miljoen tokens daadwerkelijk uit de cache worden gelezen. Een identieke instructie die geen cache hit krijgt, wordt tegen het gewone inputtarief afgerekend; de cache writes blijven als afzonderlijke post op de rekening staan.
Eén verzoek met lange context
Een voorwaardelijk verzoek met 300.000 inputtokens en 10.000 outputtokens passeert de grens van 272.000 inputtokens. Dan geldt voor het volledige verzoek het langecontexttarief: bij Luna $0,20 per miljoen inputtokens en $0,75 per miljoen outputtokens, bij Sol $4 en $15. Dat levert voor dit verzoek $0,0675 met Luna en $1,35 met Sol op.
Als dezelfde tokenaantallen tegen de kortecontexttarieven mochten worden berekend, zouden de bedragen $0,035 en $0,70 zijn. Die tweede berekening is alleen een vergelijkingspunt: een verzoek van deze omvang valt in de duurdere categorie. De omslag geldt voor alle tokens in het verzoek, waardoor een prompt net boven de grens relatief veel meer kan kosten dan een iets kortere prompt. Voor cacheverkeer in lange verzoeken gelden eveneens hogere tarieven.
De grens voor Europese dataresidentie
Batch en Flex kosten voor Sol en Luna de helft van Standard. Voor de reeks samenvattingen uit het eerste voorbeeld komt dat, bij dezelfde tokenaantallen, neer op $1,25 met Luna of $25 met Sol. Die bedragen horen bij een andere verwerkingstier. Ze zijn daarom geen alternatief met dezelfde voorwaarden wanneer Europese dataresidentie voor deze modellen vereist is.
Bij regionale Standard-verwerking verhoogt de toeslag van 10% de voorbeeldrekening voor samenvatten van $2,50 naar $2,75 bij Luna en van $50 naar $55 bij Sol. De toeslag verandert niets aan de afzonderlijke tarieven voor cache writes of lange context: ook die posten tellen mee voordat de regionale verhoging op de toepasselijke rekening doorwerkt. Een organisatie die EU-dataresidentie nodig heeft, moet voor deze modellen dus rekenen met de Standard-tarieven plus de regionale toeslag, niet met de gehalveerde Batch- of Flex-bedragen.
Vooral bij grote aantallen verzoeken maakt dat onderscheid verschil. Een toepassing met korte, herhaalde instructies kan via echte cache hits nog steeds aanzienlijk besparen, terwijl een lange prompt de duurdere contextcategorie activeert. De locatie-eis bepaalt vervolgens welke verwerkingstier beschikbaar is en daarmee welke van die berekende bedragen als Europese API-kosten bruikbaar zijn.
Gerelateerde artikelen


EU-label toont het waterverbruik van datacenters, maar stelt geen limiet

Securex koopt meerderheid in Faktion: AI moet Belgische hr opschalen

Stop AI-notulen in Teams, Meet en Zoom vóór de opname begint

Perplexity Pro of ChatGPT Plus: snel bronnen vinden of dieper uitwerken?
Abonneer je op onze nieuwsbrief
Ontvang het laatste nieuws over Web3, AI en crypto rechtstreeks in je inbox.