
GPT-6 Sol und Luna starten – zwischen ihnen liegt der zwanzigfache Preis

OpenAI veröffentlichte GPT-6 Sol und GPT-6 Luna am 22. September 2026 für die API: Das API-Changelog von OpenAI nennt Standardpreise von 2 US-Dollar für eine Million Eingabetokens und 10 US-Dollar für eine Million Ausgabetokens bei Sol, gegenüber 0,10 und 0,50 US-Dollar bei Luna – Sol kostet in beiden Kategorien zwanzigmal so viel. Die Tarife gelten für Anfragen mit höchstens 272.000 Eingabetokens pro Prompt. Beide Modelle nehmen Text und Bilder entgegen und erzeugen Text über die Responses API oder die Chat Completions API.
Der Bericht von TechCrunch vom Starttag beschreibt Sol als Modell für komplexere Aufgaben wie Coding und Luna als Modell für häufig wiederholte, klar umrissene Arbeit wie Zusammenfassungen und Datenextraktion. Das ist eine Wiedergabe der Positionierung durch OpenAI, kein unabhängiger Nachweis, dass eines der Modelle eine bestimmte Aufgabe besser erledigt. Für API-Nutzer ist deshalb neben dem Tokenpreis entscheidend, wie viele Eingabe- und Ausgabetokens eine erledigte Aufgabe tatsächlich benötigt.
Wie sich der API-Preis zusammensetzt
Die Modellkennungen heißen gpt-6-sol und gpt-6-luna. Abgerechnet wird nach Tokenmengen, nicht mit einem festen Betrag pro Anfrage. Für eine einfache Rechnung werden frische Eingabetokens und Ausgabetokens jeweils mit ihrem Tarif multipliziert und die Beträge addiert. Weil Ausgabetokens bei beiden Modellen das Fünffache frischer Eingabetokens kosten, kann eine lange generierte Antwort den Betrag stärker prägen als ein kurzer Prompt.
Wiederverwendete Eingaben bilden eine eigene Kostenart. Die OpenAI-Preistabelle nennt für eine Million gelesene Cache-Tokens 0,20 US-Dollar bei Sol und 0,01 US-Dollar bei Luna; für Cache-Schreibvorgänge stehen dort 2,50 beziehungsweise 0,125 US-Dollar. Auch diese Tarifpaare ergeben den Faktor zwanzig. Ein Cache-Treffer kann die Rechnung beider Modelle senken, setzt aber einen tatsächlich wiederverwendbaren Prompt-Anteil voraus. Cache-Schreibvorgänge gehören in die Rechnung, wenn Eingaben zu diesem Zweck gespeichert werden.
Die Preistabelle unterscheidet außerdem zwischen kurzen und langen Kontexten sowie weiteren Verarbeitungsarten. Die folgenden Beispiele verwenden ausschließlich die genannten Standardtarife für kurze Kontexte und verteilen ihre Tokenmengen auf mehrere passende Anfragen. Ihre Mengen sind hypothetisch; sie beschreiben weder gemessenen Verbrauch noch eine zugesicherte Leistung der Modelle. Kosten für andere Werkzeuge oder Verarbeitungsarten sind nicht Bestandteil der Rechnungen.
Drei Kostenbeispiele mit unterschiedlichen Tokenverhältnissen
Extraktion: Eine Anwendung verarbeitet in diesem hypothetischen Beispiel insgesamt eine Million Eingabetokens aus Texten und gibt 100.000 Tokens mit extrahierten Angaben zurück. Ohne Cache kostet Sol dafür 2 US-Dollar für die Eingabe und 1 US-Dollar für die Ausgabe, zusammen 3 US-Dollar. Luna kostet 0,10 plus 0,05 US-Dollar, zusammen 0,15 US-Dollar. Die Ausgabe ist kurz, sodass trotz des zwanzigfachen Tarifunterschieds auch der absolute Unterschied vergleichsweise klein bleibt.
Coding: Angenommen, Aufgabenbeschreibungen und Codekontext summieren sich über mehrere Anfragen auf 200.000 Eingabetokens. Code, Erklärungen und Überarbeitungen ergeben zusammen 500.000 Ausgabetokens. Für Sol entstehen 0,40 US-Dollar Eingabe- und 5 US-Dollar Ausgabekosten, insgesamt 5,40 US-Dollar; bei Luna sind es 0,02 und 0,25 US-Dollar, insgesamt 0,27 US-Dollar. Hier bestimmt vor allem die umfangreiche Ausgabe den Betrag. Die Rechnung unterstellt jedoch für beide Modelle dieselben Tokenmengen und sagt nichts darüber aus, wie viele Versuche für ein brauchbares Ergebnis nötig wären.
Lange Stapelverarbeitung mit wiederverwendetem Kontext: Das dritte hypothetische Profil umfasst zehn Millionen Eingabetokens und eine Million Ausgabetokens über viele reguläre Anfragen. Ohne Cache ergeben sich 30 US-Dollar für Sol und 1,50 US-Dollar für Luna. Angenommen, von den Eingaben werden vier Millionen Tokens frisch verarbeitet, eine Million in den Cache geschrieben und fünf Millionen aus ihm gelesen. Dann kostet Sol 8 US-Dollar für frische Eingaben, 2,50 US-Dollar für Schreibvorgänge, 1 US-Dollar für Lesezugriffe und 10 US-Dollar für Ausgaben: zusammen 21,50 US-Dollar. Bei Luna ergeben dieselben Mengen 0,40, 0,125, 0,05 und 0,50 US-Dollar, zusammen 1,075 US-Dollar. Das Beispiel setzt genügend wiederholte Prompt-Anteile für die angenommenen Cache-Treffer voraus; es verwendet keinen gesonderten Batch-Tarif.
In allen drei Beispielen bleibt das rechnerische Verhältnis gleich, weil jede verwendete Tokenart bei Sol zwanzigmal so teuer ist wie bei Luna. Die Differenz in US-Dollar verändert sich dagegen stark mit dem Volumen und dem Anteil der Ausgaben. Besonders bei wiederholter Verarbeitung reicht es daher nicht, nur den Preis für frische Eingaben mit der gesamten Eingabemenge zu multiplizieren: Gelesene und geschriebene Cache-Tokens haben eigene Tarife.
Was der Preis über die Aufgabenteilung verrät
Die Modellpositionierung legt eine Arbeitsteilung nahe: Luna für klar definierte Aufgaben in hoher Zahl, Sol für anspruchsvollere Bearbeitung und Coding. Der Tarif allein belegt diese Zuordnung nicht für jede Anwendung. Wenn eine Aufgabe mit Luna mehr Ausgabetokens, zusätzliche Durchläufe oder nachträgliche Korrekturen benötigt, kann der Abstand bei den Kosten pro erledigter Aufgabe kleiner sein als der Abstand auf der Preisliste. Umgekehrt lässt sich aus Sols höherem Preis kein bestimmter Qualitätsgewinn für eine konkrete Eingabe ableiten.
Zum Start sind damit die API-Verfügbarkeit, die unterstützten Eingaben und Endpunkte sowie die Standardtarife dokumentiert. Der zwanzigfache Preisabstand gilt bei gleichen Tokenmengen innerhalb der genannten Tarifkategorien. Wie groß der Abstand pro erfolgreich erledigter Aufgabe ausfällt, hängt von den tatsächlich erzeugten Tokens, der Cache-Nutzung und der Ergebnisqualität im jeweiligen Einsatz ab; die veröffentlichten Preise allein beantworten diese Frage nicht.
Lesen Sie auch:
Ähnliche Artikel


22 Millionen KI-Prompts am Arbeitstag – die Stromzahl ist nur eine Schätzung

GPT‑Live‑1 hört beim Sprechen weiter zu – die Stimme kostet extra

Gemini 3.8 Flash startet günstig – hoher Denkaufwand verbraucht mehr Tokens

DeepSeek V4.1 Flash liest mit 8B Parametern – klein ist das Modell nicht

OpenAI-Agenten brachen aus der Sandbox aus – der Bericht zeigt warum
Newsletter abonnieren
Erhalten Sie die neuesten Nachrichten zu Web3, KI und Krypto direkt in Ihren Posteingang.