Mistral Large 4 startet mit einer Million Token – die Bestwerte sind noch vorläufig

|Autor: QUASA-Redaktion|5 Min. Lesezeit
Mistral Large 4 startet mit einer Million Token – die Bestwerte sind noch vorläufig

Die Modellkarte von Mistral führt Mistral Large 4 seit dem 6. Oktober 2026 als öffentliche API-Vorschau mit einer Million Token Kontext und 52 Milliarden aktiven Parametern; sie zeigt derzeit 0,68 US-Dollar je Million Eingabetoken, 0,07 Dollar für zwischengespeicherte Eingaben und 2,09 Dollar je Million Ausgabetoken. Damit stehen Zugang, Kontextgröße und aktuelle API-Preise fest. Wie zuverlässig das Modell Informationen aus sehr langen Eingaben verarbeitet, lässt sich aus der Größe des Kontextfensters allein nicht ableiten.

Die Ankündigung des Herstellers nennt dagegen 49 Milliarden aktive Parameter, 3.800 NVIDIA-Grace-Blackwell-GPUs für das Training in eigenen europäischen Rechenzentren und 61,7 Prozent im Programmiertest DeepSWE v1.1; die Modellgewichte sollen Ende Oktober folgen. Gegenüber Le Monde sagte Mitgründer Guillaume Lample, das Modell „narrows the gap“ zu den besten Konkurrenten; der Bericht nennt für Deep SWE 1.1 rund 63 Prozent und weist darauf hin, dass unabhängige Ranglisten die veröffentlichten Spitzenwerte noch bestätigen müssen. Die abweichenden Parameter- und Testzahlen betreffen jeweils dasselbe Modell beziehungsweise den gleich benannten Test. Eine Aufschlüsselung, die die Unterschiede erklärt, liegt bislang nicht vor.

Die Vorschau läuft über Mistrals API

Large 4 kann in Mistral Studio und über die API mit der Modellkennung mistral-large-4 genutzt werden. Die Dokumentation führt unter anderem Chat Completions, strukturierte Ausgaben, Funktionsaufrufe, Document QnA und Batch-Verarbeitung auf. Das sind Eigenschaften des angebotenen Dienstes: Sie beschreiben, welche Schnittstellen für eigene Anfragen bereitstehen, ohne eine bestimmte Antwortqualität zu garantieren.

Das Kontextfenster bezeichnet die Menge an Token, die bei einer Anfrage berücksichtigt werden kann. Bei langen Dokumenten ist das eine wichtige Kapazitätsgrenze, weil Eingabe und gewünschte Ausgabe zusammen in den verfügbaren Rahmen passen müssen. Sie sagt aber noch nicht, ob das Modell eine einzelne relevante Stelle in einem umfangreichen Text findet, mehrere weit auseinanderliegende Passagen richtig verbindet oder seine Antwort sauber auf diese Passagen stützt. Dafür sind gesonderte Aufgaben und Bewertungen nötig.

Die Modellgewichte gehören noch nicht zum öffentlich verfügbaren Angebot. Wer Large 4 derzeit verwendet, greift auf Mistrals bereitgestellte Vorschau zu; ein selbst betriebener Einsatz setzt die angekündigte Freigabe der Gewichte voraus. Diese Trennung ist auch für die Einordnung des Begriffs „offene Gewichte“ wichtig: Er beschreibt die geplante Veröffentlichungsform, während die gegenwärtige Nutzung über den gehosteten Dienst erfolgt.

Was lange Eingaben zu den aktuellen Preisen kosten

Ein ausdrücklich hypothetisches Beispiel macht die Tokenpreise greifbar: Eine Anfrage mit 800.000 nicht zwischengespeicherten Eingabetoken und 10.000 Ausgabetoken würde zu den derzeit angezeigten Sätzen 0,5649 US-Dollar kosten. Davon entfallen 0,544 Dollar auf die Eingabe und 0,0209 Dollar auf die Ausgabe. Die Rechnung umfasst nur diese eine API-Anfrage; wie viele Token ein reales Dokument beansprucht, hängt von seinem Inhalt und seiner Aufbereitung ab.

Falls bei einer weiteren Anfrage sämtliche 800.000 Eingabetoken tatsächlich zum Cachetarif abgerechnet würden, sänke der rechnerische Betrag einschließlich derselben Ausgabe auf 0,0769 Dollar. Das ist eine Bedingung des Beispiels und kein zugesicherter Preis für jeden erneuten Dokumentdurchlauf. Die Modellkarte zeigt neben den aktuellen Sätzen auch reguläre Preise von 1,36 Dollar für Eingaben und 4,18 Dollar für Ausgaben je Million Token. Mit den angenommenen Mengen ergäbe das 1,1298 Dollar ohne Cache; der jeweils geltende Tarif und die tatsächliche Cache-Nutzung bestimmen also die Rechnung erheblich.

Produkteigenschaften und Leistungswerte haben unterschiedlichen Status

Für Large 4 lassen sich die Angaben in drei Ebenen einordnen:

  • Veröffentlichtes Angebot: Vorschauzugang, Modellkennung, Kontextfenster, unterstützte API-Funktionen und ausgewiesene Tokenpreise beschreiben den Dienst, der jetzt bereitsteht. Auch diese Angaben sind eine Momentaufnahme: Preise und Funktionen können sich nach der Vorschau ändern.
  • Herstellerwerte: Mistral stellt Ergebnisse für Programmierung, Cybersicherheit, Finanzen und die Lokalisierung von Objekten in Bildern vor. Solche Werte beziehen sich auf bestimmte Aufgaben und Testbedingungen. Ein gutes Resultat in einem Programmiertest belegt für sich genommen weder dieselbe Leistung bei Dokumentfragen noch einen Spitzenplatz über alle Einsatzgebiete hinweg.
  • Unabhängige Einordnung: Externe Ranglisten müssen Large 4 unter ihren eigenen, offengelegten Bedingungen bewerten. Erst dann lässt sich beurteilen, wie die Vorschau gegenüber anderen Modellen in denselben Tests abschneidet und wie stabil die vom Hersteller hervorgehobenen Spitzenwerte sind.

Die unterschiedlichen Zahlen zu aktiven Parametern sind keine Aussage über die Qualität des Modells. Sie zeigen jedoch, dass selbst technische Kennzahlen derzeit nicht durchgängig gleich angegeben werden. Bei DeepSWE liegen die veröffentlichten Prozentwerte ebenfalls auseinander; ohne genaue Angaben zur verwendeten Konfiguration oder zum Stand der Auswertung wäre es unbegründet, einen der Werte stillschweigend als den endgültigen zu behandeln.

Hinzu kommt die Reichweite spezialisierter Benchmarks. Bei Programmieraufgaben zählen etwa die bereitgestellten Werkzeuge und die erlaubte Zahl von Lösungsversuchen zur Testkonfiguration. Bei Sicherheitsaufgaben kann eine Moderation beeinflussen, ob ein Modell eine Aufgabe überhaupt bearbeitet. Ein Vergleich ist deshalb nur aussagekräftig, wenn Aufgabe, Modellversion und Bedingungen übereinstimmen. Die derzeit zugängliche API ermöglicht eigene Anfragen, ersetzt aber noch keine unabhängig veröffentlichte Gesamtauswertung.

Die Gewichtsfreigabe erweitert die Prüfmöglichkeiten

Mit der für Ende Oktober angekündigten Veröffentlichung der Gewichte könnten externe Teams das Modell selbst betreiben und unter eigenen Bedingungen untersuchen. Mistral hat außerdem weitere Angaben zur Architektur, zum Training nach der Grundausbildung und zu Benchmarks angekündigt. Diese Informationen wären besonders für die abweichenden technischen Zahlen und die genaue Einordnung der Leistung hilfreich.

Bis dahin bleibt für Nutzer der API vor allem eine klare Grenze: Kontextumfang, Schnittstellen und Tokenabrechnung sind beschrieben, während die behauptete Stellung unter den stärksten offenen Modellen noch von unabhängigen Ergebnissen abhängt. Die Gewichtsfreigabe und die darauf folgenden externen Ranglisten werden zeigen, ob die Spitzenwerte auch außerhalb der Herstellerdarstellung Bestand haben.

Lesen Sie auch:

Teilen:

Newsletter abonnieren

Erhalten Sie die neuesten Nachrichten zu Web3, KI und Krypto direkt in Ihren Posteingang.

0