
Claude oder Gemini für lange Dokumente: Eine Million Token reichen nicht

Für lange Verträge und Berichte mit prüfbaren Seitenbelegen ist Claude der plausiblere erste Kandidat. Gemini ist besonders interessant, wenn Bilder, Audio oder Video zum Bestand gehören oder eine schnelle erste Auswertung zählt. Das ist keine allgemeine Rangliste der Modellfamilien: Entscheidend sind die verwendete Version, der Zugang und die Frage, ob eine Antwort tatsächlich zur richtigen Stelle im Original führt.
Anthropics Angaben zum Kontextfenster nennen für Claude Opus 4.7, Opus 4.6 und Sonnet 4.6 jeweils eine Million Token, begrenzen eine API-Anfrage aber auf 600 Bilder oder PDF-Seiten. Die Modellkarte von Gemini 3.1 Pro nennt ebenfalls bis zu eine Million Token sowie Text, Bilder, Audio und Video als Eingaben; im dort ausgewiesenen MRCR-v2-Test mit acht verteilten Suchstellen erreicht das Modell bei dieser Kontextlänge 26,3 Prozent. Der Suchtest misst keine Vertragsprüfung, macht aber den Abstand zwischen Aufnahmekapazität und zuverlässigem Wiederfinden sichtbar.
Welche Grenze beim Hochladen zuerst zählt
Ein Kontextfenster beschreibt, wie viel Inhalt ein Modell in einer Anfrage berücksichtigen kann. Es sagt noch nicht, wie viele PDF-Seiten der jeweilige Zugang annimmt oder wie viel Platz nach Dateien, Anweisungen und Antwort übrig bleibt. Bei Claude können deshalb die im API-Zugang zulässigen Seiten erreicht sein, obwohl das Kontextfenster rechnerisch noch Platz bietet. Auch ein großes PDF mit vielen Abbildungen beansprucht den verfügbaren Raum anders als dieselbe Seitenzahl mit wenig Text.
Für die Gemini API zur PDF-Verarbeitung nennt Google bis zu 1.000 Seiten oder 50 MB je PDF und bei mehreren PDFs höchstens 1.000 Seiten zusammen pro Anfrage, sofern deren Inhalt in das Kontextfenster passt. Diese API-Grenze lässt sich nicht ohne Weiteres auf die Gemini-App übertragen. Wer einen Bestand auswählt, muss daher zwischen Modellkarte, API und Chat-Oberfläche unterscheiden; eine Seitenzahl aus einer Umgebung ist keine Zusage für die andere.
Was der Vergleich mit 520 und 1.040 Seiten zeigt
Der Vergleich von AI vs Tool vom 4. August 2026 meldet für 520 PDF-Seiten 18 von 20 gefundenen Fakten ohne erfundene Seitenzahl bei Claude und 16 von 20 mit zwei falschen Seitenzahlen bei Gemini; Claude brauchte 2:45 Minuten, Gemini 1:10 Minuten. Beim Bestand mit 1.040 Seiten fand der in drei Teile zerlegte Claude-Durchlauf 15 Fakten in 4:20 Minuten, der Gemini-Durchlauf in einem Prompt 16 in 1:55 Minuten. Der Test umfasste unter anderem Geschäftsberichte, einen Regulierungstext und öffentliche Vertragsanlagen.
Diese Werte betreffen die eingesetzten Chat-Zugänge samt Aufteilung des Materials. Der kleinere Durchlauf spricht für die Fundstellengenauigkeit von Claude in genau dieser Aufgabe; beim größeren Durchlauf verschaffte die Verarbeitung in einem Prompt Gemini einen Geschwindigkeitsvorteil. Für Gemini stehen im Methodentext und in den Tabellen jedoch unterschiedliche Versionsnamen, und die dortige Angabe zu Claudes Kontextgröße weicht von der Herstellerdokumentation ab. Deshalb tragen die Messwerte keine belastbare Rangfolge einzelner aktueller Modellversionen.
Auch der Unterschied zwischen den beiden Bestandsgrößen lässt sich nicht allein auf Token zurückführen: Beim größeren Test änderte sich für Claude zugleich das Verfahren. Drei Teilanfragen erfordern das Zusammenführen von Antworten und können Querverweise zwischen Teilen erschweren. Der gemeldete Gemini-Durchlauf fand zwar einen zusätzlichen Fakt, doch eine richtige Zahl mit falscher Seitenangabe bleibt für eine belegpflichtige Auswertung schwer nutzbar.
Warum eine richtige Antwort noch kein richtiger Beleg ist
Bei langen Unterlagen sind Faktentreffer, Seitenangaben und Widerspruchserkennung verschiedene Leistungen. Die Forschungsarbeit „Lost in the Middle“ zeigt für die dort untersuchten Suchaufgaben, dass relevante Informationen in der Mitte langer Eingaben häufiger übersehen wurden als am Anfang oder Ende. Sie testet andere Modelle und Aufgaben als der PDF-Vergleich. Für Vertragsanlagen und Fußnoten liefert sie dennoch einen konkreten Grund, Fundstellen aus allen Teilen eines Bestands in eine Probe aufzunehmen.
Eine Seitenzahl kann plausibel aussehen und trotzdem auf die falsche Anlage zeigen. Ebenso kann die richtige Passage gefunden sein, während eine Verpflichtung der falschen Vertragspartei zugeschrieben wird. Für eine überprüfbare Antwort gehören deshalb Dokumentname, Seite und eine kurze Belegpassage zusammen. Erst am Original lässt sich feststellen, ob die angegebene Stelle die Aussage wirklich trägt und ob die Seitenzählung des PDF mit einer im Dokument gedruckten Seitenzahl verwechselt wurde.
Gemischte Medien und widersprüchliche Angaben
Gemini 3.1 Pro nimmt laut seiner Modellkarte neben Text auch Bild-, Audio- und Videodaten an. Das ist ein sachlicher Vorteil, wenn eine Frage mehrere dieser Formate verbindet; die Leistung bei einer gescannten Tabelle oder Aufnahme ist damit noch nicht gemessen. Bei PDFs beschreibt Google zudem eine Verarbeitung visueller Elemente wie Diagrammen und Tabellen. Für einen reinen Vertragsbestand mit präzisen Zitaten wiegt dagegen die Genauigkeit der Fundstellen stärker als die Zahl unterstützter Medien.
Widersprüche verlangen mehr als das Wiederfinden zweier unterschiedlicher Werte. Berichtsjahr, Definition, Vertragsfassung und Geltungsbereich können voneinander abweichen, ohne dass sich die Aussagen tatsächlich widersprechen. Eine brauchbare Auswertung stellt beide Passagen mit ihren Fundstellen nebeneinander und benennt den jeweiligen Bezug. Im veröffentlichten PDF-Test erkannte der Claude-Zugang alle drei angelegten Widersprüche, der Gemini-Zugang zwei; auch dieses Ergebnis gehört zur dortigen Konfiguration und ersetzt keine Prüfung eigener Dokumente.
Wann ein Durchlauf genügt und wann der Bestand geteilt werden sollte
Ein Durchlauf ist sinnvoll, wenn die Dateien innerhalb der Grenzen des konkret genutzten Zugangs liegen und die Aufgabe eng gefasst ist: etwa eine Klausel finden oder Werte aus einem Bericht mit Seitenbelegen abgleichen. Vor einer größeren Auswertung genügt eine kleine Probe mit bereits bekannten Antworten. Sie sollte Fundstellen vom Anfang, aus der Mitte und vom Ende sowie eine Frage enthalten, deren Antwort im Bestand fehlt.
- Dieselben Dateien und dieselbe Frage an die vorgesehenen Zugänge geben. Als Ausgabe Dokumentname, Seite und kurze Belegpassage verlangen; für fehlende Informationen eine ausdrückliche Leerstelle vorsehen.
- Faktentreffer, falsche Seitenzahlen, übersehene Widersprüche und Laufzeit getrennt festhalten. Die Belege zu wichtigen Aussagen vollständig und weitere Seitenangaben stichprobenartig im Original öffnen.
- Wenn Seiten- oder Dateigrenzen erreicht werden, nach sachlichen Einheiten teilen: Vertrag und zugehörige Anlagen zusammenhalten, Berichtsjahre kennzeichnen und Querverweise zwischen Teilen für die anschließende Gesamtauswertung erhalten.
Bei wiederkehrenden Fragen an ein großes Archiv kann eine gezielte Dokumentensuche mit belegten Ausschnitten zweckmäßiger sein, als jedes Mal sämtliche Dateien in einen Prompt zu laden. Für die Wahl zwischen Claude und Gemini zählt dann auch, wie gut der gesamte Ablauf die richtige Passage auffindbar macht. Der erste Kandidat aus einem veröffentlichten Test bleibt nur so lange die bessere Wahl, wie er im eigenen Material korrekte Aussagen mit korrekten Fundstellen verbindet.
Lesen Sie auch:
Ähnliche Artikel


ChatGPT oder Perplexity: Viele Quellen sind noch keine belastbare Recherche

Gemini-Modell wählen: Live, Transcribe und Flash lösen andere Aufgaben

Kuro erhält 10 Mio. Euro – Bauplan-Widersprüche werden zum KI-Geschäft

Gemini 3.8 Flash kostet wie sein Vorgänger – kann aber mehr Tokens verbrauchen

Gemini springt durch Videos – bis zu 88 Prozent weniger Tokens
Newsletter abonnieren
Erhalten Sie die neuesten Nachrichten zu Web3, KI und Krypto direkt in Ihren Posteingang.