Claude erledigt 26 Prozent der KI-Forschung – autonom ist das noch nicht

|Autor: QUASA-Redaktion|5 Min. Lesezeit
Claude erledigt 26 Prozent der KI-Forschung – autonom ist das noch nicht

Anthropic veröffentlichte am 17. September 2026 neue Messwerte zur eigenen Modellentwicklung. Im August führte Claude demnach 26 Prozent der internen KI-Forschungs- und Entwicklungsarbeit weitgehend aus; bei mehr als 90 Prozent arbeitete das Modell mindestens mit Menschen zusammen. Der Methodenbeitrag von Anthropic hält zugleich fest, dass Claude in keinem gemessenen Arbeitsbereich vollständig autonom war.

Die Meldung bedeutet deshalb nicht, dass Claude seinen Nachfolger selbstständig entwickelt. Die Einordnung der Associated Press vom 18. September bestätigt: Claude kann einen Teil vorgegebener Aufgaben von einer übergeordneten Anweisung bis zum Ergebnis bearbeiten, steht dabei aber weiterhin unter menschlicher Aufsicht. Menschen bestimmen damit noch immer Forschungsziele, Rahmenbedingungen und Freigaben.

Was hinter den 26 Prozent steckt

Die Zahl bezeichnet weder den Anteil des von Claude geschriebenen Quellcodes noch ein Viertel eines neuen Modells. Sie stammt aus dem vorläufigen „Anthropic R&D Automation Index“, der Arten von Forschungsarbeit erfasst, ihren aktuellen Automatisierungsgrad bewertet und sie nach der dafür aufgewendeten menschlichen Arbeitszeit gewichtet. Die Prozentzahl ist somit ein geschätzter Anteil an einem definierten Arbeitskorb innerhalb von Anthropic.

Für die Einstufung verwendet Anthropic eine Skala mit sechs Automatisierungsstufen. „AI leads“, die für die 26 Prozent maßgebliche Stufe, bedeutet: Das Modell erledigt den größten Teil einer abgegrenzten Aufgabe durchgängig nach einer übergeordneten Anweisung, während ein Mensch die Arbeit überwacht. Erst die höchste Stufe würde einen Ablauf ohne Menschen in der Arbeitsschleife beschreiben.

Diese Unterscheidung erklärt auch den scheinbaren Widerspruch zwischen weitgehender Aufgabenbearbeitung und fehlender Autonomie. „End-to-end“ bezieht sich auf den Anfang und das Ende einer bereits abgegrenzten Aufgabe. Der Ausdruck sagt nichts darüber aus, wer die Forschungsagenda setzt, Trainingsziele auswählt, Rechenressourcen zuteilt oder entscheidet, ob ein Ergebnis in ein neues Modell einfließt.

Warum 90 Prozent Zusammenarbeit keine 90 Prozent Autonomie sind

Der Wert von mehr als 90 Prozent verwendet eine niedrigere Schwelle als die 26-Prozent-Zahl. Er schließt Arbeit ein, bei der Claude größere Teile unter enger menschlicher Anleitung übernimmt. Die von Claude „geführten“ Aufgaben sind in diesem größeren Anteil bereits enthalten; beide Werte lassen sich daher nicht addieren.

Für die Frage nach Selbstverbesserung ist nicht allein entscheidend, wie viele Arbeitsschritte ein Modell ausführt. Ebenso wichtig ist, wer Probleme auswählt, Erfolgskriterien festlegt, Ergebnisse bewertet und über den nächsten Versuch entscheidet. Solange diese Funktionen bei Menschen liegen, beschreibt die Kennzahl eine weitreichende Automatisierung von Forschungsarbeit, aber keinen geschlossenen autonomen Verbesserungsprozess.

Anthropic verwendet „rekursive Selbstverbesserung“ für den weitergehenden Fall, in dem ein Modell seinen leistungsfähigeren Nachfolger vollständig autonom baut. Die veröffentlichten Werte sollen zeigen, wie sich die Entwicklung in diese Richtung verändert. Sie belegen jedoch nicht, dass dieser Zustand bereits erreicht ist.

30.000 Agenten verändern die Aufgabe der Aufsicht

Die Größenordnung wird an einer zweiten Kennzahl sichtbar: Im August waren auf Anthropics meistgenutzter interner Plattform gleichzeitig rund 30.000 Agenten mit Forschungs- und Entwicklungsarbeit beschäftigt. Laut dem Reuters-Bericht über die Messwerte wurde jede dort erfasste Aktion vor ihrer Ausführung geprüft; von mehr als einer Milliarde Entscheidungen blockierte der Online-Monitor etwa eine von 47.000.

Die 30.000 stehen nicht für ebenso viele eigenständige Modelle oder digitale Forschende. Gemeint sind parallel laufende Agenteninstanzen auf einer bestimmten internen Plattform. Die Messung erfasst außerdem nur diese Umgebung und erlaubt daher keine Aussage über sämtliche automatisierten Aktivitäten des Unternehmens.

Auch die vollständige technische Erfassung aller Aktionen ist nicht mit vollständiger inhaltlicher Kontrolle gleichzusetzen. Ein Monitor kann eine Handlung passieren lassen, nachträglich markieren oder blockieren. Die niedrige Blockierungsquote zeigt lediglich, wie häufig das vorgeschaltete System eingriff; sie beweist nicht, dass jede zugelassene Entscheidung richtig, sicher oder wissenschaftlich nützlich war.

Mit zunehmender Zahl parallel arbeitender Agenten verschiebt sich die menschliche Rolle: Forschende müssen nicht mehr jeden einzelnen Arbeitsschritt selbst ausführen, bleiben aber für Aufgabenverteilung, Grenzfälle, Eskalationen und Freigaben zuständig. Genau deshalb misst Anthropic neben dem Automatisierungsgrad auch die Abdeckung, Geschwindigkeit und Eskalationswege der Überwachung.

Die Methodik setzt der Schlagzeile Grenzen

Der Index beruht auf internen Arbeitsaufzeichnungen, die Claude-Agenten sammelten, strukturierten und bewerteten. Fachleute aus den jeweiligen Arbeitsbereichen lieferten Vergleichsurteile. Damit entsteht eine doppelte Einschränkung: Das Unternehmen bewertet seine eigene Automatisierung, und Modelle desselben Unternehmens wirken an dieser Bewertung mit.

Besonders die Grenze zwischen „arbeitet mit“ und „führt“ bleibt eine Ermessensfrage. Zwei Beobachter können denselben Ablauf unterschiedlich einstufen, wenn das Modell die Umsetzung übernimmt, die entscheidende Idee oder Korrektur aber von einem Menschen stammt. Die Prozentwerte sind deshalb keine naturwissenschaftlich exakte Messung und ohne gemeinsame Definitionen nicht direkt mit Angaben anderer KI-Labore vergleichbar.

Anthropic schlägt insgesamt drei Messbereiche vor: den KI-Anteil an Forschung und Entwicklung, die Aufsicht über Agentenhandlungen sowie die Verteilung von Rechenressourcen. Zusammen sollen sie nicht nur zeigen, wie viel Arbeit automatisiert wird, sondern auch, ob Kontrolle und Sicherheitsaufwand mit diesem Wachstum Schritt halten.

Was nach der Veröffentlichung offenbleibt

Bestätigt ist, dass Claude innerhalb von Anthropics eigener Modellentwicklung einen erheblichen Anteil klar abgegrenzter Aufgaben übernimmt. Nicht belegt ist, welchen Anteil Claude an der grundlegenden wissenschaftlichen Richtung hat oder wie stark die gemessene Automatisierung Qualität und Entwicklungstempo eines konkreten künftigen Modells verändert.

Es fehlen außerdem vergleichbare, unabhängig geprüfte Zeitreihen anderer führender Labore. Erst gemeinsame Definitionen und externe Kontrollen würden zeigen, ob die Werte unternehmensübergreifend belastbar sind. Bis dahin beschreibt die 26-Prozent-Zahl einen deutlichen Ausbau überwachter Forschungsautomatisierung – nicht Claude als autonomes System, das sich bereits selbst weiterentwickelt.

Lesen Sie auch:

Teilen:

Newsletter abonnieren

Erhalten Sie die neuesten Nachrichten zu Web3, KI und Krypto direkt in Ihren Posteingang.

0