KI & Automatisierung

Claude führt 26 Prozent der Modellforschung – autonom ist es noch nicht

|Autor: QUASA-Redaktion|5 Min. Lesezeit
Claude führt 26 Prozent der Modellforschung – autonom ist es noch nicht

Anthropic hat am 17. September 2026 erstmals einen Index dazu veröffentlicht, wie weit Claude die interne Entwicklung künftiger KI-Modelle übernimmt. Wie der Bericht von Associated Press bestätigt, erreichte Claude im August bei 26 Prozent der gewichteten Forschungs- und Entwicklungsarbeit die Stufe „führt“; mehr als 90 Prozent lagen mindestens auf der Stufe „arbeitet mit“. Vollständig autonom war das System in keinem untersuchten Bereich.

Die Veröffentlichung vom 17. September beschreibt damit einen deutlichen Automatisierungsschub innerhalb von Anthropic, aber keine selbstständige KI-Forschung ohne Menschen. Die 26 Prozent beziehen sich weder auf die weltweite Modellforschung noch auf den Anteil wissenschaftlicher Entscheidungen, die Claude trifft. Gemessen wurde, wie stark Claude an einem nach Arbeitszeit gewichteten Korb interner Aufgaben beteiligt ist.

„Führt“ bedeutet weiterhin menschliche Aufsicht

Der starke Begriff stammt aus einer sechsstufigen Automatisierungsskala. Auf der vorletzten Stufe AL4 kann ein KI-System den größten Teil einer Aufgabe nach einer übergeordneten Anweisung durchgängig bearbeiten. Ein Mensch gibt jedoch das Ziel vor, beaufsichtigt den Ablauf und entscheidet über die Freigabe. Erst AL5 bezeichnet einen vollständig autonomen Prozess ohne Menschen in der Kontrollschleife.

Die 26-Prozent-Zahl sagt deshalb nicht aus, dass Claude die Forschungsagenda bestimmt oder ein Viertel eines neuen Modells allein entwickelt. Sie bedeutet, dass die von Anthropic als AL4 eingestuften Tätigkeiten zusammen 26 Prozent des gewichteten Arbeitskorbs ausmachen. Auch bei diesen Tätigkeiten bleiben Auswahl, Richtung und abschließende Entscheidung menschliche Aufgaben.

Das erklärt zugleich den zweiten Teil des Titels: Claude arbeitet an Systemen mit, die auf seine Generation folgen können, verbessert sich aber nach diesen Daten nicht autonom. Anthropic selbst definiert vollständig autonome rekursive Selbstverbesserung enger als die nun gemessene Stufe. Im veröffentlichten Index wurde diese höchste Stufe nirgends erreicht.

Claude half, den eigenen Automatisierungsgrad zu bestimmen

Die Kennzahl ist eine unternehmensinterne Messung, deren Datenerhebung und Bewertung teilweise auf Claude beruhen. Der Methodenanhang von Anthropic beschreibt, dass für jede Juliwoche 20 Prozent der Beschäftigten aus den am Modellzyklus beteiligten Abteilungen zufällig ausgewählt wurden. Ein Claude-Agent leitete aus interner Kommunikation und Dokumentation rund 15.000 einzelne Tätigkeiten ab; daraus entstand eine Hierarchie mit 542 Kategorien.

Ein weiterer Claude-Agent untersuchte, wie die Arbeit in jeder Kategorie ausgeführt wird und welchen Anteil KI daran hat. Anschließend ordnete ein separates Claude-Modell die Belege einer Automatisierungsstufe zu. Beschäftigte bewerteten ihre jeweiligen Arbeitsbereiche zusätzlich, ohne vorher die Belege oder Modellurteile zu sehen.

Die Übereinstimmung zeigt sowohl eine gewisse Stabilität als auch eine wichtige Unschärfe: Modell und Mensch wählten in 59 Prozent der Vergleiche exakt dieselbe Stufe; zwei menschliche Bewertungen stimmten zu 35 Prozent genau überein. In 97 Prozent der Fälle lagen Modell und Mensch höchstens eine Stufe auseinander. Gerade eine Stufe trennt jedoch „arbeitet mit“ von „führt“ und entscheidet damit darüber, ob eine Tätigkeit in die auffällige 26-Prozent-Kategorie fällt.

Gewichtet wurden die Kategorien nach dem geschätzten Zeitanteil der Beschäftigten. Aufgaben, an denen viele Menschen oder viele Arbeitsstunden hängen, zählen deshalb stärker. Der Index misst folglich den Automatisierungsgrad eines festgelegten Arbeitskorbs und nicht die Zahl der Aufgaben, die Bedeutung einzelner Forschungsergebnisse oder Claudes Einfluss auf strategische Entscheidungen.

30.000 Agenten und sechs Prozent Sicherheitsrechenleistung

Anthropic veröffentlichte neben dem Automatisierungsindex zwei weitere Messbereiche. Eine Einordnung von The Decoder nennt für August rund 30.000 gleichzeitig aktive Forschungs- und Engineering-Agenten auf Anthronics meistgenutzter interner Plattform; in einer Stichprobenwoche im Juli entfielen etwa sechs Prozent der KI-Forschungsrechenleistung auf Sicherheitsarbeit, bei der KI-gestützten KI-Forschung waren es rund zwölf Prozent.

Die Agentenzahl bezeichnet parallele Softwareinstanzen auf einer bestimmten Plattform, nicht 30.000 autonome digitale Beschäftigte. Anthropic erfasst deren Aktionen mit Online-Monitoren vor der Ausführung und mit nachgelagerten Kontrollsystemen. Diese Abdeckung zeigt, dass eine technische Aufsicht existiert; sie beweist nicht, dass jedes problematische Verhalten erkannt oder jede fachlich falsche Entscheidung verhindert wird.

Auch die Rechenanteile benötigen einen engen Nenner. Die sechs Prozent beziehen sich auf die gesamte für KI-Forschung und -Entwicklung eingesetzte Rechenleistung der untersuchten Woche, die zwölf Prozent nur auf KI-gestützte KI-Forschung. Beide Werte sind daher nicht austauschbar. Zudem kann konzeptionell aufwendige Sicherheitsforschung wenig Rechenleistung benötigen, während ein einzelner Trainingslauf sehr viel davon verbraucht.

Noch fehlt ein belastbarer Vergleich zwischen Laboren

Die drei Messbereiche ergeben eine Momentaufnahme von Automatisierung, Agentenaufsicht und Ressourceneinsatz bei Anthropic. Sie machen sichtbar, dass Claude inzwischen größere interne Arbeitspakete unter Aufsicht bearbeiten kann. Sie belegen jedoch weder ein Forschungslabor ohne menschliche Steuerung noch eine autonome Kette, in der ein Modell selbstständig seinen Nachfolger entwirft, prüft und freigibt.

Für einen Branchenvergleich fehlen gemeinsame Definitionen und einheitliche Prüfverfahren. Hinzu kommt, dass Anthropic das zu bewertende Modellsystem auch für Datenerhebung, Klassifikation und Einstufung einsetzte. Die internen Arbeitsunterlagen sind für Außenstehende nicht vollständig einsehbar, und andere Labore veröffentlichen bislang keine direkt kompatiblen Werte.

Anthropic will die Messungen fortsetzen und unabhängigen Prüfern Zugang zu internen Prozessen, Systemen und Daten geben. Ob daraus eine belastbare Kennzahl für die gesamte Branche wird, hängt nun von externen Prüfungen, stabilen Kategorien und vergleichbaren Veröffentlichungen anderer Entwickler ab. Bis dahin sind die 26 Prozent ein aufschlussreicher Anthropic-interner Wert – kein Nachweis autonomer Selbstverbesserung.

Lesen Sie auch:

Teilen:

Newsletter abonnieren

Erhalten Sie die neuesten Nachrichten zu Web3, KI und Krypto direkt in Ihren Posteingang.

0