Technologie

Claude dirige 26 % de la R&D d’Anthropic, mais ne travaille pas seul

|Auteur: Équipe éditoriale de QUASA|5 min de lecture| 1
Claude dirige 26 % de la R&D d’Anthropic, mais ne travaille pas seul

Le 18 septembre 2026, l’Associated Press a rendu compte des indicateurs publiés la veille par Anthropic : selon le reportage de l’agence, Claude « dirige » 26 % de la recherche et développement consacrée aux modèles d’IA de l’entreprise. Le terme signifie que Claude peut accomplir l’essentiel d’une tâche depuis une consigne de haut niveau, mais qu’un humain continue de superviser le travail.

Claude ne construit donc pas son successeur sans intervention humaine. La synthèse publiée par Quartz confirme que le modèle intervient au moins comme collaborateur dans plus de 90 % du travail mesuré, tandis qu’aucune catégorie évaluée n’atteint l’autonomie complète.

« Diriger » reste une forme d’automatisation supervisée

L’échelle distingue successivement l’absence d’intervention de l’IA, une intervention minimale, l’assistance, la collaboration, la direction et l’autonomie. La différence essentielle ne tient pas seulement à la quantité de travail confiée au modèle, mais aussi au rôle que conserve l’humain.

Au stade de la collaboration, Claude réalise de grandes parties d’une tâche sous une direction humaine étroite. L’humain continue notamment de décomposer le problème, de guider le processus ou de reprendre certaines étapes.

Quand Claude dirige, il reçoit une consigne plus générale et mène la majeure partie du travail de bout en bout. Une personne reste néanmoins dans la boucle pour surveiller le déroulement, apprécier le résultat et prendre les décisions qui ne sont pas déléguées.

L’autonomie complète correspond à une situation plus exigeante : le système opère sans humain dans la boucle. Le chiffre central ne mesure donc ni la part des salariés remplacés ni la proportion de l’entreprise administrée par Claude. Il représente la part pondérée du panier de tâches placée au niveau « direction », encore supervisé.

Le pourcentage vient d’un panier de tâches internes

La méthodologie détaillée par Anthropic emploie l’échelle AL0–AL5 et part d’un échantillon aléatoire couvrant chaque semaine 20 % du personnel des départements inclus dans la boucle de R&D en juillet 2026 : Claude en a tiré environ 15 000 tâches, ensuite organisées en un arbre de 542 nœuds, dont 378 feuilles, pour mesurer la situation d’août 2026. Cet arbre a été figé afin que les relevés successifs portent sur le même panier de travail.

Le résultat n’est pas un simple rapport entre des projets terminés par Claude et un nombre total de projets. Les catégories sont pondérées par une approximation du temps humain qui leur est consacré : le poids hebdomadaire attribué à chaque personne est réparti entre les tâches auxquelles elle a participé.

Cette pondération donne davantage d’importance aux activités qui mobilisent une plus grande part du personnel observé. Elle ne mesure toutefois ni la valeur scientifique d’une tâche, ni sa difficulté intrinsèque, ni son influence sur le futur modèle. Deux catégories classées au même niveau d’automatisation peuvent ainsi avoir des conséquences très différentes pour la recherche.

Le panier est lui-même une reconstruction des activités visibles dans Slack et dans plusieurs sources de documentation interne. Il décrit le travail avec la granularité retenue par l’entreprise, plutôt qu’une liste universelle des opérations nécessaires pour développer un modèle d’IA.

Claude contribue à fabriquer et à noter la mesure

L’indice n’est pas une évaluation entièrement extérieure au système étudié. Un agent Claude extrait les activités des traces internes, puis Claude organise les tâches en arborescence. Pour chaque catégorie, un autre agent rassemble des éléments sur la manière dont le travail est effectué, avant qu’un juge Claude distinct attribue un niveau d’automatisation.

Cette chaîne rend possible l’analyse d’un grand volume d’activités internes, mais crée aussi un risque d’erreurs corrélées. Un modèle chargé de juger la contribution d’un système de la même famille peut partager certaines de ses limites, interpréter de façon similaire des preuves ambiguës ou tracer au même endroit la frontière entre collaboration et direction.

Des responsables humains des domaines concernés ont donc également noté l’automatisation de leur travail sans connaître les preuves réunies ni les appréciations produites par le modèle. Cette vérification montre une proximité globale entre les évaluations, mais aussi un désaccord réel dans les cas limites. Elle ne transforme pas l’indice interne en audit indépendant.

La formule selon laquelle Claude « construit son successeur » décrit ainsi une participation substantielle au processus de R&D, pas une boucle autonome d’auto-amélioration. La sélection du problème, la supervision, l’interprétation des résultats et les décisions de déploiement peuvent toujours relever d’humains, y compris lorsqu’une tâche est classée comme dirigée par l’IA.

Une comparaison entre laboratoires reste prématurée

L’indice dépend des outils internes d’Anthropic, de ses traces de travail, de sa définition des tâches, de sa pondération et de ses modèles évaluateurs. En l’absence de méthode commune, il n’est pas possible de placer directement ce résultat à côté d’un pourcentage éventuellement publié par un autre laboratoire et d’en déduire lequel automatise le plus sa recherche.

Une validation par un tiers ou par des modèles provenant d’autres développeurs réduirait certaines limites, mais supposerait un accès à des informations internes sensibles. Il faudrait aussi harmoniser la granularité des tâches, les critères de classement et la manière de comptabiliser le temps humain pour produire une comparaison défendable.

Le caractère figé du panier impose une autre prudence. Une hausse future montrerait que Claude automatise davantage les activités recensées lors de la constitution de cette base; elle ne révélerait pas automatiquement de nouvelles catégories de travail apparues depuis, ni les tâches vers lesquelles les chercheurs humains se seraient déplacés.

À ce stade, les données étayent donc une progression importante de l’automatisation supervisée chez Anthropic, mais pas une récursivité autonome. La portée du chiffre dépendra de sa reproduction dans le temps, de l’actualisation du panier et d’une validation suffisamment indépendante pour vérifier une mesure en partie construite et jugée par Claude lui-même.

À lire aussi:

Partager:

Abonnez-vous à notre newsletter

Recevez directement les dernières actualités sur le Web3, l’IA et les cryptomonnaies.

0