OpenAI revendique 3,1 journées d’agent par journée humaine en recherche

Le 6 septembre 2026, OpenAI a publié un état des lieux de l’usage des agents de programmation dans son organisation de recherche. Dans sa publication méthodologique, l’entreprise indique qu’à la mi-août elle cumulait 3,1 journées d’exécution d’agents par journée de travail humain, les deux volumes étant ramenés à des journées standard de huit heures.
Ce ratio publié le 6 septembre décrit une quantité de calcul exécutée, souvent en parallèle, et non trois journées humaines de résultats scientifiques validés. Une analyse de Matt McDonagh parue le même jour reprend cette distinction : une journée d’agent peut comprendre une mauvaise piste, du travail répété ou une production qui devra être corrigée.
Le ratio de 3,1 mesure une durée cumulée

Le numérateur additionne le temps pendant lequel les agents travaillent dans l’organisation de recherche. Plusieurs sessions peuvent fonctionner simultanément pour un même chercheur, tandis que des agents directement sollicités peuvent lancer des sous-agents. Le ratio peut donc dépasser une journée humaine sans qu’aucun système ait produit, à lui seul, l’équivalent de plusieurs journées de recherche utile.
Cette mesure renseigne d’abord sur l’intensité d’utilisation et sur la capacité à faire avancer plusieurs opérations en parallèle. Elle ne mesure ni le nombre d’hypothèses retenues, ni la qualité des expériences, ni le temps nécessaire à leur vérification, ni leur contribution finale aux performances d’un modèle. Assimiler 3,1 journées d’exécution à une productivité multipliée par 3,1 serait donc une extrapolation que les données publiées ne permettent pas.
La comparaison comporte en outre deux agrégats de nature différente. Le temps humain correspond au travail des membres de l’organisation, alors que le temps d’agent peut se déployer de manière concurrente et produire aussi bien des résultats exploitables que des échecs. Le ratio signale un changement d’échelle de l’automatisation, mais pas son rendement scientifique.
Le « stagiaire de recherche automatisé » reste dirigé par l’humain

OpenAI estime également avoir atteint son jalon de « stagiaire de recherche automatisé ». Sa définition reste circonscrite : un système capable d’accomplir, sous la direction d’un humain, une tâche de recherche bien définie qui demanderait plusieurs jours à un chercheur qualifié. Elle ne décrit pas un chercheur autonome choisissant son propre programme, évaluant seul la valeur de ses résultats et décidant de leur déploiement.
Les agents sont employés à plusieurs étapes du cycle de R&D : construction de code et de jeux de données, exécution et surveillance d’expériences, analyse, assistance technique et communication des résultats. La planification de haut niveau ne représente encore qu’une fraction minime de leur production. Les humains continuent de fixer les priorités, de choisir les idées à poursuivre, d’interpréter les observations et de décider si un système doit être amplifié, interrompu ou déployé.
La réussite elle-même dépend encore fréquemment d’un pilotage. Dans l’échantillon interne, plus de la moitié des tâches réussies estimées à quatre à huit heures de travail humain ont nécessité au moins une intervention au cours des six mois étudiés. Les résultats incertains ont été exclus du calcul des taux de réussite, tout comme les points reposant sur moins de cinquante sessions ou moins de cinquante utilisateurs uniques : ces filtres interdisent d’étendre mécaniquement les taux affichés à l’ensemble des usages.
Le code et les expériences augmentent, pas la preuve causale
Les indicateurs d’activité évoluent dans le même sens que le temps d’exécution : les chercheurs contribuent davantage de code et lancent plus d’expériences par expérimentateur actif. Cela montre qu’un volume supérieur de travail technique traverse le laboratoire. Cela ne dit pas combien d’essais aboutissent à une amélioration robuste, reproductible et finalement intégrée à un modèle.
L’adoption accrue de Codex est corrélée à la hausse des expériences, mais plusieurs facteurs changent simultanément. La capacité de calcul disponible a fortement progressé, tout comme les modèles accessibles, les outils internes, les pratiques de délégation et potentiellement la composition de la population observée. Faute de groupe de comparaison et de données permettant d’isoler ces variables, les courbes ne démontrent pas quelle part de l’augmentation est causée par les agents.
Le périmètre mérite la même prudence. Le terme « chercheur » inclut aussi des personnes qui construisent l’infrastructure, gèrent des projets ou soutiennent l’activité scientifique. Les métriques couvrent la majeure partie de l’utilisation des agents de programmation, mais pas sa totalité. Il s’agit donc d’une photographie interne produite dans un environnement en évolution, et non d’un protocole reproduit indépendamment dans plusieurs laboratoires.
La rupture de fin juillet n’a pas d’explication publique

Un autre graphique valorise l’inférence consommée aux tarifs publics de l’API. La médiane par chercheur accélère nettement à partir de la fin juillet et dépasse 600 dollars par jour à la mi-août ; Simon Willison relève cette rupture, mais présente le possible accès interne à un nouveau modèle comme sa propre hypothèse, sans preuve publique de causalité.
Cette valorisation ne correspond pas nécessairement à une facture réglée par chaque chercheur, ni à un rendement financier. Elle convertit un volume d’inférence selon des prix de référence. Sans détail sur les coûts internes, les tâches abandonnées, le temps de supervision et la valeur des résultats conservés, elle mesure surtout l’ampleur des ressources mobilisées.
Une automatisation visible, une accélération scientifique encore à établir
Les éléments publics établissent que les agents occupent désormais une place importante dans l’exécution quotidienne de la recherche d’OpenAI. Ils travaillent en parallèle, prennent en charge des tâches plus longues et plus variées, et peuvent accomplir sous supervision certaines missions bien délimitées qui auraient demandé plusieurs jours à une personne qualifiée.
Ils n’établissent pas un gain scientifique égal au ratio de 3,1. Une validation indépendante des données brutes, une mesure complète du temps humain consacré au pilotage et à la vérification, ainsi qu’un lien entre activité automatisée et améliorations reproductibles restent absents. La portée du jalon dépendra donc des prochaines mesures publiées : non seulement le temps pendant lequel les agents s’exécutent, mais la proportion de résultats fiables qu’ils produisent, leur coût total et l’intervention humaine nécessaire pour les obtenir.
À lire aussi:
Abonnez-vous à notre newsletter
Recevez directement les dernières actualités sur le Web3, l’IA et les cryptomonnaies.