Analyse · Recherche
Claude pilote 26 % de la R&D d'Anthropic : le premier indice qui chiffre l'IA qui construit l'IA
Anthropic publie un indice d'automatisation de sa recherche : Claude « mène » 26 % des travaux en août 2026, contre moins de 1 % en février.

Une entreprise d'IA vient de mettre un chiffre sur une hypothèse que le secteur répète depuis deux ans : l'IA accélère désormais sa propre fabrication. Dans un billet publié le 17 septembre 2026, l'Anthropic Institute a dévoilé un « indice d'automatisation de la R&D » qui mesure la part du travail de recherche et développement de l'entreprise effectuée par ses propres modèles. Verdict : en août 2026, Claude « mène » 26 % de cette R&D, contre moins de 1 % en février. Une pente de sept mois qui, si elle se prolonge, change la nature même de la course aux modèles.
Le mot « mène » n'est pas anodin. Anthropic s'appuie sur une échelle d'automatisation développée avec Epoch AI, graduée de AL0 à AL5. AL0 signifie aucune implication de l'IA ; AL3 (« collabore ») correspond à une IA qui réalise une portion substantielle d'une tâche sous supervision rapprochée ; AL4 (« mène ») décrit un système qui prend en charge l'essentiel du travail à partir d'une consigne de haut niveau, l'humain gardant un rôle de contrôle ; AL5 est l'autonomie totale sans humain dans la boucle. Le chiffre de 26 % agrège des milliers de tâches pondérées selon ce barème.
Ce que « 26 % » veut réellement dire
La méthodologie mérite qu'on s'y attarde, parce que c'est elle qui distingue cet indice d'un simple argument marketing. Anthropic a cartographié environ 15 000 tâches granulaires réalisées en juillet 2026, réparties dans 542 catégories hiérarchiques, puis a fait noter le niveau d'automatisation de chacune. L'accord entre évaluateurs humains et modèles atteint 59 % de correspondance exacte et 97 % à un niveau près — autrement dit, humains et IA sont rarement en désaccord de plus d'un cran sur l'échelle.
Deux nuances corrigent l'effet d'annonce. D'abord, Claude n'opère à AL5 — l'autonomie complète — sur aucun sous-ensemble mesuré de la R&D : il n'y a pas de recherche entièrement déléguée à la machine. Ensuite, si Claude « participe » à plus de 90 % des travaux, participer va du simple coup de main ponctuel au pilotage. Le chiffre de 26 % agrège ces intensités très variables ; il ne dit pas qu'un quart des chercheurs a disparu, mais qu'un quart du volume de travail, pondéré par l'autonomie, passe désormais par les modèles.
30 000 agents sous surveillance permanente
Le second enseignement de l'indice est opérationnel. Anthropic dit faire tourner environ 30 000 agents à tout instant sur sa plateforme interne de recherche et d'ingénierie. À cette échelle, la question n'est plus « l'IA peut-elle aider ? » mais « comment garde-t-on la main sur 30 000 exécutants numériques ? ».
La réponse tient dans un double filet de sécurité que l'entreprise détaille. Un moniteur en ligne inspecte 100 % des actions des agents avant leur exécution et en bloque environ une sur 47 000. Un système hors ligne repasse ensuite l'intégralité des traces après coup et signale de l'ordre de 100 000 transcriptions par semaine pour examen. Sur la semaine du 13 au 20 juillet 2026, environ 6 % de la puissance de calcul consacrée à la R&D est allée aux travaux de sécurité. C'est cette instrumentation — mesurer, surveiller, tracer — qui distingue l'exercice d'une simple opération de communication.
Pourquoi l'Europe devrait lire ce document
Pour un lecteur français ou européen, l'intérêt de cet indice dépasse le cas Anthropic. Il pose une métrique reproductible sur une question centrale de l'AI Act et des débats sur la sécurité des modèles : à quel moment un système « mène » un travail au lieu d'assister un humain ? La bascule de AL3 à AL4 — de « collabore » à « mène » — est exactement le seuil où les régimes de responsabilité changent de nature. Un régulateur qui veut encadrer les usages à haut risque a besoin d'un vocabulaire pour désigner ce degré d'autonomie ; l'échelle AL0-AL5 en fournit une ébauche.
L'autre signal est concurrentiel. Si l'automatisation de la R&D compose — l'IA qui aide à construire une IA qui aide mieux à construire la suivante —, l'avantage se joue moins sur le talent brut que sur la capacité à orchestrer des flottes d'agents en toute sûreté. C'est un terrain où les laboratoires européens, Mistral en tête, partent avec moins de calcul mais où la maîtrise des garde-fous devient un actif autant qu'une contrainte réglementaire.
Reste la limite que tout observateur doit garder en tête : l'indice est auto-déclaré. C'est Anthropic qui mesure Anthropic, avec une méthodologie que nul tiers n'a encore répliquée. La valeur du document n'est pas dans le chiffre de 26 % — impossible à auditer de l'extérieur — mais dans le cadre qu'il propose. Si l'échelle AL0-AL5 devient un standard partagé, la prochaine étape logique serait un indice comparable, mesuré par un tiers indépendant, sur l'ensemble des grands laboratoires. C'est précisément le genre de brique que réclamerait un organisme de standards crédible.