Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Anthropic mesure son automatisation : 26 % du travail au niveau où l'IA mène, noté par un modèle maison

3 min de lecture · The Decoder · 18 sept. 2026

D'après Anthropic - Measurements for understanding the pace of AI development inside frontier labs et The Decoder - Anthropic wants you to know Claude leads a quarter of its research, relayé par The Decoder

Anthropic mesure son automatisation : 26 % du travail au niveau où l'IA mène, noté par un modèle maison

Image : générée (Gemini)

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • L'échelle vient d'Epoch AI et va de AL0, aucune implication de l'IA, à AL5, où l'IA opère en pleine autonomie sans humain dans la boucle. Le 26 % correspond à AL4 : l'IA accomplit l'essentiel d'une tâche de bout en bout à partir d'une consigne générale, pendant que l'humain supervise.
  • Claude n'atteint AL5 sur aucun sous-ensemble mesuré. En revanche, plus de 90 % du travail se situe au niveau où l'IA collabore, ou au-dessus.
  • C'est Claude qui a noté Claude, et Anthropic l'écrit elle-même : le modèle juge pourrait commettre les mêmes erreurs que le modèle qu'il évalue.
  • Environ 30 000 agents travaillent en même temps sur sa plateforme interne la plus utilisée. Toutes leurs actions passent par un moniteur avant exécution : sur plus d'un milliard de décisions en août 2026, 0,002 % ont été bloquées, soit environ une sur 47 000.
  • Le calcul consacré à la sûreté est de 6 % sur la recherche en IA, mais de 12 % sur la recherche en IA PILOTÉE par l'IA. Le relais anglophone ne retient que le premier : les deux chiffres n'ont pas le même dénominateur.

Pourquoi ça compte

Un chiffre qui dit « l'IA mène un quart du travail » se retient vite et se déforme aussi vite. Ce qui distingue cette publication, c'est qu'Anthropic fournit elle-même de quoi le relativiser : l'échelle employée, le niveau jamais atteint, et l'identité du juge. The Decoder ajoute une lecture qui lui appartient : ce nombre sert deux fois l'entreprise, comme argument de produit et comme appui à l'appel de son dirigeant à ralentir la course.

Chiffre-clé

0,002 % : la part des décisions d'agents bloquées par le moniteur en temps réel d'Anthropic, sur plus d'un milliard de décisions analysées en août 2026, soit environ une sur 47 000, selon son propre billet de mesures.

Citation

« the “judge” model could make the same kinds of errors as the model it is checking » Anthropic, à propos de sa propre méthode de notation, dans son billet de mesures

Action concrète

Si tu reprends le 26 %, garde les deux précisions qui vont avec : « mène » est un niveau d'échelle et non une autonomie, et la note vient d'un modèle de la même maison. Sans elles, le chiffre affirme quelque chose que sa source ne dit pas.

Repères datés

Fondée sur la source originale

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !