Anthropic mesure son automatisation : 26 % du travail au niveau où l'IA mène, noté par un modèle maison
D'après Anthropic - Measurements for understanding the pace of AI development inside frontier labs et The Decoder - Anthropic wants you to know Claude leads a quarter of its research, relayé par The Decoder
Image : générée (Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- L'échelle vient d'Epoch AI et va de AL0, aucune implication de l'IA, à AL5, où l'IA opère en pleine autonomie sans humain dans la boucle. Le 26 % correspond à AL4 : l'IA accomplit l'essentiel d'une tâche de bout en bout à partir d'une consigne générale, pendant que l'humain supervise.
- Claude n'atteint AL5 sur aucun sous-ensemble mesuré. En revanche, plus de 90 % du travail se situe au niveau où l'IA collabore, ou au-dessus.
- C'est Claude qui a noté Claude, et Anthropic l'écrit elle-même : le modèle juge pourrait commettre les mêmes erreurs que le modèle qu'il évalue.
- Environ 30 000 agents travaillent en même temps sur sa plateforme interne la plus utilisée. Toutes leurs actions passent par un moniteur avant exécution : sur plus d'un milliard de décisions en août 2026, 0,002 % ont été bloquées, soit environ une sur 47 000.
- Le calcul consacré à la sûreté est de 6 % sur la recherche en IA, mais de 12 % sur la recherche en IA PILOTÉE par l'IA. Le relais anglophone ne retient que le premier : les deux chiffres n'ont pas le même dénominateur.
Pourquoi ça compte
Un chiffre qui dit « l'IA mène un quart du travail » se retient vite et se déforme aussi vite. Ce qui distingue cette publication, c'est qu'Anthropic fournit elle-même de quoi le relativiser : l'échelle employée, le niveau jamais atteint, et l'identité du juge. The Decoder ajoute une lecture qui lui appartient : ce nombre sert deux fois l'entreprise, comme argument de produit et comme appui à l'appel de son dirigeant à ralentir la course.
Chiffre-clé
0,002 % : la part des décisions d'agents bloquées par le moniteur en temps réel d'Anthropic, sur plus d'un milliard de décisions analysées en août 2026, soit environ une sur 47 000, selon son propre billet de mesures.
Citation
« the “judge” model could make the same kinds of errors as the model it is checking » Anthropic, à propos de sa propre méthode de notation, dans son billet de mesures
Action concrète
Si tu reprends le 26 %, garde les deux précisions qui vont avec : « mène » est un niveau d'échelle et non une autonomie, et la note vient d'un modèle de la même maison. Sans elles, le chiffre affirme quelque chose que sa source ne dit pas.
Repères datés
- 8 septembre 2026 - Le directeur scientifique d'OpenAI dit que la surveillance s'affaiblit et réclame des seuils imposés de l'extérieur.
- 18 septembre 2026 - Deux responsables de la sûreté chez Google DeepMind avertissent que la fenêtre sur le raisonnement des modèles se referme.
Fondée sur la source originale
Sources
- Anthropic - Measurements for understanding the pace of AI development inside frontier labs : Billet de mesures, texte dont la fiche est issue. Données arrêtées à août 2026.
- The Decoder - Anthropic wants you to know Claude leads a quarter of its research : Relais du 18 septembre 2026.
- Relais média : The Decoder → · Lire en français
🔧 Outils mentionnés