Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

APEX-Agents

APEX-Agents

APEX-Agents

Aussi appelé : ApexBench · APEX Agents · AI Productivity Index for Agents

Terme IA Intermédiaire 🤖 Intelligence artificielle

Mis à jour le

En bref

APEX-Agents est un banc d'essai de Mercor qui mesure si un agent d'IA réussit entièrement des tâches professionnelles longues de finance, de conseil et de droit, sans accès au web.

📖 Définition

APEX-Agents est un banc d'essai créé par l'entreprise Mercor pour mesurer si un agent d'intelligence artificielle peut accomplir de vraies tâches professionnelles longues, en passant d'une application à l'autre comme le ferait un employé. Il compte 480 tâches réparties également entre trois métiers : banque d'investissement, conseil en management et droit des affaires, conçues par 256 experts de ces domaines.

Chaque tâche se déroule dans l'un des 33 « mondes » de travail simulés, qui contiennent en moyenne 166 fichiers : courriels, clavardage, calendrier, documents, PDF, tableurs, présentations, système de fichiers et exécution de code. La recherche sur le web y est volontairement coupée, pour que deux exécutions restent comparables.

La mesure principale, appelée Pass@1, est la probabilité qu'un agent réussisse ENTIÈREMENT une tâche du premier coup. Chaque tâche porte une grille de critères tous indispensables : un seul critère manqué et la tâche est un échec, une réussite partielle ne compte pour rien. C'est ce qui explique des scores très bas comparés aux autres bancs d'essai.

💬 En termes simples

Un examen pratique de fin de stage : le dossier est livré complet, ou il ne passe pas.

🎯 Exemple concret

Dans ses notes de version du 21 août 2026, DeepSeek annonce un score de 36,5 à ApexBench (Pass@1) pour son modèle expérimental V4-Flash-Vision-Exp.

💡 Le saviez-vous ?

Les experts estimaient chaque tâche à 1,82 heure. L'échantillon réellement exécuté en a pris 1,37 : on surestime la durée de son propre métier.

❓ Questions fréquentes

Pourquoi voit-on « ApexBench » alors que le nom officiel est « APEX-Agents » ?
« ApexBench » est un raccourci employé par des fabricants de modèles dans leurs fiches et leurs graphiques. Le nom officiel, celui de l'article de recherche de Mercor, est APEX-Agents, où APEX développe « AI Productivity Index for Agents ».
Un agent qui réussit une tâche à moitié obtient-il des points ?
Non, et c'est le coeur de la mesure. Chaque tâche porte une grille de critères tous obligatoires : un seul manqué, la tâche entière est comptée en échec. Un score de 36 % ne veut donc pas dire « 36 % du travail fait », mais « 36 % des tâches livrées au complet ».
Qui corrige les réponses des agents ?
Un modèle de langage sert de juge, critère par critère. Les auteurs rapportent une exactitude de 98,5 % de ce juge par rapport à des étiquettes posées par des humains. Ce n'est donc pas une correction humaine, mais elle est mesurée contre elle.

🔗 Termes liés

🏷️ Catégorie parente

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !