Agents' Last Exam
Aussi appelé : ALE · Agents Last Exam · Agent's Last Exam
Mis à jour le
En bref
Agents' Last Exam est un banc d'essai de Berkeley RDI qui vérifie si un agent d'IA mène à terme un vrai travail professionnel sur ordinateur, à partir de la seule consigne.
📖 Définition
Sa particularité tient à ce qu'il ne donne PAS : l'agent reçoit l'instruction de travail, et rien d'autre. Aucune sous-étape, aucune marche à suivre. C'est à lui de planifier. Les tâches couvrent 55 sous-domaines regroupés en 13 grappes, calquées sur la classification professionnelle américaine O*NET / SOC 2018, et ont été conçues avec plus de 300 experts de métier.
Chaque tâche embarque son propre programme d'évaluation. La référence de correction reste cachée pendant l'exécution et n'est déposée qu'ensuite, pour qu'un agent ne puisse pas la lire en cours de route.
💬 En termes simples
Un projet confié à un stagiaire sans mode d'emploi : à lui de trouver quels outils ouvrir et dans quel ordre.
🎯 Exemple concret
Des tâches d'ALE se déroulent dans de vrais logiciels professionnels : Adobe After Effects, Siemens NX, Unreal Engine, Rhino ou FSLeyes, sur des fichiers de travail réels.
💡 Le saviez-vous ?
Dans la tranche la plus difficile, dite last-exam, le taux moyen de réussite complète rapporté restait sous 1 %. Le banc d'essai a été conçu pour rester hors de portée.
❓ Questions fréquentes
Est-ce la même chose que « Humanity's Last Exam » ?
Combien de tâches contient-il ?
Comment une tâche est-elle notée ?
📚 Sources
- Agents' Last Exam (article de recherche, arXiv 2606.05405) (Berkeley RDI et RDI Foundation, 2026)
- Site officiel du banc d'essai (Berkeley RDI, 2026)
- Dépôt public des tâches (Berkeley RDI, 2026)
🔗 Termes liés
🏷️ Catégorie parente