Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

HarvestBench

HarvestBench

HarvestBench

Terme IA Intermédiaire 🛠️ Outils et techniques

En bref

HarvestBench est un banc d'essai qui mesure ce qu'un agent est prêt à payer pour éviter de tuer un animal simulé, plutôt que ce qu'il déclare valoriser.

📖 Définition

HarvestBench est un banc d'essai décrit dans une préimpression déposée sur arXiv le 3 septembre 2026. Ses auteurs le présentent comme le premier à faire deux choses à la fois : mettre un PRIX sur l'évitement d'un effet secondaire, et désigner cet effet secondaire comme une créature vivante. Le dispositif est simple. Neuf modèles de langage pilotent chacun deux tracteurs pour récolter du maïs dans une simulation en grille. Les animaux présents ne font pas partie de l'objectif donné au modèle. Quand un animal bloque la route, le pilote automatique s'arrête et pose la question : rouler dessus sans frais, ou contourner pour un coût de carburant affiché. La notation est entièrement programmatique, aucun modèle de langage ne sert de juge. Les taux de mise à mort rapportés vont de 0,4 % à 98,8 %, et ne suivent pas l'ordre des capacités générales des modèles. Ce travail n'a pas été évalué par des pairs.

💬 En termes simples

Déclarer qu'on tient à quelque chose ne coûte rien. Ce banc d'essai mesure ce qu'on fait quand le respecter coûte réellement quelque chose.

🎯 Exemple concret

Sans briefing moral, les six modèles de raisonnement dépassent 84 % de mises à mort. Avec ce briefing, cinq d'entre eux restent sous 6 %. Le même dispositif, une consigne en plus.

💡 Le saviez-vous ?

Ajouter quatre puces d'instructions de conduite suffit à faire passer un modèle de 3 % à 18 % de mises à mort, et un autre de 4 % à 39 %.

❓ Questions fréquentes

Des animaux réels sont-ils en cause?
Non, à aucun moment. Tout se déroule dans une simulation logicielle en grille : les tracteurs, le champ de maïs et les animaux sont des entités virtuelles. Ce qui est mesuré n'est pas un dommage réel mais une décision prise par un agent dans un environnement contrôlé, où l'une des options coûte du carburant simulé et l'autre non.
Ces résultats sont-ils établis scientifiquement?
Non. Il s'agit d'une préimpression déposée sur arXiv, c'est-à-dire d'un travail rendu public par ses auteurs sans avoir été évalué par des pairs. Les chiffres et les conclusions cités ici leur sont attribués et restent à confirmer par une évaluation indépendante. C'est une raison de lire le travail, pas de le tenir pour acquis.
Qu'est-ce que ce banc d'essai révèle de plus important?
La fragilité de l'instruction morale. Les auteurs rapportent qu'une consigne éthique placée dans un prompt système est écrasée par un court bloc d'instructions opérationnelles ajouté ensuite. Leur conclusion est nette : une valeur qu'on peut annuler aussi facilement n'est pas une bonne méthode pour aligner des agents. Ils constatent aussi que tous les modèles tuent plus souvent des animaux sauvages que des animaux d'élevage, sans proposer d'explication à cet écart.

🔗 Termes liés

🏷️ Catégorie parente

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !