Filigrane : six modèles sur sept appellent moins bien leurs outils
D'après Lasso Security – The Provenance Tax, 17 septembre 2026 et The Register – 17 septembre 2026, relayé par The Register
Image : générée (Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Le filigrane n'ajoute rien au texte fini : il oriente le choix du mot suivant là où le modèle hésite. Anthropic donne l'exemple de « overcast » préféré à « gray ». Le lecteur n'y voit rien, mais l'agent qui agit à partir de ce texte, lui, change de comportement.
- Au banc d'essai BFCL v4, la précision d'appel d'outils baisse sur six des sept modèles testés, dont quatre de façon significative. Les sept sont phi-4, Llama-3.1-8B, Qwen3-32B, Qwen3-4B, gemma-3-12b, gemma-3-27b et Granite-3.2-8B.
- Le point le plus fin : un score global presque inchangé peut cacher un comportement différent, parce qu'un appel devenu faux en compense un autre devenu juste. Lasso mesure ce désaccord plutôt que de s'arrêter à la moyenne.
- Les erreurs diffèrent d'un modèle à l'autre. Sur Llama-3.1-8B, ce sont surtout de mauvais arguments (moins 3,48 points) ; sur phi-4 et Granite-3.2-8B, c'est la sortie malformée qui domine (moins 5,96 et moins 4,36 points).
- Sur les refus de sécurité, l'effet est faible face à une demande ouvertement nuisible, mais nettement plus marqué sous injection d'invite, où le taux de réussite des attaques monte.
Pourquoi ça compte
Le filigrane répond à une obligation légale européenne, l'article 50(2) du règlement sur l'IA. laveille.ai rapportait le 18 août 2026 qu'Anthropic l'appliquait aux textes de Claude sans bornage régional. Cette fiche-ci ne porte pas sur ce déploiement, mais sur son effet secondaire : le mécanisme qui rend un texte traçable modifie les mots que l'agent utilisera ensuite pour agir. Lasso ne demande pas d'y renoncer. Elle demande que les tests de sécurité portent sur du contenu filigrané, faute de quoi on évalue un modèle qui n'est pas celui qui tourne en production.
Chiffre-clé
Six modèles sur sept : la part des modèles dont la précision d'appel d'outils baisse avec le filigrane, mesurée par Lasso Security au banc d'essai BFCL v4 et publiée le 17 septembre 2026. La baisse est significative sur quatre d'entre eux.
Citation
« Watermarking is designed for provenance, but SynthID-Text changes the process by which the model generates each next token. At the model level, this can change safety behavior, including whether the model refuses a harmful request and whether that refusal holds under prompt injection. » Lasso Security, dans son rapport du 17 septembre 2026
Ce que ça change au Québec
🇨🇦 Le filigrane de Claude n'est pas réservé à l'Europe. laveille.ai rapportait le 18 août 2026 qu'Anthropic l'applique au niveau du modèle, sans découpage régional, donc aussi aux personnes qui l'utilisent depuis le Québec. Les effets mesurés ici ne sont pas un problème européen lointain.
Action concrète
Si tu fais tourner un agent sur un modèle filigrané, teste-le AVEC le filigrane actif plutôt que sans : c'est la recommandation de Lasso, et elle vaut surtout pour les scénarios d'injection d'invite, là où l'écart mesuré est le plus grand.
Repères datés
- 18 août 2026 - Anthropic filigrane les textes de Claude pour l'Europe et, faute de bornage régional, au Québec aussi.
Fondée sur la source originale
Sources
- Lasso Security – The Provenance Tax, 17 septembre 2026
- The Register – 17 septembre 2026
- Relais média : The Register → · Lire en français
🔧 Outils mentionnés