Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Modèles locaux décensurés : deux des quatre testés déconseillés

3 min de lecture · Hacker News (frontpage) · 22 août 2026

D'après Level1Techs - Why your local LLM feels dumber than it is (partie 3.11, par thr3e), relayé par Hacker News (frontpage)

Modèles locaux décensurés : deux des quatre testés déconseillés

Photo : Egor Komarov, Unsplash

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Le test compare, à contexte identique, le mot que choisit la version modifiée et celui que choisit le modèle d'origine. Écarts mesurés : 1,3 % et 1,4 % pour les deux premières, 5,0 % et 5,8 % pour les deux autres.
  • Les erreurs concrètes viennent toutes de la plus divergente, AEON : le port PostgreSQL 5432 devenu « 543ql », un appel de fonction jamais refermé, et « page_size=100 » changé en « size=100 ».
  • La quatrième, Blackfrost, s'écarte fortement elle aussi, mais l'auteur note qu'elle est restée le plus souvent cohérente. Elle n'a produit qu'un seul enchaînement invalide sur 216 examinés.
  • L'auteur écrit qu'une procédure sophistiquée n'était pas nécessaire pour préserver ce type de travail : une méthode que ses propres auteurs qualifient de grossière a fait presque aussi bien que la plus rigoureuse.
  • Il pose lui-même les limites : rien ici ne dit laquelle est le mieux décensurée, et les dégâts de la pire ne s'imputent pas à la seule décensure, sa recette combinant trois modifications.

Pourquoi ça compte

L'auteur note que pour bavarder, ces modèles s'en tirent probablement très bien. Le défaut apparaît ailleurs : au moment de recopier une chaîne exacte dans une commande, un numéro de port, un nom d'hôte, un paramètre. C'est l'écart entre « il a l'air correct » et « il est correct », et la conversation ne le révèle pas.

Chiffre-clé

5,8 % des mots choisis diffèrent de ceux du modèle d'origine pour la version la plus divergente, contre 1,3 % pour la moins divergente, sur 4 339 mots de sortie mesurés, selon les tests publiés en août 2026 sur le forum Level1Techs.

Citation

« These are not vague stylistic differences. They are high-confidence literal-copy failures in operational commands. (« Ce ne sont pas de vagues différences de style. Ce sont des échecs de copie littérale, à haute confiance, dans des commandes opérationnelles. ») » thr3e, auteur des tests, forum Level1Techs

Action concrète

Si vous faites tourner un modèle « décensuré » chez vous et qu'il exécute des commandes, testez-le sur la copie exacte de chaînes : un numéro de port, un nom d'hôte, un paramètre. Bavarder avec lui ne révélera pas ce défaut.

Fondée sur la source originale

Sources

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !