Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Qwen3.8-Flash-Next : le vrai prix pour tourner sur 24 Go

3 min de lecture · The Decoder · 26 août 2026
Vérification : Contexte manquant L'information est exacte, mais il lui manque un élément sans lequel on la comprend mal. « Faire tourner Qwen3.8-Flash-Next (125 milliards de paramètres) avec un contexte de 250 000 jetons sur une seule RTX 4090 de 24 Go prouverait que « la barrière de la VRAM est morte ». » Voir la publication d'origine (ouvre un nouvel onglet)

D'après Qwen3.8-Flash-Next - fiche officielle du modèle (Hugging Face), relayé par The Decoder

Qwen3.8-Flash-Next : le vrai prix pour tourner sur 24 Go

Photo : Jimmy Chan, Pexels

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Qwen3.8-Flash-Next compte 125 milliards de paramètres, mais n'en active que 6 milliards par jeton (MoE, mélange d'experts). Il ajoute 51 milliards dans une couche de « plongement par n-grammes », conçue pour rester en mémoire vive plutôt que sur la carte graphique.
  • Le modèle gère nativement une fenêtre de contexte de 262 144 jetons, extensible jusqu'à 1 million de jetons (source : the-decoder, 26 août 2026, d'après l'annonce de Qwen).
  • @analogalok (X, 26 août 2026) affirme avoir fait tourner Qwen3.8-Flash-Next avec un contexte de 250 000 jetons sur une seule RTX 4090 de 24 Go, à 21 jetons/s, sans compression du cache KV (la mémoire tampon du contexte en génération) - sans dire à quel point les poids étaient compressés.
  • @Oluwaphilemon1 (X, 26 août 2026) montre Qwen3.8-27B (modèle distinct, plus petit, entièrement actif) tourner sur un Colab gratuit à 16 Go, via un GGUF (format de poids compressé) à 3,7 bits par poids (environ 12,5 Go), en protégeant les couches Gated-DeltaNet - et le dit ouvertement.
  • Même au format le plus compressé publié pour Qwen3.8-Flash-Next au 26 août 2026, les fichiers de poids totalisent plus de 67 Go : le faire tenir sur une carte de 24 Go suppose de garder l'essentiel des poids hors de la carte graphique, en mémoire vive.

Pourquoi ça compte

Le sujet réel n'est pas un score de performance, mais une leçon plus large : on peut désormais faire tourner de gros modèles d'intelligence artificielle sur du matériel ordinaire (carte grand public, Colab gratuit), et le prix à payer s'appelle la compression - qu'elle vienne de poids réduits en bits ou de calculs déplacés vers la mémoire vive plutôt que la carte graphique. Un billet enthousiaste peut être vrai et taire ce prix en même temps.

Chiffre-clé

Le quantifieur Empero a publié, le 15 août 2026, un GGUF de Qwen3.8-27B à 3,69 bits par poids : 11,73 Gio (12,59 Go), contre 50,89 Gio pour la version non compressée du même modèle (source : fiche du modèle, Hugging Face).

Citation

« This setup runs a 3.7 bpw Ridge GGUF of Qwen3.8-27B on a 16GB T4, while keeping the model's sensitive Gated-DeltaNet layers protected. » @Oluwaphilemon1 (X, 26 août 2026)

Action concrète

Avant de croire qu'un modèle « tourne » sur une carte de 24 Go, chercher son niveau réel de compression (bits par poids, format GGUF) : la fiche du modèle sur Hugging Face donne la taille exacte du fichier de poids, un chiffre qui ne ment pas.

Fondée sur la source originale

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !