Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Qwen3.8-27B sur Mac Studio : deux fois plus lent, presque aussi rapide

3 min de lecture · Hacker News (frontpage) · 28 août 2026

D'après Qwen (Alibaba) - fiche officielle du modèle Qwen3.8-27B (Hugging Face), relayé par Hacker News (frontpage)

Qwen3.8-27B sur Mac Studio : deux fois plus lent, presque aussi rapide

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Sur un Mac Studio M3 Ultra (256 Go), Qwen3.8-27B (quantification Q4_K_M, 17 Go) génère à 14,0 jetons/s en moyenne sur cinq essais, contre 28,6 jetons/s pour son prédécesseur Qwen3.6-27B, mesuré par l'auteur de TerminalBytes le 27 août 2026.
  • Qwen3.8-27B compense : il répond en 890 à 1090 jetons là où Qwen3.6-27B en utilisait 1950 à 3340, si bien que le temps réel par réponse complète reste presque identique entre les deux versions.
  • La quantification à 1 bit (6,7 Go, publiée par Unsloth) tourne à 27,2 jetons/s et connaît les faits correctement, mais échoue à conclure une tâche agentique simple : elle a cyclé 400 jetons sans jamais choisir de réponse finale.
  • Qwen3.8-27B est un modèle DENSE distinct de Qwen3.8-Flash-Next (à mélange d'experts, déjà couvert ici) : Alibaba les présente comme deux sorties séparées, annoncées la même semaine.
  • Selon la fiche officielle du modèle (Hugging Face, Qwen), Qwen3.8-27B est multimodal, gère nativement 262 144 jetons de contexte (extensible à 1 million) et est publié sous licence Apache 2.0.

Pourquoi ça compte

Le sujet n'est pas seulement Qwen3.8-27B : c'est la confirmation qu'un modèle de 27 milliards de paramètres, réputé rivaliser avec un modèle dix fois plus gros, tourne désormais sur du matériel qu'un particulier peut acheter, au prix d'un compromis clair entre vitesse et compression, documenté ici avec des chiffres, pas des promesses.

Chiffre-clé

14,0 jetons par seconde en moyenne sur cinq essais chronométrés (13,2 à 15,4) : la vitesse de génération de Qwen3.8-27B (quantification Q4_K_M) mesurée par TerminalBytes sur un Mac Studio M3 Ultra à 256 Go, le 27 août 2026.

Citation

« D'après mon expérience, la quantification à 1 bit est un tour de passe-passe qui enseigne une vraie leçon : la compression ne dégrade pas un modèle de façon uniforme. Les faits survivent, la capacité à trancher, elle, meurt. » TerminalBytes, essai sur Mac Studio M3 Ultra (27 août 2026)

Action concrète

Avant d'acheter du matériel pour l'exécuter localement, vérifier son propre besoin dans le tableau des quantifications : 16 Go de mémoire suffisent en 1 ou 2 bits, mais la qualité pour des tâches agentiques exige au moins la quantification Q2_K_XL (9,8 Go), et 32 Go pour la pleine qualité Q4.

Repères datés

Sources originale et média

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !