Qwen3.8-27B sur Mac Studio : deux fois plus lent, presque aussi rapide
D'après Qwen (Alibaba) - fiche officielle du modèle Qwen3.8-27B (Hugging Face), relayé par Hacker News (frontpage)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Sur un Mac Studio M3 Ultra (256 Go), Qwen3.8-27B (quantification Q4_K_M, 17 Go) génère à 14,0 jetons/s en moyenne sur cinq essais, contre 28,6 jetons/s pour son prédécesseur Qwen3.6-27B, mesuré par l'auteur de TerminalBytes le 27 août 2026.
- Qwen3.8-27B compense : il répond en 890 à 1090 jetons là où Qwen3.6-27B en utilisait 1950 à 3340, si bien que le temps réel par réponse complète reste presque identique entre les deux versions.
- La quantification à 1 bit (6,7 Go, publiée par Unsloth) tourne à 27,2 jetons/s et connaît les faits correctement, mais échoue à conclure une tâche agentique simple : elle a cyclé 400 jetons sans jamais choisir de réponse finale.
- Qwen3.8-27B est un modèle DENSE distinct de Qwen3.8-Flash-Next (à mélange d'experts, déjà couvert ici) : Alibaba les présente comme deux sorties séparées, annoncées la même semaine.
- Selon la fiche officielle du modèle (Hugging Face, Qwen), Qwen3.8-27B est multimodal, gère nativement 262 144 jetons de contexte (extensible à 1 million) et est publié sous licence Apache 2.0.
Pourquoi ça compte
Le sujet n'est pas seulement Qwen3.8-27B : c'est la confirmation qu'un modèle de 27 milliards de paramètres, réputé rivaliser avec un modèle dix fois plus gros, tourne désormais sur du matériel qu'un particulier peut acheter, au prix d'un compromis clair entre vitesse et compression, documenté ici avec des chiffres, pas des promesses.
Chiffre-clé
14,0 jetons par seconde en moyenne sur cinq essais chronométrés (13,2 à 15,4) : la vitesse de génération de Qwen3.8-27B (quantification Q4_K_M) mesurée par TerminalBytes sur un Mac Studio M3 Ultra à 256 Go, le 27 août 2026.
Citation
« D'après mon expérience, la quantification à 1 bit est un tour de passe-passe qui enseigne une vraie leçon : la compression ne dégrade pas un modèle de façon uniforme. Les faits survivent, la capacité à trancher, elle, meurt. » TerminalBytes, essai sur Mac Studio M3 Ultra (27 août 2026)
Action concrète
Avant d'acheter du matériel pour l'exécuter localement, vérifier son propre besoin dans le tableau des quantifications : 16 Go de mémoire suffisent en 1 ou 2 bits, mais la qualité pour des tâches agentiques exige au moins la quantification Q2_K_XL (9,8 Go), et 32 Go pour la pleine qualité Q4.
Repères datés
- 2026-08-17 - Alibaba dévoile Qwen3.8-27B, modèle dense multimodal sous licence Apache 2.0, et publie séparément les poids de son modèle-phare Qwen3.8-2.4T-A95B.
- 2026-08-26 - Notre fiche sur Qwen3.8-Flash-Next (modèle distinct, à mélange d'experts) documentait déjà le prix de la compression pour le faire tourner sur une carte grand public.
- 2026-08-27 - TerminalBytes publie ses mesures détaillées de Qwen3.8-27B sur Mac Studio M3 Ultra, après dix jours d'utilisation quotidienne.
Sources originale et média
Sources
- Qwen (Alibaba) - fiche officielle du modèle Qwen3.8-27B (Hugging Face)
- Alibaba Cloud Community - Alibaba dévoile Qwen3.8-27B et les poids du modèle-phare Qwen3.8 : Billet officiel republié d'Alizila, daté du 17 août 2026 - confirme la licence Apache 2.0, le contexte natif de 262 144 jetons et la distinction avec Qwen3.8-Flash-Next et le modèle-phare Qwen3.8-2.4T-A95B.
- Relais média : Hacker News (frontpage) → · Lire en français
🔧 Outils mentionnés