Перейти к содержимому

Qwen 4 Preview vs GLM-5.3-Flash vs Qwen 3.8 27B : 3 benchmarks, qui gagne ?

Nicefox · IA & Dev

0:00 / 0:00

Qwen 4 Preview vs GLM-5.3-Flash vs Qwen 3.8 27B : 3 benchmarks, qui gagne ?

9 841 просмотр · 1 день назад
Nicefox · IA & Dev
2,67 тыс. подписчиков
9 841 просмотр · 1 день назад
Deux modèles open-weight sont sortis hier. GLM 5.3 Flash, le premier modèle de ZAI capable de voir, 320 milliards de paramètres dont 18 actifs. Et Qwen 3.8 Flash Next (la preview de Qwen 4), 125 milliards de paramètres dont 6 actifs, avec une architecture MoE qui casse les codes. Le jour même, j'ai réussi à faire tourner Flash Next en FP8 sur mon cluster DGX Spark, une première pour un modèle aussi récent. Face à eux, Qwen 3.8 27B en NVFP4 sur ma 5090. Trois modèles, trois benchmarks réels, un seul verdict. Au programme : Le benchmark 1 : la visualisation de l'invalidation du cache, comprendre des données de base de données et produire une visualisation qui a du sens Le benchmark 2 : le jeu du dinosaure, éviter les obstacles et récolter des pièces Le benchmark 3 : mon dashboard de consommation d'énergie, les prises Shelley, le graphe en temps réel des dernières 24 heures Les modèles qui testent leur propre travail : screenshots, Playwright, code review intégrée Le bug de GLM 5.3 Flash qui oublie d'appeler Step Done La déduplication des données : 1,4 Mo réduit à 186 Ko, un comportement que je n'avais jamais vu GLM bloqué au benchmark 2 : le passage de relais à DeepSeek V4 Flash Vision Le verdict : lequel des trois gagne ma confiance pour la production Les chiffres : 320 milliards de paramètres pour GLM 5.3 Flash, dont 18 actifs, contexte jusqu'à 1 million de tokens 125 milliards pour Qwen 3.8 Flash Next, dont 6 actifs, plus 51 milliards de n-grammes chargés en mémoire 4 min 32 : le plan de Flash Next sur le benchmark 1 16 contre 36 minutes : les modèles locaux face à GLM 5.3 Flash sur le benchmark 1 12 min 09 : Qwen 3.8 27B sur le benchmark 2, à 135 tokens par seconde 1 h 09 : le benchmark 2, terminé par DeepSeek V4 Flash Vision après le blocage de GLM 230 W le cluster, 413 W le PC fixe, 523 W le PC en charge, mesurés à la prise GLM 5.3 Flash : 4/6 sur le benchmark 1, les deux Qwen : 6/6 15 centimes par million de tokens en entrée, 50 en sortie, cache à 1,5 centime sur l'API ZAI Les liens : Qwen 3.8 Flash Next (la preview de Qwen 4) : https://huggingface.co/Qwen/Qwen3.8-F... GLM 5.3 Flash : https://huggingface.co/zai-org/GLM-5.... Qwen 3.8 27B : https://huggingface.co/Qwen/Qwen3.8-27B OpenFox (gratuit, open source) : https://github.com/co-l/openfox Le subreddit :   / nicefoxfr   (IA locale, dev assisté par IA) 00:00 Intro : 3 modèles open-weight sortis hier, 3 benchmarks pour les départager 02:00 Le benchmark 1 : la visualisation de l'invalidation du cache 03:00 Flash Next en 4 min 32, les 3 modèles testent leur propre travail 07:06 GLM 5.3 Flash oublie Step Done, la déduplication des données 08:03 Résultats du benchmark 1 : GLM 4/6, les Qwen 6/6 10:12 Le benchmark 2 : le jeu du dinosaure 12:48 Qwen 27B termine en 12 min 09, le bug des obstacles invisibles 15:21 Résultats du benchmark 2 : Flash Next le mieux fini 17:27 GLM trop lent : DeepSeek V4 Flash Vision prend le relais 18:12 Le benchmark 3 : le dashboard de consommation d'énergie 20:00 Pas d'historique sur les prises : un service d'échantillonnage à construire 29:33 Verdict : GLM décevant, Qwen 3.8 Flash Next bluffant