Перейти к содержимому

Une 5090, Qwen 3.8 27B, 4 sessions en parallèle : voici la config

Nicefox · IA & Dev

0:00 / 0:00

Une 5090, Qwen 3.8 27B, 4 sessions en parallèle : voici la config

5 026 просмотров · 1 день назад
Nicefox · IA & Dev
2,85 тыс. подписчиков
5 026 просмотров · 1 день назад
Une 5090 à 4 000 € d'occasion, 32 Go de DDR5, bridée à 400 watts sur 600. Et avec ça : 4 agents IA qui travaillent en parallèle, 262 000 tokens de contexte par session, et plus d'un million de tokens de cache (460 000 en VRAM, 600 000 en RAM). C'est la config que j'ai assemblée pour faire tourner Qwen 3.8 27B avec Ninfer, le moteur d'inférence le plus optimisé pour la 5090. Sauf qu'il fallait le corriger : le cache de Ninfer ne tenait pas, et le streaming des outils n'existait pas. Dans cette vidéo, je montre les 4 benchmarks que j'ai construits pour valider mes corrections, et la différence est brutale : 96% de cache réutilisé contre 0%. Au programme : Pourquoi une 5090 et Ninfer pour l'IA locale en entreprise Les deux problèmes corrigés dans Ninfer : le cache et le streaming des outils La démo live : une page HTML générée en 5 min 25, outils streamés compris Le benchmark cache pressure : 57 contextes sur 65 préservés, 456 000 tokens Le benchmark agent sim : 4 sessions en parallèle, 100% de cache hit Le benchmark interruption : 96% de cache réutilisé contre 0% sur Ninfer Le benchmark de l'aiguille dans la botte de foin : jusqu'à 200 000 tokens La nouvelle version de Qwen 3.8 27B, entraînée pour moins réfléchir Le test grandeur nature : 3 agents OpenFox en parallèle, 400 tokens par seconde Ma méthode : 5 jours, des benchmarks comme critère d'acceptation Les chiffres : 262 000 tokens de contexte par session, 4 sessions en parallèle (10 en usage sporadique) 460 000 tokens de cache en VRAM, 600 000 en RAM 150+ tokens par seconde en moyenne, 400 en pointe, 1 token par seconde par watt 52,6% des poids en NVFP4, 41,8% en FP8 (pas du NVFP4 pur) 4 000 € la 5090 d'occasion, 5 500 € la config complète 400 W sur les 600 W disponibles, 520 W mesurés sur toute la machine 5 min 25 la démo live, dont 4 min 40 de réflexion et 46 secondes d'outils 96% contre 0% : le cache réutilisé après une interruption, mon fork contre Ninfer 19 à 25 minutes : le temps de réflexion de chaque agent sur le test final 5 jours de travail, 62 heures au total : 24 heures de réflexion IA et 38 heures d'outils Les liens : Mon fork de Ninfer : https://github.com/co-l/ninfer Le modèle Qwen 3.8 27B réentraîné (quantisations, dont Bartoski) : https://huggingface.co/ukisai/Swift-Q... (le quant ninfer: https://huggingface.co/Yuuyuuyuuyuu/S... ) La configuration exacte de ma machine : https://github.com/co-l/ninfer/blob/m... OpenFox (gratuit, open source) : https://github.com/co-l/openfox Le subreddit :   / nicefoxfr   (IA locale, dev assisté par IA) Like, abonnement, commentaire. Et si vous voulez que je teste des quantisations qui tiennent en 16 Go de VRAM, dites-le en commentaire. 00:00 Intro : le moteur le plus optimisé pour la 5090 00:39 Pourquoi l'IA locale pour les PME 02:46 Ninfer, un moteur dédié : Qwen 3.8 27B format NVFP4+ 04:12 Démo live : outils streamés et page HTML à 202 tok/s 05:45 Benchmark 1 : la pression sur le cache 07:30 Benchmark 2 : 4 sessions en parallèle 10:19 Benchmark 3 : la génération interrompue 11:25 Benchmark 4 : l'aiguille dans la botte de foin 11:57 Ma méthode : 5 jours, des benchmarks comme critère 14:00 La version Swift : moins de réflexion, mêmes résultats 14:45 3 agents en parallèle : le test grandeur nature 18:18 Verdict et liens