Перейти к содержимому

Le Grokking : quand une IA comprend (très) longtemps après avoir mémorisé

Projets IA

0:00 / 0:00

Le Grokking : quand une IA comprend (très) longtemps après avoir mémorisé

916 просмотров · 4 часа назад
Projets IA
11,1 тыс. подписчиков
916 просмотров · 4 часа назад
🧠 Tu entraînes un petit réseau sur une tâche de calcul. En quelques centaines d'étapes, il répond juste sur tous les exemples vus : il a mémorisé. Sur des exemples nouveaux, il reste nul, au niveau du hasard. Et si tu continues à l'entraîner très longtemps après que tout semble figé, sa précision bondit d'un coup jusqu'à quasi 100 % : il a « grokké ». C'est la généralisation retardée. Dans cette vidéo, en trois temps : le phénomène et pourquoi il déroute, le rôle du weight decay qui pousse le modèle du par-cœur vers la vraie règle, et surtout ce qui se passe à l'intérieur — le modèle apprend un vrai algorithme, il pose les nombres sur un cercle (comme une horloge) et additionne en tournant les aiguilles, en trois phases : mémorisation → formation du circuit → nettoyage. Aucun prérequis technique lourd. Fil rouge unique : l'horloge. ⚠️ Nuance importante : le grokking a été observé surtout sur de petites tâches algorithmiques (arithmétique modulaire). Sa portée aux grands modèles reste débattue. 📚 Pour aller plus loin : — Power, Burda, Edwards, Babuschkin, Misra — « Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets » (OpenAI, 2022) — Nanda, Chan, Lieberum, Smith, Steinhardt — « Progress measures for grokking via mechanistic interpretability » (ICLR 2023, arXiv:2301.05217) 📩 Newsletter IA Décodée (gratuite, chaque semaine) — la vidéo en synthèse, une idée à creuser et l'actu de la recherche expliquée simplement : https://projetsia.netlify.app/ 🔔 Abonne-toi à Projets IA : on démonte l'IA en profondeur, un concept par vidéo. #Grokking #Généralisation #InterprétabilitéMécanique #WeightDecay #DeepLearning #IA #IntelligenceArtificielle #MachineLearning #RéseauxDeNeurones #Transformer #VulgarisationIA #ProjetsIA