Перейти к содержимому

NLP – Catégorisation multiclasse avec TabICL (TabICLv2 / Python)

MASTER 2 SISE DATA SCIENCE

0:00 / 0:00

NLP – Catégorisation multiclasse avec TabICL (TabICLv2 / Python)

162 просмотра · 2 месяца назад
MASTER 2 SISE DATA SCIENCE
8,95 тыс. подписчиков
162 просмотра · 2 месяца назад
Machine learning. Data science. NLP (natural language processing). TabICL (tabular in-context learning) est une technologie de modélisation prédictive pour données tabulaires. Elle est novatrice dans le sens où elle transpose les idées des grands modèles de langages (LLM) dans le cadre des données tabulaires. Un modèle générique basé sur la technologie « transformer » est construit sur un très grand nombre de jeux de données synthétiques. En classement, les données d’apprentissage sont fournies comme éléments de contextualisation, utilisé pour élaborer la séquence présentée au « transformer » pour le calcul de l’attention. En creusant un peu, on se rend compte que la volumétrie est un enjeu important lorsqu’il s’agit d’appliquer le dispositif. Dans cette vidéo, j’explore différents aspects dans le cadre de la catégorisation multiclasse de documents (Corpus Ohsumed) : la taille de l’échantillon d’apprentissage (nombre d’observations, même si un échantillonnage est fait pour la contextualisation), le nombre de classes, la dimensionalité (nombre de features). D’un côté, les situations à forte volumétrie n’ont pas fonctionné sur ma machine, il y a bien une limitation à ce niveau ; mais, de l’autre, à chaque fois que les calculs ont été possibles, TabICLv2 a surclassé un SVM linéaire (scikit-learn, LinearSVC) en termes de performances prédictives. TabICL découverte :    • Classifieur « universel » avec TabICL (Tab...   GitHub TabICL : https://github.com/soda-inria/tabicl Données et notebook : https://tutoriels-data-science.blogsp... 00:00 La technologie TabICL pour la classification supervisée 03:28 Enjeux de volumétrie - Goulots d'étranglement 05:56 Le Corpus Ohsumed (20k) - Catégorisation de documents 08:01 Démarrage du notebook 08:29 Importation, inspection (train) - Fichier parquet 09:49 Filtrage sur les classes (et nombre d'observations) 11:10 Construction de la matrice documents - termes (TF-IDF) 11:48 Filtrage sur les features (nombre de descripteurs) 12:38 Approche "classique" - LinearSVC 13:05 Corpus de test - Préparation des données 13:18 Prédiction et évaluation (F1-Score, micro-averaging) 14:23 Apprentissage avec TabICLv2 14:59 Prédiction et évaluation