Перейти к содержимому

Туториал по сквозной донастройке (малой) визуально-языковой модели | На DGX Spark

Daniel Bourke

0:00 / 0:00

Туториал по сквозной донастройке (малой) визуально-языковой модели | На DGX Spark

21 896 просмотров · 8 месяцев назад
Daniel Bourke
252 тыс. подписчиков
21 896 просмотров · 8 месяцев назад
В этом видео мы дорабатываем модель обработки естественного языка SmolVLM2-500M от Hugging Face для извлечения структурированных данных из изображений. Поскольку модель SmolVLM2-500M довольно мала в мире LLM/VLM, мы можем проводить обучение локально на NVIDIA DGX Spark (подробнее см. здесь: https://nvda.ws/4iQXZU4). Код также должен работать в Google Colab. Если у вас возникнут какие-либо проблемы, пожалуйста, сообщите мне об этом в комментариях. Ссылки: Google Colab Notebook - https://colab.research.google.com/dri... GitHub - https://github.com/mrdbourke/learn-hu... Изучите Hugging Face в версии для Book - https://www.learnhuggingface.com/note... Набор данных - https://huggingface.co/datasets/mrdbo... Базовая модель (SmolVLM2-500M) - https://huggingface.co/HuggingFaceTB/... Демо - https://huggingface.co/spaces/mrdbour... Прямые трансляции (где я создаю этот проект с нуля): Часть 1: Создание набора данных VLM - https://www.youtube.com/live/cZVU559B... Часть 2: Тонкая настройка VLM с помощью LoRA и QLoRA и получение множества ошибок (в основном по моей вине) - https://www.youtube.com/live/Lgcp9hBq... Часть 3: Переход от использования LoRA и QLoRA (мы сделаем это в будущем видео) к успешной тонкой настройке меньшей модели (SmolVLM2) и ее загрузке в Создание и публикация демо-версии Hugging Face Hub - https://youtube.com/live/cZVU559BLLM?... Курсы, которые я преподаю: Изучение ИИ/машинного обучения (курс для начинающих) - https://dbourke.link/ZTMMLcourse Изучение Hugging Face - https://dbourke.link/ZTMHuggingFace Изучение TensorFlow - https://dbourke.link/ZTMTFcourse Изучение PyTorch - https://dbourke.link/ZTMPyTorch Свяжитесь со мной в других местах: Скачайте Nutrify (мой стартап) - https://apple.co/4ahM7Wc Мой веб-сайт - https://www.mrdbourke.com X/Twitter -   / mrdbourke   LinkedIn - www.linkedin.com/in/mrdbourke Получайте обновления о моей работе по электронной почте - https://dbourke.link/newsletter Читайте мой роман «Чарли гуляет» — https://www.charliewalks.com Временные метки: 00:00:00 — Введение 00:02:19 — Что такое VLM? 00:03:45 — Зачем тонкая настройка собственной модели? 00:06:05 - Подход к тонкой настройке LLM 00:06:51 - Пример из практики: Nutrify 00:09:16 - Пример из практики: Invoice Extractor 00:11:06 - Ингредиенты и инструменты, которые мы будем использовать 00:12:16 - Изучение набора данных FoodExtract-1k-Vision 00:15:52 - Моя настройка 00:16:13 - Форматирование набора данных для VLM 00:16:54 - Создание набора данных для VLM 00:17:20 - Подготовка модели для тонкой настройки 00:18:13 - Обзор нашей задачи (извлечение структурированных данных из изображений) 00:20:11 - Что мы получим в итоге 00:22:38 - Начало работы с кодом 00:23:31 - Просмотр одного образца данных 00:29:08 - Разделение наших данных на обучающую выборку и тестовые наборы 00:34:25 - Изучение архитектуры нашей модели 00:40:03 - Чтение рецепта из статьи SmolDocling 00:45:29 - Замораживание кодировщика зрения в нашей модели 00:47:34 - Обсуждение размеров пакетов 00:49:06 - Настройка SFTConfig 00:52:03 - Обучение нашей модели с помощью SFTTrainer 00:54:11 - Начало обучения модели 00:54:19 - Завершение обучения модели 00:56:13 - Изучение кривых потерь нашей модели 00:57:10 - Загрузка обученной модели в Hugging Face 00:58:19 - Начало загрузки модели в Hugging Face 00:58:26 - Завершение загрузки модели 00:59:38 - Сравнение базовой модели с дообученной модель 01:01:06 - Просмотр первых прогнозов нашей доработанной модели 01:03:35 - Создание демо-версии с помощью Gradio 01:06:46 - Загрузка нашей демо-версии в Hugging Face Hub 01:07:35 - Тестирование нашей демо-версии 01:08:27 - Что дальше и расширения