Туториал по сквозной донастройке (малой) визуально-языковой модели | На DGX Spark
Daniel Bourke
0:00 / 0:00
Туториал по сквозной донастройке (малой) визуально-языковой модели | На DGX Spark
21 896 просмотров · 8 месяцев назад
Daniel Bourke
252 тыс. подписчиков
21 896 просмотров · 8 месяцев назад
В этом видео мы дорабатываем модель обработки естественного языка SmolVLM2-500M от Hugging Face для извлечения структурированных данных из изображений.
Поскольку модель SmolVLM2-500M довольно мала в мире LLM/VLM, мы можем проводить обучение локально на NVIDIA DGX Spark (подробнее см. здесь: https://nvda.ws/4iQXZU4).
Код также должен работать в Google Colab.
Если у вас возникнут какие-либо проблемы, пожалуйста, сообщите мне об этом в комментариях.
Ссылки:
Google Colab Notebook - https://colab.research.google.com/dri...
GitHub - https://github.com/mrdbourke/learn-hu...
Изучите Hugging Face в версии для Book - https://www.learnhuggingface.com/note...
Набор данных - https://huggingface.co/datasets/mrdbo...
Базовая модель (SmolVLM2-500M) - https://huggingface.co/HuggingFaceTB/...
Демо - https://huggingface.co/spaces/mrdbour...
Прямые трансляции (где я создаю этот проект с нуля):
Часть 1: Создание набора данных VLM - https://www.youtube.com/live/cZVU559B...
Часть 2: Тонкая настройка VLM с помощью LoRA и QLoRA и получение множества ошибок (в основном по моей вине) - https://www.youtube.com/live/Lgcp9hBq...
Часть 3: Переход от использования LoRA и QLoRA (мы сделаем это в будущем видео) к успешной тонкой настройке меньшей модели (SmolVLM2) и ее загрузке в Создание и публикация демо-версии Hugging Face Hub - https://youtube.com/live/cZVU559BLLM?...
Курсы, которые я преподаю:
Изучение ИИ/машинного обучения (курс для начинающих) - https://dbourke.link/ZTMMLcourse
Изучение Hugging Face - https://dbourke.link/ZTMHuggingFace
Изучение TensorFlow - https://dbourke.link/ZTMTFcourse
Изучение PyTorch - https://dbourke.link/ZTMPyTorch
Свяжитесь со мной в других местах:
Скачайте Nutrify (мой стартап) - https://apple.co/4ahM7Wc
Мой веб-сайт - https://www.mrdbourke.com
X/Twitter - / mrdbourke
LinkedIn - www.linkedin.com/in/mrdbourke
Получайте обновления о моей работе по электронной почте - https://dbourke.link/newsletter
Читайте мой роман «Чарли гуляет» — https://www.charliewalks.com
Временные метки:
00:00:00 — Введение
00:02:19 — Что такое VLM?
00:03:45 — Зачем тонкая настройка собственной модели?
00:06:05 - Подход к тонкой настройке LLM
00:06:51 - Пример из практики: Nutrify
00:09:16 - Пример из практики: Invoice Extractor
00:11:06 - Ингредиенты и инструменты, которые мы будем использовать
00:12:16 - Изучение набора данных FoodExtract-1k-Vision
00:15:52 - Моя настройка
00:16:13 - Форматирование набора данных для VLM
00:16:54 - Создание набора данных для VLM
00:17:20 - Подготовка модели для тонкой настройки
00:18:13 - Обзор нашей задачи (извлечение структурированных данных из изображений)
00:20:11 - Что мы получим в итоге
00:22:38 - Начало работы с кодом
00:23:31 - Просмотр одного образца данных
00:29:08 - Разделение наших данных на обучающую выборку и тестовые наборы
00:34:25 - Изучение архитектуры нашей модели
00:40:03 - Чтение рецепта из статьи SmolDocling
00:45:29 - Замораживание кодировщика зрения в нашей модели
00:47:34 - Обсуждение размеров пакетов
00:49:06 - Настройка SFTConfig
00:52:03 - Обучение нашей модели с помощью SFTTrainer
00:54:11 - Начало обучения модели
00:54:19 - Завершение обучения модели
00:56:13 - Изучение кривых потерь нашей модели
00:57:10 - Загрузка обученной модели в Hugging Face
00:58:19 - Начало загрузки модели в Hugging Face
00:58:26 - Завершение загрузки модели
00:59:38 - Сравнение базовой модели с дообученной модель
01:01:06 - Просмотр первых прогнозов нашей доработанной модели
01:03:35 - Создание демо-версии с помощью Gradio
01:06:46 - Загрузка нашей демо-версии в Hugging Face Hub
01:07:35 - Тестирование нашей демо-версии
01:08:27 - Что дальше и расширения