Быстрая тонкая настройка Gemma-3, Qwen-3 и GPT-OSS на Strix Halo с использованием Unsloth и много...
Donato Capitella
0:00 / 0:00
Быстрая тонкая настройка Gemma-3, Qwen-3 и GPT-OSS на Strix Halo с использованием Unsloth и много...
10 982 просмотра · 6 месяцев назад
Donato Capitella
112 тыс. подписчиков
10 982 просмотра · 6 месяцев назад
В этом видео я представляю обновленный набор инструментов для тонкой настройки Strix Halo, включающий два основных улучшения: интеграцию с Unsloth и многоузловое распределенное обучение. Настройка основана на предыдущем руководстве по тонкой настройке, но теперь использует высокооптимизированные ядра Triton от Unsloth для уменьшения использования видеопамяти и ускорения времени обучения для таких моделей, как Gemma 3.
Я рассказываю о программных деталях, которые делают это возможным: как Unsloth динамически вносит изменения в библиотеку Hugging Face Transformers и почему стандартный PyTorch Autograd менее эффективен для этих конкретных архитектур. Я также показываю сравнительный анализ полной тонкой настройки и LoRA, демонстрируя огромные преимущества Unsloth в плане памяти и скорости, а также конкретные коммиты и патчи, необходимые для запуска на ROCm.
Что касается распределенного обучения, я показываю запуск DDP (Distributed Data Parallel) и FSDP (Fully-Sharded Data Parallel) на двухузловом кластере Strix Halo. Как и в случае с vLLM, основной проблемой здесь было отсутствие поддержки RCCL для gfx1151 в исходном коде ROCm. Я объясняю, как я интегрировал свою модифицированную библиотеку RCCL в инструментарий, что позволило нам разделить рабочую нагрузку обучения между несколькими машинами, используя либо RDMA, либо стандартный Ethernet, и как воспроизвести эту настройку с помощью моих скриптов управления кластером.
Временные метки
00:00 – Введение
03:26 – Запуск инструментария
07:00 – Как работает Unsloth (в сравнении с PyTorch Autograd)
10:15 – Демонстрация обучения Unsloth и бенчмарки
16:50 – Патчинг Unsloth и детали реализации
20:28 – Настройка многоузлового кластера
24:08 – Стратегии обучения DDP против FSDP
27:00 – Демонстрация многоузлового обучения
29:53 – Заключение
Ссылки и ресурсы
Инструментарии и руководства Strix Halo: https://strix-halo-toolboxes.com
Инструментарий тонкой настройки Strix Halo: https://github.com/kyuz0/amd-strix-ha...
LLM Chronicles (подробный анализ градиентного спуска): https://llm-chronicles.com
Сравнение DDP и FSDP в PyTorch: https://www.jellyfishtechnologies.com...