Локальный мультимодальный RAG-пайплайн: пошаговое руководство | На DGX Spark
Daniel Bourke
0:00 / 0:00
Локальный мультимодальный RAG-пайплайн: пошаговое руководство | На DGX Spark
11 527 просмотров · 8 месяцев назад
Daniel Bourke
252 тыс. подписчиков
11 527 просмотров · 8 месяцев назад
Давайте создадим многомодальный конвейер RAG (Retrieval Augmented Generation) с использованием эмбеддингов NVIDIA Nemotron и переранжируем модели обработки изображений и текста.
Многомодальный означает, что мы сможем встраивать изображения и текст в одно и то же пространство признаков.
Это позволит нам одновременно осуществлять поиск по изображениям и тексту.
Мы научимся создавать многомодальные эмбеддинги, извлекать их с помощью запроса, переранжировать при необходимости и генерировать выходные данные на основе извлеченных образцов.
Это масштабируемый рабочий процесс, который можно использовать в самых разных сценариях. Если у вас есть набор документов, по которым нужно выполнить поиск, многомодальный RAG может стать частью решения.
Все это было выполнено локально на NVIDIA DGX Spark (подробнее см. здесь: https://nvda.ws/4iQXZU4).
Для бизнеса:
Если вы — компания, которой нужна помощь в создании собственного многомодального RAG-конвейера, свяжитесь со мной по адресу: https://www.mrdbourke.com/contact/
Ссылки:
Исходный код (версия книги) — https://www.learnhuggingface.com/note...
Исходный код (GitHub) — https://github.com/mrdbourke/learn-hu...
Исходный код (Colab) — https://colab.research.google.com/dri...
Плейлист прямых трансляций на YouTube — • Multimodal RAG (Retrieval Augmented Genera...
Ресурсы:
Модели Nemotron RAG - https://huggingface.co/collections/nv...
Реалистичная система RAG от Мартина Фаулера - https://martinfowler.com/articles/gen...
Временные метки:
0:00 - Введение и обзор
1:42 - Что такое RAG?
2:29 - RAG против тонкой настройки
3:25 - Реалистичная настройка RAG
4:15 - Что мы будем создавать
8:35 - Ингредиенты и инструменты
9:15 - Что такое эмбеддинги? (Часть 1)
12:07 - Что такое эмбеддинги? (Часть 2 - полезный ресурс)
12:39 - Шаг: Создание эмбеддингов
15:08 - Шаг: Получение результатов по запросу
21:17 - Шаг: Переранжирование полученных результатов
23:46 - Начало работы с кодом
25:05 - Просмотр примеров в нашем наборе данных
26:29 - Загрузка моделей из определенной контрольной точки в Hugging Face
28:12 - Создание/загрузка эмбеддингов
30:22 - Рассмотрение примеров эмбеддингов
31:00 - Всегда встраивайте свой запрос с той же моделью, что и ваши документы 34:07 - Просмотр результатов сопоставления запроса с эмбеддингами документов
36:38 - Использование изображения в качестве запроса
39:19 - Шаг: Переранжирование результатов
41:01 - Обсуждение вариантов переранжирования
45:20 - Визуализация переранжированных примеров по сравнению с исходными полученными результатами 47:54 - Шаг: Загрузка поколения модель
49:52 - Создание сводки входных рецептов
50:28 - Создание демо-версии (локально)
1:00:34 - Загрузка нашей демо-версии в Hugging Face
1:01:58 - Обсуждение интересных моментов, заметок и расширений