Перейти к содержимому

Релиз Qwen Image 2.1! Генерация по тексту и редактирование изображений в ComfyUI

Benji’s AI Playground

0:00 / 0:00

Релиз Qwen Image 2.1! Генерация по тексту и редактирование изображений в ComfyUI

15 874 просмотра · 9 часов назад
Benji’s AI Playground
34,5 тыс. подписчиков
15 874 просмотра · 9 часов назад
Qwen Image 2.1 в ComfyUI: модель с 7 миллиардами параметров и открытыми весами, которая выполняет преобразование текста в изображение, редактирование изображений, обеспечивает нативную прозрачность RGBA и обрабатывает до десяти эталонных изображений в одном конвейере. В этом видео показана полная локальная настройка, официальный рабочий процесс ComfyUI, мой собственный узел для улучшения подсказок и набор сложных подсказок, чтобы увидеть, где модель действительно дает сбой. Что показано в этом видео — Я запускаю Qwen Image 2.1 локально в ComfyUI и тестирую оба рабочих процесса: преобразование текста в изображение и редактирование изображений. Вы видите три файла, которые вам нужны из репозитория Comfy Org Hugging Face (диффузионная модель, кодировщик текста Qwen3-VL, VAE) в форматах BF16, Int8 Convrot и W4A8, а также опцию GGUF, если у вас достаточно видеопамяти. Затем я тестирую модель с помощью заданий, призванных её сломать: разборная сборка автоматических часов, объяснение различий между классическими и квантовыми вычислениями на доске, скриншот торгового терминала, доска с синтаксическим деревом и чертеж зонирования строительной площадки. После этого я перехожу к редактированию изображений с помощью примерки на нескольких эталонных изображениях, генерации прозрачного фона, макетов дизайна интерьера на основе пяти эталонных изображений и тестов на поворот ракурса камеры. Для кого это предназначено — для пользователей ComfyUI, специалистов по генерации изображений с помощью ИИ и всех, кто создает локально конвейеры обработки изображений для предметной фотографии или электронной коммерции. Вам должно быть удобно размещать файлы моделей в папки моделей ComfyUI и запускать рабочий процесс. Обучение LoRA или разработка пользовательских узлов не требуются. Если вы уже работали с какой-либо моделью ComfyUI, вы сможете следовать этому руководству. Почему это важно — Qwen Image 2.1 обрабатывает прозрачность нативно, что раньше требовало отдельной модели. Она принимает до десяти эталонных изображений для композиции и редактирования, сохраняет выкройки одежды и детали продукта между редактированиями и делает это примерно за шестнадцать гигабайт с помощью сборки int8. В бенчмарке он опережает Nano Banana 2.0 на один пункт, имея семь миллиардов параметров. Я также показываю реальные ограничения: числа в сгенерированных чертежах не сходятся, углы обзора камеры неверны, когда эталонное изображение не содержит информации о лицах, а пространственный размер ненадежен, поскольку модель не имеет входных данных измерений. Ресурсы: Мой пользовательский узел Prompt Enhancer: https://github.com/benjiyaya/ComfyUI-... Веса ComfyUI для Qwen Image 2.1 (Comfy Org): https://huggingface.co/Comfy-Org/Qwen... Официальные веса для Qwen Image 2.1: https://huggingface.co/Qwen/Qwen-Imag... GitHub Qwen Image 2.1: https://github.com/QwenLM/Qwen-Image-2.1 Блог Qwen Image 2.1: https://qwen.ai/blog?id=qwen-image-2.1 Зеркало ModelScope: https://modelscope.cn/models/Qwen/Qwe... Шаблон ComfyUI для преобразования текста в изображение: https://github.com/Comfy-Org/workflow... Шаблон редактирования изображения ComfyUI: https://github.com/Comfy-Org/workflow... Модели расширения подсказки (обе необходимы для узлов перезаписи подсказки): qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors — 9,47 ГБ, подсказка «текст-изображение» переписыватель https://huggingface.co/Comfy-Org/Qwen... qwen3.5_9b_qwen_image_2.1_pe_i2i.int8_convrot.safetensors — 9.47 ГБ, подсказка редактирования изображения переписыватель https://huggingface.co/Comfy-Org/Qwen... Папка: ComfyUI/models/text_encoders/ Диффузионная модель — папка: ComfyUI/models/diffusion_models/ qwen_image_2.1_bf16.safetensors (14,2 ГБ) — полная точность, используется в рабочем процессе VIP и в моем пользовательском рабочем процессе qwen_image_2.1_int8_convrot.safetensors (7,26 ГБ) — сборка с меньшим объемом видеопамяти, используется в официальных шаблонах ComfyUI Кодировщик текста — папка: ComfyUI/models/text_encoders/ qwen3vl_8b_bf16.safetensors (17,5 ГБ) — полная точность qwen3vl_8b_int8_convrot.safetensors (9,35 ГБ) — сборка с меньшим объемом видеопамяти qwen3vl_8b_w4a8.safetensors (6,31 ГБ) — сборка с наименьшим объемом памяти, используется для графических процессоров с меньшим объемом видеопамяти VAE — папка: ComfyUI/models/vae/ qwen_image_2.1_vae_bf16.safetensors (676 МБ) — Автокодировщик RGBA, 16-кратное пространственное сжатие Если вам понравился этот урок, вы можете поддержать нашу работу на Patreon:   / aifuturetech   #QwenImage #ComfyUI #AIImageGeneration #OpenSourceAI #ImageEditing