Перейти к содержимому

Практический обзор Qwen 3.8: распознавание изображений + чтение PDF (локальное тестирование)

MGlab

0:00 / 0:00

Практический обзор Qwen 3.8: распознавание изображений + чтение PDF (локальное тестирование)

119 просмотров · 1 мес. назад
MGlab
88 подписчиков
119 просмотров · 1 мес. назад
Qwen 3.8-27B — это новая модель с открытым исходным кодом от Alibaba, и на этот раз она поставляется с настоящим кодировщиком изображений и гораздо большим контекстным окном — работая полностью на вашем собственном графическом процессоре, без облака и ключа API. В этом видео я провожу два практических теста: 🖼️ РАСПОЗНАВАНИЕ ИЗОБРАЖЕНИЙ Я подаю ей на вход изображение, сгенерированное ИИ, которое я сам создал в ComfyUI, и прошу описать, что на самом деле находится в кадре — объекты, сцена, композиция, мелкие детали. Никаких подсказок, никакого обмана. 📄 ЧТЕНИЕ PDF Я загружаю настоящий PDF-файл и прошу Qwen 3.8 сделать его краткое изложение, а затем задаю ей вопросы, ответы на которые скрыты в тексте — это то, что сбивает с толку модели, которые просто бегло просматривают текст, вместо того чтобы читать его. Если вы решаете, достаточно ли хороша локальная модель с открытыми весами для замены облачного ИИ в повседневных задачах обработки изображений и документов, то это видео действительно проверяет её работоспособность, а не просто зачитывает вам технические характеристики. ⏱️ ВРЕМЕННЫЕ МЕТКИ 0:16 Распознавание изображений с помощью Qwen VL 1:07 Режимы рассуждений LM Studio 1:56 Анализ изображений с высокими затратами усилий 3:29 Анализ изображений с низкими затратами усилий 5:32 Сравнение анализа с высокими и низкими затратами усилий 6:33 Настройка анализа PDF-файлов 8:40 Краткое содержание книги о нейронных сетях 10:34 Вопросы и ответы по обучению нейронных сетей 11:45 Простое объяснение обратного распространения ошибки 13:41 Анонс следующего видео: Тесты по программированию