Перейти к содержимому

PaddleOCR-VL-1.5 против GLM-OCR: локальное тестирование

kintu

0:00 / 0:00

PaddleOCR-VL-1.5 против GLM-OCR: локальное тестирование

2 243 просмотра · 6 месяцев назад
kintu
2,58 тыс. подписчиков
2 243 просмотра · 6 месяцев назад
PaddleOCR-VL-1.5 против GLM-OCR | Полное сравнение 0,9 млрд параметров в открытых системах распознавания текста Сравним две самые мощные и компактные модели распознавания текста с открытым исходным кодом, доступные на данный момент! В этом видео я подробно рассматриваю и сравниваю PaddleOCR-VL-1.5 от PaddlePaddle и GLM-OCR от Zhipu AI. Обе модели содержат около 0,9 миллиарда параметров, но построены на совершенно разных архитектурах для решения сложных задач распознавания текста, распознавания текста и извлечения данных. Я подверг обе модели ожидаемым реальным испытаниям, включая неаккуратные чеки, математические формулы, удостоверения личности, дорожные знаки, блоки кода и плохо освещенный текст, чтобы определить, какая из локально-ориентированных гибридных моделей распознавания текста лучше всего подходит для больших объемов работы с распознаванием текста. Что вы узнаете из этого урока: ✅ Архитектурные различия между PaddleOCR-VL-1.5 и GLM-OCR. ✅ Как использовать GLM-OCR для анализа структурированных данных с помощью пользовательских JSON-схем. ✅ Использование уникальной функции PaddleOCR «Spotting» для обводки локализованного текста ограничивающими рамками. ✅ Тестирование производительности в реальных условиях на чеках, таблицах, математических формулах и удостоверениях личности. ✅ Оценка поведения модели на сложных входных данных, таких как изогнутый текст, круговые диаграммы и изображения при слабом освещении. ✅ Подробный анализ настроек параметров и выбор оптимальной модели размером 0,9 млрд пикселей для автоматизированного конвейера распознавания текста. Используемые инструменты и модели: Gradio: для создания среды тестирования веб-интерфейса. Библиотека Transformers: бэкенд-фреймворк Hugging Face для запуска моделей. PaddleOCR-VL-1.5: компактная модель VLM для документов размером 0,9 млрд пикселей от PaddlePaddle. GLM-OCR: Мультимодальная модель распознавания текста с языковым декодером 0,5 млрд слов от Zhipu AI. Характеристики ПК: Видеокарта: Nvidia RTX 5060 Ti 16 ГБ: https://amzn.to/4rU7xRy Оперативная память: 64 ГБ 4x16 ГБ Kingston Fury: https://amzn.to/473HoaG Используемая модель: PaddleOCR-VL-1.5 (0,9 млрд слов) GLM-OCR (0,9 млрд слов) Совет: Воспользуйтесь пользовательской схемой извлечения JSON в GLM-OCR для чистого автоматизированного анализа данных в ваших конвейерах, а также функцией «Обнаружение текста» в PaddleOCR, когда вам нужна точная локализация текста и ограничивающие рамки! Если это сравнение оказалось для вас полезным, не забудьте поставить лайк, подписаться и нажать на колокольчик уведомлений, чтобы получать больше подробных обзоров моделей ИИ и рабочих процессов распознавания текста! Instagram:   / kintugk   X: https://x.com/gk_kintu Контакты: kintutech@gmail.com Временные метки: 0:00 - Введение и обзор 0:33 - Технические характеристики PaddleOCR-VL-1.5 и результаты OmniDocBench 1:04 - Технические характеристики и функции GLM-OCR 1:48 - Подробный анализ архитектуры модели 3:15 - Настройка тестирования Gradio и использование видеопамяти 3:44 - Объяснение параметров PaddleOCR и GLM 5:46 - Тест 1: Извлечение текста с чека 7:30 - Тест 2: Распознавание CAPTCHA 8:06 - Тест 3: Распознавание математических формул 9:10 - Тест 4: Текст на упаковочной коробке 10:14 - Тест 5: Извлечение данных удостоверения личности и JSON-схемы 11:59 - Тест 6: Считывание показаний счетчиков и перевод 12:45 - Тест 7: Распознавание текста на дорожных знаках 14:05 - Тест 8: Анализ круговых диаграмм 15:01 - Тест 9: Распознавание печатей и штампов 15:31 - Тест 10: Извлечение таблиц 16:45 - Тест 11: Изогнутый текст на шине 19:01 - Тест 12: Плохо освещенный иностранный текст 20:14 - Тест 13: Сохранение синтаксиса блоков кода 20:58 - Заключительные мысли и выводы #GLMOCR #PaddleOCR #OCR #AIModels #MachineLearning #DocumentParsing #OpenSourceAI #ComputerVision #HuggingFace #VLM