PaddleOCR-VL-1.5 против GLM-OCR: локальное тестирование
kintu
0:00 / 0:00
PaddleOCR-VL-1.5 против GLM-OCR: локальное тестирование
2 243 просмотра · 6 месяцев назад
kintu
2,58 тыс. подписчиков
2 243 просмотра · 6 месяцев назад
PaddleOCR-VL-1.5 против GLM-OCR | Полное сравнение 0,9 млрд параметров в открытых системах распознавания текста
Сравним две самые мощные и компактные модели распознавания текста с открытым исходным кодом, доступные на данный момент! В этом видео я подробно рассматриваю и сравниваю PaddleOCR-VL-1.5 от PaddlePaddle и GLM-OCR от Zhipu AI. Обе модели содержат около 0,9 миллиарда параметров, но построены на совершенно разных архитектурах для решения сложных задач распознавания текста, распознавания текста и извлечения данных.
Я подверг обе модели ожидаемым реальным испытаниям, включая неаккуратные чеки, математические формулы, удостоверения личности, дорожные знаки, блоки кода и плохо освещенный текст, чтобы определить, какая из локально-ориентированных гибридных моделей распознавания текста лучше всего подходит для больших объемов работы с распознаванием текста.
Что вы узнаете из этого урока:
✅ Архитектурные различия между PaddleOCR-VL-1.5 и GLM-OCR.
✅ Как использовать GLM-OCR для анализа структурированных данных с помощью пользовательских JSON-схем.
✅ Использование уникальной функции PaddleOCR «Spotting» для обводки локализованного текста ограничивающими рамками.
✅ Тестирование производительности в реальных условиях на чеках, таблицах, математических формулах и удостоверениях личности.
✅ Оценка поведения модели на сложных входных данных, таких как изогнутый текст, круговые диаграммы и изображения при слабом освещении.
✅ Подробный анализ настроек параметров и выбор оптимальной модели размером 0,9 млрд пикселей для автоматизированного конвейера распознавания текста.
Используемые инструменты и модели:
Gradio: для создания среды тестирования веб-интерфейса.
Библиотека Transformers: бэкенд-фреймворк Hugging Face для запуска моделей.
PaddleOCR-VL-1.5: компактная модель VLM для документов размером 0,9 млрд пикселей от PaddlePaddle.
GLM-OCR: Мультимодальная модель распознавания текста с языковым декодером 0,5 млрд слов от Zhipu AI.
Характеристики ПК:
Видеокарта: Nvidia RTX 5060 Ti 16 ГБ: https://amzn.to/4rU7xRy
Оперативная память: 64 ГБ 4x16 ГБ Kingston Fury: https://amzn.to/473HoaG
Используемая модель:
PaddleOCR-VL-1.5 (0,9 млрд слов)
GLM-OCR (0,9 млрд слов)
Совет: Воспользуйтесь пользовательской схемой извлечения JSON в GLM-OCR для чистого автоматизированного анализа данных в ваших конвейерах, а также функцией «Обнаружение текста» в PaddleOCR, когда вам нужна точная локализация текста и ограничивающие рамки!
Если это сравнение оказалось для вас полезным, не забудьте поставить лайк, подписаться и нажать на колокольчик уведомлений, чтобы получать больше подробных обзоров моделей ИИ и рабочих процессов распознавания текста!
Instagram: / kintugk
X: https://x.com/gk_kintu
Контакты: kintutech@gmail.com
Временные метки:
0:00 - Введение и обзор
0:33 - Технические характеристики PaddleOCR-VL-1.5 и результаты OmniDocBench
1:04 - Технические характеристики и функции GLM-OCR
1:48 - Подробный анализ архитектуры модели
3:15 - Настройка тестирования Gradio и использование видеопамяти
3:44 - Объяснение параметров PaddleOCR и GLM
5:46 - Тест 1: Извлечение текста с чека
7:30 - Тест 2: Распознавание CAPTCHA
8:06 - Тест 3: Распознавание математических формул
9:10 - Тест 4: Текст на упаковочной коробке
10:14 - Тест 5: Извлечение данных удостоверения личности и JSON-схемы
11:59 - Тест 6: Считывание показаний счетчиков и перевод
12:45 - Тест 7: Распознавание текста на дорожных знаках
14:05 - Тест 8: Анализ круговых диаграмм
15:01 - Тест 9: Распознавание печатей и штампов
15:31 - Тест 10: Извлечение таблиц
16:45 - Тест 11: Изогнутый текст на шине
19:01 - Тест 12: Плохо освещенный иностранный текст
20:14 - Тест 13: Сохранение синтаксиса блоков кода
20:58 - Заключительные мысли и выводы
#GLMOCR #PaddleOCR #OCR #AIModels #MachineLearning #DocumentParsing #OpenSourceAI #ComputerVision #HuggingFace #VLM