Перейти к содержимому

Тестируем TeleOCR: сможет ли OCR-модель на 1,2 млрд параметров обойти Gemini 3 Pro? (Обзор, ноутб...

Singularity Feed | AI Models , Agents & Robotics

0:00 / 0:00

Тестируем TeleOCR: сможет ли OCR-модель на 1,2 млрд параметров обойти Gemini 3 Pro? (Обзор, ноутб...

442 просмотра · 6 дней назад
Singularity Feed | AI Models , Agents & Robotics
316 подписчиков
442 просмотра · 6 дней назад
TeleOCR — это новая модель распознавания текста с открытым исходным кодом, имеющая 1,2 миллиарда параметров, которая заняла первое место в OmniDocBench v1.6 (96,87), опередив OvisOCR2, PaddleOCR-VL и даже Gemini 3 Pro. Я установил её на свой игровой ноутбук (RTX 3070 Ti, 8 ГБ) и протестировал на 8 реальных документах, от простых до сложных. Всё, что вы видите, — это реальные результаты моих запусков, включая ошибки. Что я обнаружил: ✓ Отлично работает на печатных страницах, с математическими вычислениями (идеально работает LaTeX), таблицами с объединенными ячейками и страницами, погнутыми/снятыми камерой. ✓ Читает таблицу результатов собственной исследовательской работы размером 25 × 9 с правильными значениями. ✓ Загружает около 2,4 ГБ видеопамяти (большие страницы с высоким разрешением могут занимать более 7 ГБ). ~ Машинописный заказ на покупку 1925 года: отличная структура, несколько неправильно прочитанных слов. ~ Фотография меню, сделанная на телефоне: прочитал большую часть, но две строки застряли в цикле повторения. ✗ Рукописный текст: вся заметка была классифицирована как картинка, текст не был возвращен. ✗ Тамильская газета: 13 минут вывода и ни одной тамильской буквы (официально поддерживает только английский и китайский языки). ✗ Медленно работает в Windows с Transformers: около 16 токенов в секунду; одна страница заняла 3,5 минуты. Авторы используют vLLM, который не поместился на 70% моей карты памяти объемом 8 ГБ. Совет по установке: pin transformers==4.57.1. Более новые версии (5.x) ломают пользовательский код модели с ошибкой KeyError: 'default'. Разделы TeleOCR — это новая модель распознавания текста с 1,2 миллиардами параметров, занимающая первое место в OmniDocBench. Я установил её на свой ноутбук, чтобы посмотреть, как она обрабатывает реальные документы. Эта небольшая модель разработана для высокопроизводительного чтения документов и, как сообщается, превосходит более крупных конкурентов, таких как Gemini 3 Pro, в бенчмарк-тестах. Я протестировал TeleOCR в восьми различных сценариях, чтобы проверить, соответствует ли она этим заявлениям, начиная от погнутых страниц учебников и рукописных заметок и заканчивая сложными таблицами и математическими формулами. Результаты оказались неоднозначными, показав, в чём эта локальная модель LLM преуспевает, а в чём испытывает трудности. Помимо результатов бенчмарков, я подробно описываю процесс установки на Windows и объясняю конкретные требования к видеопамяти и конфигурации, необходимые для её запуска. Вы увидите, как именно модель работает с изображениями высокого разрешения, что происходит при обработке рукописного текста, и с какими ограничениями вы можете столкнуться при запуске специализированной модели распознавания текста на потребительском оборудовании. Если этот анализ вам помог, подпишитесь на канал, чтобы получать больше честных тестов инструментов ИИ, и напишите в комментариях, какой формат документа мне следует попробовать взломать в следующий раз. 0:00 Помятая страница, прочитанная идеально 0:32 Что означает OCR сегодня 1:00 Заявленные результаты бенчмарка (OmniDocBench 96.87) 1:42 Как работает TeleOCR: два шага 2:13 Три идеи из статьи 2:55 Установка на Windows (+ подвох с трансформерами) 3:34 Скорость и память на видеокарте с 8 ГБ памяти 4:09 8 реальных тестов 4:24 Тест 1: помятая страница учебника 4:39 Тест 2: машинописная карточка с рецептом 5:00 Тест 3: математика, таблицы и собственная бумага 5:26 Тест 4: заказ на покупку 1925 года 5:51 Тест 5: фотография меню, сделанная на телефон 6:16 Тест 6: чеки в реальных условиях 6:44 Тесты 7 и 8: почерк и тамильский язык 7:17 Вердикт Ссылки Модель: https://huggingface.co/XingChen-AGI/T... Код: https://github.com/caipeng328/TeleOCR Статья: https://arxiv.org/abs/2608.12898 Результаты бенчмарков приведены авторами (OmniDocBench v1.6, Wild-OmniDocBench, PureDocBench). Моя конфигурация: Windows 11 · Видеокарта RTX 3070 Ti для ноутбука (8 ГБ) · i7-12650H · 32 ГБ ОЗУ · PyTorch 2.11 (CUDA 12.8) · transformers 4.57.1 ​​· официальный конвейер TeleOCR с бэкендом transformers (обнаружение компоновки, затем распознавание блоков). Тестовые изображения (Wikimedia Commons) Кооперативная ассоциация Dairymans League, Inc. Брайана Фаулера (общественное достояние) https://commons.wikimedia.org/wiki/Fi... Квитанция IJsselland Ziekenhuis, Hillegersberg, Rotterdam (2020) 02, автор Donald Trung Quoc Don (CC BY-SA 4.0) https://commons.wikimedia.org/wiki/Fi... Меню ресторана Petit Pois (1) 11 июля 2024 г., автор: Энди Ли (CC0) https://commons.wikimedia.org/wiki/Fi... Оплаченный счет за кофе от Kritzolina (CC BY-SA 4.0) https://commons.wikimedia.org/wiki/Fi... Стикеры с рукописным списком покупок и бытовых товаров от Pittigrilli (CC BY-SA 4.0) https://commons.wikimedia.org/wiki/Fi....