Тестируем TeleOCR: сможет ли OCR-модель на 1,2 млрд параметров обойти Gemini 3 Pro? (Обзор, ноутб...
Singularity Feed | AI Models , Agents & Robotics
0:00 / 0:00
Тестируем TeleOCR: сможет ли OCR-модель на 1,2 млрд параметров обойти Gemini 3 Pro? (Обзор, ноутб...
442 просмотра · 6 дней назад
Singularity Feed | AI Models , Agents & Robotics
316 подписчиков
442 просмотра · 6 дней назад
TeleOCR — это новая модель распознавания текста с открытым исходным кодом, имеющая 1,2 миллиарда параметров, которая заняла первое место в OmniDocBench v1.6 (96,87), опередив OvisOCR2, PaddleOCR-VL и даже Gemini 3 Pro. Я установил её на свой игровой ноутбук (RTX 3070 Ti, 8 ГБ) и протестировал на 8 реальных документах, от простых до сложных. Всё, что вы видите, — это реальные результаты моих запусков, включая ошибки.
Что я обнаружил:
✓ Отлично работает на печатных страницах, с математическими вычислениями (идеально работает LaTeX), таблицами с объединенными ячейками и страницами, погнутыми/снятыми камерой.
✓ Читает таблицу результатов собственной исследовательской работы размером 25 × 9 с правильными значениями.
✓ Загружает около 2,4 ГБ видеопамяти (большие страницы с высоким разрешением могут занимать более 7 ГБ).
~ Машинописный заказ на покупку 1925 года: отличная структура, несколько неправильно прочитанных слов.
~ Фотография меню, сделанная на телефоне: прочитал большую часть, но две строки застряли в цикле повторения.
✗ Рукописный текст: вся заметка была классифицирована как картинка, текст не был возвращен.
✗ Тамильская газета: 13 минут вывода и ни одной тамильской буквы (официально поддерживает только английский и китайский языки).
✗ Медленно работает в Windows с Transformers: около 16 токенов в секунду; одна страница заняла 3,5 минуты. Авторы используют vLLM, который не поместился на 70% моей карты памяти объемом 8 ГБ.
Совет по установке: pin transformers==4.57.1. Более новые версии (5.x) ломают пользовательский код модели с ошибкой KeyError: 'default'.
Разделы
TeleOCR — это новая модель распознавания текста с 1,2 миллиардами параметров, занимающая первое место в OmniDocBench. Я установил её на свой ноутбук, чтобы посмотреть, как она обрабатывает реальные документы.
Эта небольшая модель разработана для высокопроизводительного чтения документов и, как сообщается, превосходит более крупных конкурентов, таких как Gemini 3 Pro, в бенчмарк-тестах. Я протестировал TeleOCR в восьми различных сценариях, чтобы проверить, соответствует ли она этим заявлениям, начиная от погнутых страниц учебников и рукописных заметок и заканчивая сложными таблицами и математическими формулами. Результаты оказались неоднозначными, показав, в чём эта локальная модель LLM преуспевает, а в чём испытывает трудности.
Помимо результатов бенчмарков, я подробно описываю процесс установки на Windows и объясняю конкретные требования к видеопамяти и конфигурации, необходимые для её запуска. Вы увидите, как именно модель работает с изображениями высокого разрешения, что происходит при обработке рукописного текста, и с какими ограничениями вы можете столкнуться при запуске специализированной модели распознавания текста на потребительском оборудовании.
Если этот анализ вам помог, подпишитесь на канал, чтобы получать больше честных тестов инструментов ИИ, и напишите в комментариях, какой формат документа мне следует попробовать взломать в следующий раз.
0:00 Помятая страница, прочитанная идеально
0:32 Что означает OCR сегодня
1:00 Заявленные результаты бенчмарка (OmniDocBench 96.87)
1:42 Как работает TeleOCR: два шага
2:13 Три идеи из статьи
2:55 Установка на Windows (+ подвох с трансформерами)
3:34 Скорость и память на видеокарте с 8 ГБ памяти
4:09 8 реальных тестов
4:24 Тест 1: помятая страница учебника
4:39 Тест 2: машинописная карточка с рецептом
5:00 Тест 3: математика, таблицы и собственная бумага
5:26 Тест 4: заказ на покупку 1925 года
5:51 Тест 5: фотография меню, сделанная на телефон
6:16 Тест 6: чеки в реальных условиях
6:44 Тесты 7 и 8: почерк и тамильский язык
7:17 Вердикт
Ссылки
Модель: https://huggingface.co/XingChen-AGI/T...
Код: https://github.com/caipeng328/TeleOCR
Статья: https://arxiv.org/abs/2608.12898
Результаты бенчмарков приведены авторами (OmniDocBench v1.6, Wild-OmniDocBench, PureDocBench).
Моя конфигурация:
Windows 11 · Видеокарта RTX 3070 Ti для ноутбука (8 ГБ) · i7-12650H · 32 ГБ ОЗУ · PyTorch 2.11 (CUDA 12.8) · transformers 4.57.1 · официальный конвейер TeleOCR с бэкендом transformers (обнаружение компоновки, затем распознавание блоков).
Тестовые изображения (Wikimedia Commons)
Кооперативная ассоциация Dairymans League, Inc. Брайана Фаулера (общественное достояние) https://commons.wikimedia.org/wiki/Fi...
Квитанция IJsselland Ziekenhuis, Hillegersberg, Rotterdam (2020) 02, автор Donald Trung Quoc Don (CC BY-SA 4.0) https://commons.wikimedia.org/wiki/Fi...
Меню ресторана Petit Pois (1) 11 июля 2024 г., автор: Энди Ли (CC0) https://commons.wikimedia.org/wiki/Fi...
Оплаченный счет за кофе от Kritzolina (CC BY-SA 4.0) https://commons.wikimedia.org/wiki/Fi...
Стикеры с рукописным списком покупок и бытовых товаров от Pittigrilli (CC BY-SA 4.0) https://commons.wikimedia.org/wiki/Fi....