The OpenNET Project / Index page

[ новости /+++ | форум | теги | ]



Индекс форумов
Составление сообщения

Исходное сообщение
"Релиз системы распознавания текста Tesseract 4.1"
Отправлено opennews, 12-Июл-19 10:21 
Подготовлен (https://groups.google.com/forum/#!topic/tesseract-ocr/oKtTOI... релиз системы оптического распознавания текста Tesseract 4.1 (https://github.com/tesseract-ocr/tesseract/), поддерживающей распознавание символов UTF-8 и текстов на более чем 100 языках, включая русский, казахский, белорусский  и украинский. Результат может сохраняться как открытым текстом, так и в форматах HTML (hOCR),  ALTO (XML), PDF и TSV. Изначально система была создана в 1985-1995 годах в лаборатории компании Hewlett Packard, в 2005 году код был открыт под лицензией Apache и в дальнейшем развивался при участии работников компании Google. Исходные тексты  проекта распространяются (https://github.com/tesseract-ocr/tesseract) под лицензией Apache 2.0.


Tesseract включает в себя консольную утилиту и библиотеку libtesseract для встраивания функций распознавания текста в другие приложения. Из поддерживающих Tesseract сторонних GUI-интерфейсов (https://github.com/tesseract-ocr/tesseract/wiki/User-Project... можно отметить gImageReader (https://github.com/manisandro/gImageReader), VietOCR (http://vietocr.sourceforge.net/) и YAGF (https://sourceforge.net/projects/yagf-ocr/). Предлагается два движка распознавания: классический, распознающий текст на уровне шаблонов отдельных символов, и новый, базирующийся на применении системы машинного обучения на базе рекуррентной нейронной сети LSTM, оптимизированной для распознавания целиком строк и позволяющей добиться существенного увеличения точности. Готовые натренированные модели опубликованы для 123 языков (https://github.com/tesseract-ocr/tesseract/wiki/Data-Files). Для  оптимизации производительности предлагаются модули, использующие OpenMP и SIMD-инструкций AVX2, AVX или SSE4.1.

Основные улучшения (https://github.com/tesseract-ocr/tesseract/wiki/ReleaseNotes) в Tesseract 4.1:


-  Добавлена возможность вывода в XML-формате ALTO (https://en.wikipedia.org/wiki/ALTO_(XML)) (Analyzed Layout and Text Object). Для использования данного формата следует запустить приложение как "tessaract имя_изображения каталог_вывода alto";
-  Добавлены новые модули рендеринга LSTMBox и WordStrBox, упрощающие проведение обучения движка;
-  Добавлена поддержка псевдографики в выводе hOCR;
-  Добавлены написанные на языке Python альтернативные скрипты для тренировки движка на базе машинного обучения;

-  Расширены оптимизации с использованием инструкций AVX, AVX2 и SSE;
-  По умолчанию отключена поддержка OpenMP из-за проблем (https://github.com/tesseract-ocr/tesseract/issues/1171) с производительностью;
-  В движке LSTM добавлена поддержка белых и чёрных списков;
-  Улучшены сборочные сценарии на базе Cmake.


URL: https://groups.google.com/forum/#!topic/tesseract-ocr/oKtTOI...
Новость: https://www.opennet.ru/opennews/art.shtml?num=51081

 

Ваше сообщение
Имя*:
EMail:
Для отправки ответов на email укажите знак ! перед адресом, например, !user@host.ru (!! - не показывать email).
Более тонкая настройка отправки ответов производится в профиле зарегистрированного участника форума.
Заголовок*:
Сообщение*:
 
При общении не допускается: неуважительное отношение к собеседнику, хамство, унизительное обращение, ненормативная лексика, переход на личности, агрессивное поведение, обесценивание собеседника, провоцирование флейма голословными и заведомо ложными заявлениями. Не отвечайте на сообщения, явно нарушающие правила - удаляются не только сами нарушения, но и все ответы на них. Лог модерирования.



Партнёры:
PostgresPro
Inferno Solutions
Hosting by Hoster.ru
Хостинг:

Закладки на сайте
Проследить за страницей
Created 1996-2024 by Maxim Chirkov
Добавить, Поддержать, Вебмастеру