PDF Editor
Руководство по OCR

Как работает OCR

Digital, scanned и mixed pages, Tesseract RU/EN, confidence, ручная проверка и searchable output.

Когда использовать

Digital, scanned и mixed pages, Tesseract RU/EN, confidence, ручная проверка и searchable output. Ниже перечислены ситуации, в которых это руководство поможет выбрать правильный порядок действий и избежать лишней обработки файла.

  • В PDF нет поиска и выделения текста.
  • Mixed документ содержит сканы и уже существующий digital text.

Как это работает

Руководство разбивает тему на три последовательных этапа: классификация страниц, распознавание, review и экспорт. Пройдите их по порядку, чтобы заранее понимать результат и точки ручной проверки.

  1. 01Классификация страницDigital, scanned и mixed pages определяются до OCR.
  2. 02РаспознаваниеTesseract на нашем сервере обрабатывает только нужные страницы на RU/EN.
  3. 03Review и экспортСлова ниже confidence threshold проверяются, затем создаётся отдельный searchable PDF.

Что изменится

Перед началом работы важно понимать, какие части документа будут изменены, а какие останутся исходными. Перечень ниже описывает изменения в результирующей копии, а не скрытые изменения исходного файла.

  • К scanned page добавляется searchable text layer.
  • Existing digital text сохраняется и не распознаётся повторно без необходимости.
  • Исправления пользователя применяются только к подтверждённым OCR words.

Что потеряется

Некоторые операции меняют не только вид страницы, но и текстовый слой, формы, ссылки или подписи. Этот список помогает заранее решить, подходит ли отдельная результирующая копия для дальнейшей работы.

  • Растровое изображение страницы сохраняется, но исправленный OCR layer может отличаться от исходного визуального текста.
  • Если пользователь подтвердит patch, предыдущая версия распознанного слова заменяется в result copy.

Ограничения

Ограничения показывают границы текущей реализации и ситуации, в которых потребуется дополнительная проверка. Их стоит оценить до загрузки документа, особенно если файл сложный, защищённый или содержит важную структуру.

  • Поддерживаются русский и английский языки.
  • Низкое качество скана, сложная таблица или рукописный текст могут снизить confidence.
  • Результат нужно проверять вручную; безошибочное распознавание не обещается.

Связанные инструменты позволяют сразу перейти от объяснения к нужному действию. Каждый из них создаёт отдельный рабочий сценарий и показывает собственные ограничения перед запуском.