PDF Editor
Доступно сейчасИнструмент PDF

Распознавайте текст и добавляйте поиск в сканированный PDF

Распознавайте русский и английский текст в сканах через Tesseract на нашем сервере и создавайте PDF с поиском.

OCR на нашем сервере распознаёт русский и английский текст в scanned/mixed страницах и сохраняет цифровой текст.
Инструмент PDF

Когда пригодится инструмент

OCR на нашем сервере распознаёт русский и английский текст в scanned/mixed страницах и сохраняет цифровой текст. Ниже собраны типовые ситуации, для которых предназначен этот сценарий, чтобы можно было выбрать инструмент до загрузки документа.

  • Добавить поиск в отсканированный документ.
  • Распознать mixed PDF, не заменяя уже существующий digital text.
Как это работает

Распознать PDF онлайн

Работа с инструментом «Распознать PDF онлайн» состоит из 3 последовательных этапов. На каждом этапе проверяйте выбранные настройки и ожидаемый результат, потому что обработка создаёт новую копию, а не перезаписывает исходник.

  1. 01Загрузите PDF

    Выберите сканированный или смешанный PDF.

  2. 02Запустите OCR

    Укажите страницы и язык распознавания.

  3. 03Проверьте и скачайте

    Проверьте сомнительные слова и скачайте PDF с поиском.

Что можно сделать

Возможности ниже описывают, что именно попадёт в рабочий сценарий и результирующий файл. Они помогают проверить, покрывает ли инструмент задачу целиком или потребуется ещё один этап обработки.

  • OCR на русском и английском
  • Определение страниц-сканов
  • Проверка уверенности
  • PDF с поиском

Ограничения и важные детали

Ограничения нужны для предсказуемого результата: они описывают поддерживаемые файлы, границы обработки и свойства PDF, которые могут потребовать ручной проверки. Ознакомьтесь с ними до запуска, особенно для сложных документов.

  • До 100 OCR-страниц на задачу
  • Рукописный текст не гарантируется
  • PDF не сохраняется в постоянной библиотеке
  • Неактивная гостевая сессия завершается через 15 минут
  • Жёсткий максимум сессии — 2 часа

Перед началом работы

  • Сохраните исходный файл до завершения проверки результата
  • Проверьте, защищён ли PDF паролем или цифровой подписью
  • Определите страницы и объекты, которые должны измениться
  • Для незнакомого сценария сначала используйте копию без чувствительных данных

Как проверить результат

  • Откройте скачанную копию во втором PDF-просмотрщике
  • Проверьте каждую изменённую страницу в обычном и увеличенном масштабе
  • Проверьте поиск по тексту, ссылки, формы и визуальное качество
  • Убедитесь, что конфиденциальные данные и метаданные соответствуют задаче
Пример

Сделать скан доступным для поиска

Сценарий «Сделать скан доступным для поиска» показывает путь от исходного файла до отдельного результата. Он помогает заранее понять, какое действие выполняется и что следует проверить после скачивания.

Исходник
Синтетический скан из двух страниц.
Действие
Выбрать русский и английский языки, затем проверить слова с низкой уверенностью.
Результат
Новый searchable PDF и отчёт проверки распознавания.
Приватность

Временная обработка в Германии, EU

Файл обрабатывается только в рамках временной гостевой сессии. После завершения работы доступ закрывается, а исходник и результаты удаляются по правилам жизненного цикла сервиса.

  • Нет постоянной библиотеки документов
  • Нет внешних AI-, OCR- и PDF-провайдеров
  • 15 минут до завершения неактивной сессии
  • Жёсткий максимум сессии — 2 часа
FAQ

Вопросы и ответы

Ответы относятся именно к сценарию «Распознать PDF онлайн» и дополняют основную инструкцию. Здесь разобраны настройки, ожидаемый результат и случаи, которые чаще всего требуют уточнения до запуска.

Какие языки поддерживаются?

Поддерживаются русский, английский и смешанные русско-английские документы.

Можно ли исправить ошибки распознавания?

Слова с низкой уверенностью можно проверить и исправить перед перестроением PDF с поиском.

Документ отправляется во внешний AI-сервис?

Нет. OCR выполняется через Tesseract в собственном контуре сервиса.

Нужно ли проверять результат OCR?

Нет. Слова с низкой уверенностью помечаются для ручной проверки.

Центр помощи

Типичные ошибки и следующий шаг

Если обработку нельзя продолжить, сервис показывает код причины и безопасный следующий шаг. Сначала исправьте указанную проблему, затем повторите загрузку или выберите другой режим — исходный документ при этом не изменяется.

OCR_LOW_CONFIDENCE

Часть распознанных слов не достигла заданного порога уверенности.

Проверьте отмеченные слова и внесите исправления до экспорта.
OCR_ADAPTER_UNAVAILABLE

Локальный адаптер Tesseract временно недоступен.

Повторите позже или продолжите без OCR после восстановления адаптера.
Центр помощи
Центр помощи

Полезные руководства

Практические руководства дают контекст, которого недостаточно в пошаговой инструкции: объясняют выбор режима, последствия обработки и правила безопасной работы с файлом.

Редакционная и техническая проверка: · следующая проверка:

Инструменты

Похожие инструменты продолжают текущий сценарий: помогают подготовить страницы, изменить содержимое, проверить безопасность или преобразовать результат в другой формат.