Распознать текст в PDF

OCR добавляет в PDF невидимый текстовый слой поверх изображений, сохраняя их вид и размеры страниц. Текст можно искать, выделять и копировать.

Файл загружается по защищённому соединению и обрабатывается на нашем сервере. Оригинал удаляется сразу после обработки, результат — через 1 час (в аккаунте — через 24 часа).

Загрузите до 10 PDF-файлов: одинаковые настройки применяются ко всем сразу.

Выберите все языки документа — до трёх из 11 доступных. Без правильного языка текст может распознаться некорректно, автоматического определения нет.

При необходимости включите поворот боковых или перевёрнутых страниц и выравнивание наклона. Последнее недоступно при повторном OCR.

Запустите OCR. По умолчанию страницы с обычным текстом пропускаются, обрабатываются сканы. Чтобы заменить прежний невидимый слой, выберите режим повторного распознавания. При этом обычный текст страницы не превращается в изображение.

Скачайте PDF с текстовым слоем. При включённой настройке доступен также TXT, а для нескольких PDF — ZIP-архив.

Обработка занимает около 2–10 секунд на страницу, а точность зависит от качества скана. Почерк и сложные таблицы распознаются ненадёжно, поэтому проверяйте результат. Сервис создаёт PDF с текстовым слоем и, по настройке, TXT, но не редактируемый файл Word или таблицу Excel.

Если все страницы уже содержат текст, OCR может ничего не добавить: по умолчанию такие страницы пропускаются. Повторное распознавание заменяет прежний невидимый слой. PDF с паролем можно обработать, указав его, результат будет без защиты, а пароль удаляется после задачи. Цифровая подпись после OCR станет недействительной.

За один раз можно загрузить до 10 PDF. Для гостей лимит — 50 МБ и 20 страниц на документ, для зарегистрированных пользователей — 100 МБ и 100 страниц. Сервис бесплатный, регистрация не обязательна, водяной знак не добавляется.

PDF загружается на сервер по HTTPS и удаляется после обработки. Результаты хранятся 1 час для гостей и 24 часа для зарегистрированных пользователей, затем удаляются. Распознанный текст отдельно не хранится.

Частые вопросы

Какие языки можно выбрать для распознавания?

Доступны русский, английский, испанский, португальский, итальянский, французский, немецкий, польский, турецкий, чешский и нидерландский. Можно выбрать не более трёх языков одновременно. Если документ многоязычный, укажите каждый язык, иначе часть текста может выглядеть как набор случайных символов.

Можно ли распознать PDF, защищённый паролем?

Да. Для такого файла появится поле «Пароль PDF», где можно указать пароль, необходимый для обработки. Пароль используется только для этой задачи и не сохраняется, а готовый PDF будет без защиты паролем.

Что произойдёт с цифровой подписью PDF?

Распознавание возможно, но после обработки цифровая подпись станет недействительной. Если важно сохранить её действительность, не обрабатывайте подписанный оригинал.

Что делать, если распознанных слов нет?

Если все страницы уже содержат текст, режим по умолчанию может пропустить документ целиком. Чтобы обновить старый невидимый OCR-слой, выберите в настройках режим повторного распознавания. Если распознано мало слов, проверьте, что выбраны языки документа и скан не слишком размытый.

Какие файлы можно скачать и какие ограничения действуют?

Для одного PDF можно получить файл «<имя>-ocr.pdf» с текстовым слоем и, если включено отдельное сохранение текста, «<имя>.txt». Для нескольких документов предлагается архив «ocr-pdf.zip». За один раз можно загрузить до 10 PDF. Гостям доступны файлы размером до 50 МБ и документы до 20 страниц, зарегистрированным пользователям — до 100 МБ и 100 страниц на документ.