OCR PDF: распознать текст в отсканированном PDF

Загрузите отсканированный PDF: каждая страница проходит оптическое распознавание символов, а найденный текст невидимо добавляется под изображение. После этого можно искать слова, выделять и копировать текст, а внешний вид документа не меняется.

  • Бесплатно
  • 15 языков
  • Исходное изображение не меняется
  • Обработка на вашем устройстве

Перетащите сюда отсканированный PDF

PDF из отсканированных страниц (сканер, приложение камеры…)

Выбрать

100 % приватно — Всё обрабатывается прямо в вашем браузере: файлы, голос и изображение никогда не отправляются на серверы Chatzam.

Как распознать текст в PDF?

  1. Загрузите отсканированный PDF

    Инструмент сразу определяет, какие страницы — только изображения, а какие уже содержат текст.

  2. Выберите языки

    Русский предлагается по умолчанию; добавьте английский, немецкий или другой язык, если в документе их несколько.

  3. Скачайте PDF с поиском

    Следите за ходом распознавания по страницам, затем скачайте PDF и при необходимости простой текст в .txt.

Скан, который ведёт себя как настоящий PDF

Невидимый текст, точно по словам

Каждое распознанное слово размещается ровно на своём изображении: поиск и выделение попадают в нужное место.

Без потери качества

Изображения страниц не пережимаются и не масштабируются; страницы, где уже есть текст, не изменяются.

Перевёрнутые страницы выпрямляются

Страница, отсканированная боком или вверх ногами, определяется и поворачивается правильно перед распознаванием.

Несколько языков сразу

До 5 языков из 15, включая русский, английский, немецкий, французский, испанский и итальянский.

Что такое OCR для PDF?

PDF со сканера или из приложения для сканирования содержит только фотографии страниц: вы видите слова, а программа видит лишь пиксели. Поэтому нельзя найти фамилию через Ctrl+F, скопировать абзац или дать документ программе чтения с экрана. OCR — оптическое распознавание символов — анализирует изображение и находит на нём буквы. Затем этот инструмент добавляет текст в PDF невидимым слоем, выровненным по каждому слову. Документ выглядит точно так же, но в нём появляется поиск, выделение и индексация — как в PDF, созданном прямо из текстового редактора.

Как получить лучший результат?

Качество распознавания прежде всего зависит от скана. Сканирование в 300 dpi при хорошем освещении, в чёрно-белом режиме или в оттенках серого даёт отличный результат на печатном тексте. Страницы считываются примерно в 300 dpi, так что запас есть даже при более лёгком скане. Укажите все языки документа: для двуязычной инструкции на русском и английском добавьте оба, иначе иностранные слова распознаются хуже. Рукописный текст, печати и текст на пёстром фоне остаются сложными. После OCR проверьте результат: найдите поиском редкое слово из документа.

Ваши документы остаются на вашем устройстве

В отсканированных PDF часто бывают конфиденциальные бумаги: паспорта, расчётные листки, договоры, медицинские справки. Здесь файл открывается и читается прямо в браузере и никогда не отправляется на сервер. Загружаются только языковые модели — по несколько мегабайт на язык — при первом использовании, после чего они хранятся в кэше браузера. Обработка занимает от нескольких секунд до двадцати секунд на страницу в зависимости от мощности устройства; её можно отменить в любой момент. Когда PDF станет доступен для поиска, его можно сжать, конвертировать в Word или извлечь из него текст другими PDF-инструментами.

Частые вопросы

Как сделать отсканированный PDF редактируемым?

OCR добавляет в PDF распознанный текст: его можно искать, выделять и копировать. Чтобы редактировать содержимое, затем конвертируйте полученный PDF инструментом «PDF в Word» или экспортируйте текст в .txt.

Мой PDF загружается на сервер?

Нет. PDF читается и обрабатывается полностью в вашем браузере. Только языковые модели скачиваются в первый раз и затем хранятся в кэше.

Полученный PDF станет тяжелее или хуже по качеству?

Исходные изображения сохраняются как есть, без пережатия. Файл увеличивается только на размер добавленного текста — обычно на несколько десятков килобайт.

Что происходит со страницами, где уже есть текст?

Они определяются и остаются без изменений. Распознавание проходят только страницы, которые являются изображениями.

Распознаёт ли инструмент рукописный текст?

Он создан для печатного и машинописного текста. Очень аккуратный почерк может распознаться частично, но результат ненадёжен.

Другие бесплатные инструменты

Все бесплатные инструменты →