OCR PDF: распознать текст в отсканированном PDF
Загрузите отсканированный PDF: каждая страница проходит оптическое распознавание символов, а найденный текст невидимо добавляется под изображение. После этого можно искать слова, выделять и копировать текст, а внешний вид документа не меняется.
- Бесплатно
- 15 языков
- Исходное изображение не меняется
- Обработка на вашем устройстве
100 % приватно — Всё обрабатывается прямо в вашем браузере: файлы, голос и изображение никогда не отправляются на серверы Chatzam.
Как распознать текст в PDF?
-
Загрузите отсканированный PDF
Инструмент сразу определяет, какие страницы — только изображения, а какие уже содержат текст.
-
Выберите языки
Русский предлагается по умолчанию; добавьте английский, немецкий или другой язык, если в документе их несколько.
-
Скачайте PDF с поиском
Следите за ходом распознавания по страницам, затем скачайте PDF и при необходимости простой текст в .txt.
Скан, который ведёт себя как настоящий PDF
Невидимый текст, точно по словам
Каждое распознанное слово размещается ровно на своём изображении: поиск и выделение попадают в нужное место.
Без потери качества
Изображения страниц не пережимаются и не масштабируются; страницы, где уже есть текст, не изменяются.
Перевёрнутые страницы выпрямляются
Страница, отсканированная боком или вверх ногами, определяется и поворачивается правильно перед распознаванием.
Несколько языков сразу
До 5 языков из 15, включая русский, английский, немецкий, французский, испанский и итальянский.
Что такое OCR для PDF?
PDF со сканера или из приложения для сканирования содержит только фотографии страниц: вы видите слова, а программа видит лишь пиксели. Поэтому нельзя найти фамилию через Ctrl+F, скопировать абзац или дать документ программе чтения с экрана. OCR — оптическое распознавание символов — анализирует изображение и находит на нём буквы. Затем этот инструмент добавляет текст в PDF невидимым слоем, выровненным по каждому слову. Документ выглядит точно так же, но в нём появляется поиск, выделение и индексация — как в PDF, созданном прямо из текстового редактора.
Как получить лучший результат?
Качество распознавания прежде всего зависит от скана. Сканирование в 300 dpi при хорошем освещении, в чёрно-белом режиме или в оттенках серого даёт отличный результат на печатном тексте. Страницы считываются примерно в 300 dpi, так что запас есть даже при более лёгком скане. Укажите все языки документа: для двуязычной инструкции на русском и английском добавьте оба, иначе иностранные слова распознаются хуже. Рукописный текст, печати и текст на пёстром фоне остаются сложными. После OCR проверьте результат: найдите поиском редкое слово из документа.
Ваши документы остаются на вашем устройстве
В отсканированных PDF часто бывают конфиденциальные бумаги: паспорта, расчётные листки, договоры, медицинские справки. Здесь файл открывается и читается прямо в браузере и никогда не отправляется на сервер. Загружаются только языковые модели — по несколько мегабайт на язык — при первом использовании, после чего они хранятся в кэше браузера. Обработка занимает от нескольких секунд до двадцати секунд на страницу в зависимости от мощности устройства; её можно отменить в любой момент. Когда PDF станет доступен для поиска, его можно сжать, конвертировать в Word или извлечь из него текст другими PDF-инструментами.
Частые вопросы
Как сделать отсканированный PDF редактируемым?
OCR добавляет в PDF распознанный текст: его можно искать, выделять и копировать. Чтобы редактировать содержимое, затем конвертируйте полученный PDF инструментом «PDF в Word» или экспортируйте текст в .txt.
Мой PDF загружается на сервер?
Нет. PDF читается и обрабатывается полностью в вашем браузере. Только языковые модели скачиваются в первый раз и затем хранятся в кэше.
Полученный PDF станет тяжелее или хуже по качеству?
Исходные изображения сохраняются как есть, без пережатия. Файл увеличивается только на размер добавленного текста — обычно на несколько десятков килобайт.
Что происходит со страницами, где уже есть текст?
Они определяются и остаются без изменений. Распознавание проходят только страницы, которые являются изображениями.
Распознаёт ли инструмент рукописный текст?
Он создан для печатного и машинописного текста. Очень аккуратный почерк может распознаться частично, но результат ненадёжен.