OCR PDF: zeskanowany PDF z tekstem do przeszukiwania

Wgraj zeskanowany PDF: każda strona zostanie odczytana przez rozpoznawanie znaków, a znaleziony tekst dodany niewidocznie pod obrazem. Potem możesz wyszukać słowo, zaznaczyć i skopiować tekst, a wygląd dokumentu się nie zmieni.

  • Za darmo
  • 15 języków
  • Oryginalny obraz bez zmian
  • Przetwarzane na Twoim urządzeniu

Wrzuć tutaj zeskanowany PDF

PDF ze zeskanowanymi stronami (skaner, aplikacja aparatu…)

Wybierz

100% prywatności — Wszystko jest przetwarzane bezpośrednio w Twojej przeglądarce: Twoje pliki, głos i obraz nigdy nie są wysyłane na serwery Chatzam.

Jak zrobić OCR pliku PDF?

  1. Wgraj zeskanowany PDF

    Narzędzie od razu rozpoznaje strony, które są tylko obrazami, i te, które już zawierają tekst.

  2. Wybierz języki

    Domyślnie ustawiony jest polski; dodaj angielski, niemiecki lub inny język, jeśli dokument łączy kilka języków.

  3. Pobierz przeszukiwalny PDF

    Śledź postęp strona po stronie, a potem pobierz PDF i w razie potrzeby sam tekst w pliku .txt.

Skan, który działa jak prawdziwy PDF

Niewidoczny tekst co do słowa

Każde rozpoznane słowo jest umieszczone dokładnie na swoim obrazie: wyszukiwanie i zaznaczanie trafiają we właściwe miejsce.

Bez utraty jakości

Obrazy stron nie są ponownie kompresowane ani skalowane; strony, które już mają tekst, pozostają bez zmian.

Krzywe strony prostowane

Strona zeskanowana bokiem lub do góry nogami jest wykrywana i obracana przed odczytem.

Kilka języków naraz

Do 5 języków spośród 15, w tym polski, angielski, niemiecki, francuski, hiszpański i włoski.

Czym jest OCR pliku PDF?

PDF ze skanera lub aplikacji do skanowania zawiera tylko zdjęcia stron: Ty widzisz słowa, a program widzi jedynie piksele. Nie da się wtedy wyszukać nazwiska skrótem Ctrl+F, skopiować akapitu ani odsłuchać dokumentu w programie do syntezy mowy. OCR, czyli optyczne rozpoznawanie znaków, analizuje obraz i odnajduje zawarte w nim litery. To narzędzie umieszcza następnie ten tekst w PDF jako niewidoczną warstwę dopasowaną do każdego słowa. Dokument wygląda dokładnie tak samo, ale można go przeszukiwać, zaznaczać i indeksować, jak PDF utworzony bezpośrednio w edytorze tekstu.

Jak uzyskać najlepszy wynik?

Jakość rozpoznawania zależy przede wszystkim od skanu. Skanowanie w 300 dpi, przy dobrym oświetleniu, w czerni i bieli lub w skali szarości daje doskonałe wyniki przy tekście drukowanym. Strony są odczytywane w około 300 dpi, co zostawia zapas nawet przy lżejszym skanie. Wskaż wszystkie języki występujące w dokumencie: przy instrukcji po polsku i angielsku dodaj oba, inaczej polskie znaki (ą, ę, ł, ż) lub obce słowa zostaną rozpoznane gorzej. Pismo odręczne, pieczątki i tekst na bardzo zróżnicowanym tle nadal sprawiają trudność. Po OCR zrób test: wyszukaj rzadkie słowo z dokumentu, aby sprawdzić, czy zostało znalezione.

Twoje dokumenty zostają na Twoim urządzeniu

Zeskanowane PDF często zawierają wrażliwe dokumenty: dowody osobiste, paski wypłaty, umowy, recepty. Tutaj plik jest otwierany i odczytywany bezpośrednio w przeglądarce; nigdy nie trafia na serwer. Przy pierwszym użyciu pobierane są tylko modele językowe, po kilka megabajtów na język, a przeglądarka przechowuje je potem w pamięci podręcznej. Przetwarzanie trwa od kilku do około dwudziestu sekund na stronę, zależnie od mocy urządzenia; możesz je w każdej chwili przerwać. Gdy PDF jest już przeszukiwalny, możesz go skompresować, zamienić na Word lub wyodrębnić z niego tekst innymi narzędziami PDF.

Najczęściej zadawane pytania

Jak sprawić, by zeskanowany PDF dało się edytować?

OCR dodaje do PDF rozpoznany tekst: możesz go wtedy wyszukiwać, zaznaczać i kopiować. Aby dalej pracować nad treścią, przekonwertuj przeszukiwalny PDF narzędziem „PDF na Word” albo wyeksportuj tekst do pliku .txt.

Czy mój PDF jest wysyłany na serwer?

Nie. PDF jest odczytywany i przetwarzany w całości w przeglądarce. Tylko modele językowe są pobierane za pierwszym razem, a potem przechowywane w pamięci podręcznej.

Czy otrzymany PDF jest większy lub gorszej jakości?

Oryginalne obrazy są zachowane bez zmian, bez ponownej kompresji. Plik rośnie tylko o rozmiar dodanego tekstu, zwykle o kilkadziesiąt kilobajtów.

Co dzieje się ze stronami, które już zawierają tekst?

Są wykrywane i pozostawiane bez zmian. Przez rozpoznawanie znaków przechodzą tylko strony, które są wyłącznie obrazami.

Czy narzędzie rozpoznaje pismo odręczne?

Jest przeznaczone do tekstu drukowanego lub pisanego na maszynie. Bardzo staranne pismo odręczne może zostać częściowo rozpoznane, ale wynik nie jest wiarygodny.

Inne darmowe narzędzia

Zobacz wszystkie darmowe narzędzia →