OCR PDF: gescande PDF doorzoekbaar maken
Upload een gescande PDF: elke pagina wordt gelezen met tekstherkenning, en de gevonden tekst wordt onzichtbaar onder de afbeelding toegevoegd. Daarna kun je naar een woord zoeken, tekst selecteren en kopiëren, zonder dat het document er anders uitziet.
- Gratis
- 15 talen
- Originele afbeelding intact
- Verwerkt op je apparaat
100% privé — Alles wordt rechtstreeks in je browser verwerkt: je bestanden, je stem en je beeld worden nooit naar de servers van Chatzam verzonden.
Hoe doe je OCR op een PDF?
-
Upload de gescande PDF
De tool ziet meteen welke pagina's alleen uit afbeeldingen bestaan en welke al tekst bevatten.
-
Kies de talen
Nederlands staat standaard ingesteld; voeg Engels, Duits of een andere taal toe als het document meerdere talen bevat.
-
Download de doorzoekbare PDF
Volg de voortgang pagina voor pagina en download daarna de PDF, en zo nodig de platte tekst als .txt.
Een scan die zich gedraagt als een echte PDF
Onzichtbare tekst, per woord
Elk herkend woord wordt precies op zijn afbeelding geplaatst: zoeken en selecteren komen op de juiste plek uit.
Geen kwaliteitsverlies
De afbeeldingen van de pagina's worden niet opnieuw gecomprimeerd of verkleind; pagina's die al tekst hebben, blijven ongewijzigd.
Scheve pagina's rechtgezet
Een pagina die gekanteld of ondersteboven is gescand, wordt herkend en rechtgezet voor het lezen.
Meerdere talen tegelijk
Tot 5 talen uit 15, waaronder Nederlands, Engels, Duits, Frans, Spaans en Italiaans.
Wat is OCR voor een PDF?
Een PDF uit een scanner of scan-app bevat alleen foto's van pagina's: jij ziet woorden, maar de software ziet alleen pixels. Je kunt dan niet met Ctrl+F naar een naam zoeken, geen alinea kopiëren en het document niet laten voorlezen door spraaksoftware. OCR, optische tekenherkenning, analyseert de afbeelding en vindt de letters die erin staan. Deze tool legt die tekst vervolgens in de PDF, als onzichtbare laag die op elk woord is uitgelijnd. Het document ziet er precies hetzelfde uit, maar wordt doorzoekbaar, selecteerbaar en indexeerbaar, net als een PDF die rechtstreeks vanuit een tekstverwerker is gemaakt.
Hoe krijg je het beste resultaat?
De kwaliteit van de herkenning hangt vooral af van de scan. Een scan op 300 dpi, goed belicht, in zwart-wit of grijstinten, geeft uitstekende resultaten bij gedrukte tekst. De pagina's worden op ongeveer 300 dpi gelezen, wat marge geeft, ook bij een lichtere scan. Geef alle talen op die erin voorkomen: voeg bij een tweetalige handleiding in het Nederlands en Frans beide talen toe, anders worden accenten of buitenlandse woorden minder goed herkend. Handschrift, stempels en tekst op een drukke achtergrond blijven lastig. Doe na de OCR een test: zoek een zeldzaam woord uit het document om te controleren of het wordt gevonden.
Je documenten blijven op je apparaat
Gescande PDF's bevatten vaak gevoelige papieren: identiteitsbewijzen, loonstroken, contracten, recepten. Hier wordt het bestand direct in je browser geopend en gelezen; het wordt nooit naar een server gestuurd. Alleen de taalmodellen, een paar megabyte per taal, worden bij het eerste gebruik gedownload en daarna door de browser in de cache bewaard. De verwerking duurt van enkele seconden tot een seconde of twintig per pagina, afhankelijk van de kracht van je apparaat; je kunt op elk moment annuleren. Is de PDF eenmaal doorzoekbaar, dan kun je hem met de andere PDF-tools verkleinen, omzetten naar Word of de tekst eruit halen.
Veelgestelde vragen
Hoe maak ik een gescande PDF bewerkbaar?
OCR voegt de herkende tekst toe aan de PDF: je kunt hem dan zoeken, selecteren en kopiëren. Wil je de inhoud bewerken, zet de doorzoekbare PDF dan daarna om met ‘PDF naar Word’ of exporteer de tekst als .txt.
Wordt mijn PDF naar een server gestuurd?
Nee. De PDF wordt volledig in je browser gelezen en verwerkt. Alleen de taalmodellen worden de eerste keer gedownload en daarna in de cache bewaard.
Is de nieuwe PDF groter of van mindere kwaliteit?
De originele afbeeldingen blijven zoals ze zijn, zonder nieuwe compressie. Het bestand wordt alleen groter met het gewicht van de toegevoegde tekst, meestal enkele tientallen kilobytes.
Wat gebeurt er met pagina's die al tekst bevatten?
Die worden herkend en blijven ongewijzigd. Alleen pagina's die uitsluitend uit afbeeldingen bestaan, gaan door de tekstherkenning.
Herkent de tool handschrift?
De tool is gemaakt voor gedrukte of getypte tekst. Heel netjes handschrift kan gedeeltelijk worden herkend, maar het resultaat is niet betrouwbaar.