OCR PDF: rendere ricercabile un PDF scansionato

Carica un PDF scansionato: ogni pagina viene letta con il riconoscimento dei caratteri e il testo trovato viene aggiunto in modo invisibile sotto l'immagine. Poi puoi cercare una parola, selezionare e copiare, senza che l'aspetto del documento cambi.

  • Gratis
  • 15 lingue
  • Immagine originale intatta
  • Elaborato sul tuo dispositivo

Trascina qui il tuo PDF scansionato

Un PDF di pagine scansionate (scanner, app fotocamera…)

Seleziona

100% privato — Tutto viene elaborato direttamente nel tuo browser: i tuoi file, la tua voce e la tua immagine non vengono mai inviati ai server di Chatzam.

Come fare l'OCR di un PDF?

  1. Carica il PDF scansionato

    Lo strumento individua subito le pagine che sono solo immagini e quelle che contengono già del testo.

  2. Scegli le lingue

    L'italiano è proposto di default; aggiungi l'inglese, lo spagnolo o un'altra lingua se il documento ne mescola più di una.

  3. Scarica il PDF ricercabile

    Segui l'avanzamento pagina per pagina, poi scarica il PDF e, se serve, il testo semplice in .txt.

Una scansione che si comporta come un vero PDF

Testo invisibile, parola per parola

Ogni parola riconosciuta viene posizionata esattamente sulla sua immagine: ricerca e selezione cadono nel punto giusto.

Nessuna perdita di qualità

Le immagini delle pagine non vengono né ricompresse né ridimensionate; le pagine che hanno già del testo non vengono modificate.

Pagine storte raddrizzate

Una pagina scansionata di lato o capovolta viene rilevata e rimessa dritta prima della lettura.

Più lingue insieme

Fino a 5 lingue tra 15, tra cui italiano, inglese, francese, spagnolo, tedesco e portoghese.

Che cos'è l'OCR di un PDF?

Un PDF creato da uno scanner o da un'app di scansione contiene solo foto di pagine: tu vedi parole, ma il programma vede solo pixel. Non puoi quindi cercare un nome con Ctrl+F, copiare un paragrafo o far leggere il documento da un programma di sintesi vocale. L'OCR, cioè il riconoscimento ottico dei caratteri, analizza l'immagine e ritrova le lettere che contiene. Questo strumento inserisce poi il testo nel PDF, come livello invisibile allineato su ogni parola. Il documento mantiene esattamente lo stesso aspetto, ma diventa ricercabile, selezionabile e indicizzabile, come un PDF creato direttamente da un programma di videoscrittura.

Come ottenere il risultato migliore?

La qualità del riconoscimento dipende prima di tutto dalla scansione. Una scansione a 300 dpi, ben illuminata, in bianco e nero o in scala di grigi, dà ottimi risultati sul testo stampato. Le pagine vengono lette a circa 300 dpi, il che lascia margine anche con una scansione più leggera. Indica tutte le lingue presenti: per un libretto di istruzioni bilingue italiano e inglese, aggiungile entrambe, altrimenti gli accenti o le parole straniere vengono riconosciuti peggio. La scrittura a mano, i timbri e il testo su sfondi molto carichi restano difficili. Dopo l'OCR, fai una prova: cerca una parola rara del documento per verificare che venga trovata.

I tuoi documenti restano sul tuo dispositivo

I PDF scansionati contengono spesso documenti delicati: carte d'identità, buste paga, contratti, ricette mediche. Qui il file viene aperto e letto direttamente nel tuo browser; non viene mai inviato a un server. Solo i modelli linguistici, qualche megabyte per lingua, vengono scaricati al primo utilizzo e poi conservati nella cache del browser. L'elaborazione richiede da pochi secondi a una ventina di secondi per pagina, a seconda della potenza del dispositivo; puoi annullarla in qualsiasi momento. Una volta reso ricercabile il PDF, puoi comprimerlo, convertirlo in Word o estrarne il testo con gli altri strumenti PDF.

Domande frequenti

Come si rende modificabile un PDF scansionato?

L'OCR aggiunge il testo riconosciuto al PDF: a quel punto puoi cercarlo, selezionarlo e copiarlo. Per rielaborare il contenuto, converti poi il PDF ricercabile con «PDF in Word» oppure esporta il testo in .txt.

Il mio PDF viene inviato a un server?

No. Il PDF viene letto ed elaborato interamente nel tuo browser. Solo i modelli linguistici vengono scaricati la prima volta e poi conservati nella cache.

Il PDF ottenuto è più pesante o di qualità inferiore?

Le immagini originali vengono conservate così come sono, senza ricompressione. Il file aumenta solo del peso del testo aggiunto, in genere qualche decina di kilobyte.

Cosa succede alle pagine che contengono già del testo?

Vengono rilevate e lasciate intatte. Solo le pagine che sono semplici immagini passano per il riconoscimento dei caratteri.

Lo strumento riconosce la scrittura a mano?

È pensato per il testo stampato o dattiloscritto. Una calligrafia molto ordinata può essere riconosciuta in parte, ma il risultato non è affidabile.

Altri strumenti gratuiti

Vedi tutti gli strumenti gratuiti →