OCR PDF : rendre un PDF scanné cherchable

Importez un PDF scanné : chaque page est lue par reconnaissance de caractères, et le texte trouvé est ajouté de façon invisible sous l'image. Vous pouvez ensuite chercher un mot, sélectionner et copier, sans que l'aspect du document change.

  • Gratuit
  • 15 langues
  • Image d'origine intacte
  • Traité sur votre appareil

Déposez votre PDF scanné ici

Un PDF de pages numérisées (scanner, appli photo…)

Sélectionner

100 % privé — Tout est traité directement dans votre navigateur : vos fichiers, votre voix et votre image ne sont jamais envoyés sur les serveurs de Chatzam.

Comment faire l'OCR d'un PDF ?

  1. Importez le PDF scanné

    L'outil repère aussitôt les pages qui ne sont que des images et celles qui contiennent déjà du texte.

  2. Choisissez les langues

    Le français est proposé par défaut ; ajoutez l'anglais, l'espagnol ou une autre langue si le document en mélange plusieurs.

  3. Téléchargez le PDF cherchable

    Suivez la progression page par page, puis récupérez le PDF, et si besoin le texte brut en .txt.

Un scan qui se comporte comme un vrai PDF

Texte invisible, au mot près

Chaque mot reconnu est placé exactement sur son image : la recherche et la sélection tombent au bon endroit.

Aucune perte de qualité

Les images des pages ne sont ni recompressées ni redimensionnées ; les pages qui ont déjà du texte ne sont pas modifiées.

Pages de travers redressées

Une page scannée couchée ou à l'envers est détectée et remise à l'endroit avant la lecture.

Plusieurs langues à la fois

Jusqu'à 5 langues parmi 15, dont le français, l'anglais, l'espagnol, l'allemand, l'italien et le portugais.

Qu'est-ce que l'OCR d'un PDF ?

Un PDF issu d'un scanner ou d'une application de numérisation ne contient que des photos de pages : vous voyez des mots, mais le logiciel ne voit que des pixels. Impossible alors de chercher un nom avec Ctrl+F, de copier un paragraphe ou de faire lire le document par un logiciel de synthèse vocale. L'OCR, pour reconnaissance optique de caractères, analyse l'image et retrouve les lettres qu'elle contient. Cet outil pose ensuite ce texte dans le PDF, sous forme de calque invisible aligné sur chaque mot. Le document garde exactement la même apparence, mais il devient cherchable, sélectionnable et indexable, comme un PDF créé directement depuis un traitement de texte.

Comment obtenir le meilleur résultat ?

La qualité de la reconnaissance dépend d'abord du scan. Une numérisation à 300 dpi, bien éclairée, en noir et blanc ou en niveaux de gris, donne d'excellents résultats sur du texte imprimé. Les pages sont lues à environ 300 dpi, ce qui laisse de la marge même avec un scan plus léger. Indiquez toutes les langues présentes : pour une notice bilingue français et anglais, ajoutez les deux, sinon les accents ou les mots étrangers sont moins bien reconnus. L'écriture manuscrite, les tampons et le texte sur fond très chargé restent difficiles. Après l'OCR, faites un essai : cherchez un mot rare du document pour vérifier qu'il est bien retrouvé.

Vos documents restent sur votre appareil

Les PDF scannés contiennent souvent des papiers sensibles : pièces d'identité, bulletins de salaire, contrats, ordonnances. Ici, le fichier est ouvert et lu directement dans votre navigateur ; il n'est jamais envoyé sur un serveur. Seuls les modèles de langue, quelques mégaoctets par langue, sont téléchargés lors de la première utilisation puis gardés en cache par le navigateur. Le traitement prend de quelques secondes à une vingtaine de secondes par page selon la puissance de l'appareil ; vous pouvez l'annuler à tout moment. Une fois le PDF cherchable, vous pouvez le compresser, le convertir en Word ou en extraire le texte avec les autres outils PDF.

Questions fréquentes

Comment rendre un PDF scanné modifiable ?

L'OCR ajoute le texte reconnu au PDF : vous pouvez alors le chercher, le sélectionner et le copier. Pour retravailler le contenu, convertissez ensuite le PDF cherchable avec « PDF en Word » ou exportez le texte en .txt.

Mon PDF est-il envoyé sur un serveur ?

Non. Le PDF est lu et traité entièrement dans votre navigateur. Seuls les modèles de langue sont téléchargés la première fois, puis gardés en cache.

Le PDF obtenu est-il plus lourd ou de moins bonne qualité ?

Les images d'origine sont conservées telles quelles, sans recompression. Le fichier grossit seulement du poids du texte ajouté, en général quelques dizaines de kilo-octets.

Que se passe-t-il pour les pages qui contiennent déjà du texte ?

Elles sont détectées et laissées intactes. Seules les pages qui ne sont que des images passent par la reconnaissance de caractères.

L'outil reconnaît-il l'écriture manuscrite ?

Il est conçu pour le texte imprimé ou dactylographié. Une écriture manuscrite très soignée peut être partiellement reconnue, mais le résultat n'est pas fiable.

Autres outils gratuits

Voir tous les outils gratuits →