OCR PDF: hacer buscable un PDF escaneado
Sube un PDF escaneado: cada página se lee con reconocimiento de caracteres y el texto encontrado se añade de forma invisible bajo la imagen. Después puedes buscar una palabra, seleccionar y copiar, sin que cambie el aspecto del documento.
- Gratis
- 15 idiomas
- Imagen original intacta
- Procesado en tu dispositivo
100 % privado — Todo se procesa directamente en tu navegador: tus archivos, tu voz y tu imagen nunca se envían a los servidores de Chatzam.
¿Cómo hacer OCR a un PDF?
-
Sube el PDF escaneado
La herramienta detecta al instante las páginas que solo son imágenes y las que ya contienen texto.
-
Elige los idiomas
El español aparece por defecto; añade el inglés, el catalán u otro idioma si el documento mezcla varios.
-
Descarga el PDF buscable
Sigue el progreso página a página y descarga el PDF y, si lo necesitas, el texto sin formato en .txt.
Un escaneo que se comporta como un PDF de verdad
Texto invisible, palabra por palabra
Cada palabra reconocida se coloca exactamente sobre su imagen: la búsqueda y la selección caen en el sitio correcto.
Sin pérdida de calidad
Las imágenes de las páginas no se recomprimen ni se redimensionan; las páginas que ya tienen texto no se modifican.
Páginas torcidas enderezadas
Una página escaneada tumbada o del revés se detecta y se pone derecha antes de leerla.
Varios idiomas a la vez
Hasta 5 idiomas de 15, entre ellos el español, el inglés, el francés, el alemán, el italiano y el portugués.
¿Qué es el OCR de un PDF?
Un PDF que sale de un escáner o de una app de digitalización solo contiene fotos de páginas: tú ves palabras, pero el programa solo ve píxeles. No puedes buscar un nombre con Ctrl+F, copiar un párrafo ni hacer que un lector de pantalla lea el documento. El OCR, o reconocimiento óptico de caracteres, analiza la imagen y encuentra las letras que contiene. Esta herramienta coloca después ese texto en el PDF como una capa invisible alineada con cada palabra. El documento conserva exactamente el mismo aspecto, pero se puede buscar, seleccionar e indexar, como un PDF creado directamente desde un procesador de textos.
¿Cómo conseguir el mejor resultado?
La calidad del reconocimiento depende sobre todo del escaneo. Una digitalización a 300 ppp, bien iluminada, en blanco y negro o en escala de grises, da resultados excelentes con texto impreso. Las páginas se leen a unos 300 ppp, lo que deja margen incluso con un escaneo más ligero. Indica todos los idiomas presentes: para unas instrucciones bilingües en español e inglés, añade los dos; si no, las tildes, la ñ o las palabras extranjeras se reconocen peor. La letra manuscrita, los sellos y el texto sobre fondos muy recargados siguen siendo difíciles. Después del OCR, haz una prueba: busca una palabra poco común del documento para comprobar que se encuentra.
Tus documentos se quedan en tu dispositivo
Los PDF escaneados suelen contener papeles delicados: DNI, nóminas, contratos, recetas médicas. Aquí el archivo se abre y se lee directamente en tu navegador; nunca se envía a un servidor. Solo los modelos de idioma, unos pocos megabytes por idioma, se descargan la primera vez y el navegador los guarda en caché. El proceso tarda entre unos segundos y una veintena de segundos por página, según la potencia del dispositivo, y puedes cancelarlo en cualquier momento. Cuando el PDF ya sea buscable, puedes comprimirlo, convertirlo a Word o extraer su texto con las demás herramientas PDF.
Preguntas frecuentes
¿Cómo hacer editable un PDF escaneado?
El OCR añade el texto reconocido al PDF: así puedes buscarlo, seleccionarlo y copiarlo. Para trabajar el contenido, convierte después el PDF buscable con «PDF a Word» o exporta el texto en .txt.
¿Se sube mi PDF a un servidor?
No. El PDF se lee y se procesa por completo en tu navegador. Solo los modelos de idioma se descargan la primera vez y después quedan en caché.
¿El PDF resultante pesa más o tiene peor calidad?
Las imágenes originales se conservan tal cual, sin recompresión. El archivo solo aumenta el peso del texto añadido, normalmente unas decenas de kilobytes.
¿Qué pasa con las páginas que ya contienen texto?
Se detectan y se dejan intactas. Solo las páginas que son únicamente imágenes pasan por el reconocimiento de caracteres.
¿La herramienta reconoce la letra manuscrita?
Está pensada para texto impreso o mecanografiado. Una letra manuscrita muy cuidada puede reconocerse en parte, pero el resultado no es fiable.