OCR PDF: tornar um PDF escaneado pesquisável

Envie um PDF escaneado: cada página é lida por reconhecimento de caracteres, e o texto encontrado é adicionado de forma invisível sob a imagem. Depois você pode buscar uma palavra, selecionar e copiar, sem mudar a aparência do documento.

  • Grátis
  • 15 idiomas
  • Imagem original intacta
  • Processado no seu aparelho

Solte aqui seu PDF escaneado

Um PDF de páginas digitalizadas (scanner, app de fotos…)

Selecionar

100% privado — Tudo é processado diretamente no seu navegador: seus arquivos, sua voz e sua imagem nunca são enviados aos servidores do Chatzam.

Como fazer OCR em um PDF?

  1. Envie o PDF escaneado

    A ferramenta identifica na hora as páginas que são só imagens e as que já contêm texto.

  2. Escolha os idiomas

    O português vem selecionado por padrão; adicione inglês, espanhol ou outro idioma se o documento misturar vários.

  3. Baixe o PDF pesquisável

    Acompanhe o progresso página por página e depois baixe o PDF e, se precisar, o texto puro em .txt.

Um PDF escaneado que funciona como um PDF de verdade

Texto invisível, palavra por palavra

Cada palavra reconhecida é posicionada exatamente sobre a sua imagem: a busca e a seleção caem no lugar certo.

Nenhuma perda de qualidade

As imagens das páginas não são recomprimidas nem redimensionadas; páginas que já têm texto não são alteradas.

Páginas tortas endireitadas

Uma página escaneada deitada ou de cabeça para baixo é detectada e colocada na posição certa antes da leitura.

Vários idiomas ao mesmo tempo

Até 5 idiomas entre 15, incluindo português, inglês, espanhol, francês, alemão e italiano.

O que é OCR de PDF?

Um PDF gerado por um scanner ou por um aplicativo de digitalização contém apenas fotos das páginas: você vê palavras, mas o programa só vê pixels. Assim não dá para buscar um nome com Ctrl+F, copiar um parágrafo ou fazer um leitor de tela ler o documento. O OCR, sigla em inglês para reconhecimento óptico de caracteres, analisa a imagem e encontra as letras que ela contém. Esta ferramenta coloca esse texto no PDF, como uma camada invisível alinhada a cada palavra. O documento mantém exatamente a mesma aparência, mas passa a ser pesquisável, selecionável e indexável, como um PDF criado diretamente em um editor de texto.

Como conseguir o melhor resultado?

A qualidade do reconhecimento depende antes de tudo da digitalização. Um escaneamento a 300 dpi, bem iluminado, em preto e branco ou em tons de cinza, dá ótimos resultados com texto impresso. As páginas são lidas a cerca de 300 dpi, o que deixa margem mesmo com uma digitalização mais leve. Indique todos os idiomas presentes: para um manual bilíngue em português e inglês, adicione os dois; caso contrário, acentos e palavras estrangeiras são reconhecidos com menos precisão. Letra cursiva, carimbos e texto sobre fundo muito carregado continuam difíceis. Depois do OCR, faça um teste: busque uma palavra rara do documento para conferir se ela é encontrada.

Seus documentos ficam no seu aparelho

PDFs escaneados muitas vezes contêm papéis sensíveis: documentos de identidade, holerites, contratos, receitas médicas. Aqui, o arquivo é aberto e lido diretamente no seu navegador; ele nunca é enviado para um servidor. Apenas os modelos de idioma, alguns megabytes por idioma, são baixados no primeiro uso e depois ficam no cache do navegador. O processamento leva de alguns segundos a uns vinte segundos por página, conforme a potência do aparelho; você pode cancelar a qualquer momento. Com o PDF pesquisável, você pode comprimi-lo, convertê-lo em Word ou extrair o texto com as outras ferramentas de PDF.

Perguntas frequentes

Como tornar um PDF escaneado editável?

O OCR adiciona o texto reconhecido ao PDF: assim você pode buscá-lo, selecioná-lo e copiá-lo. Para editar o conteúdo, converta depois o PDF pesquisável com “PDF para Word” ou exporte o texto em .txt.

Meu PDF é enviado para algum servidor?

Não. O PDF é lido e processado inteiramente no seu navegador. Apenas os modelos de idioma são baixados na primeira vez e depois ficam em cache.

O PDF gerado fica mais pesado ou com qualidade pior?

As imagens originais são mantidas como estão, sem recompressão. O arquivo cresce só o peso do texto adicionado, em geral algumas dezenas de kilobytes.

O que acontece com as páginas que já têm texto?

Elas são detectadas e deixadas intactas. Só as páginas que são apenas imagens passam pelo reconhecimento de caracteres.

A ferramenta reconhece letra manuscrita?

Ela foi feita para texto impresso ou datilografado. Uma letra manuscrita muito caprichada pode ser parcialmente reconhecida, mas o resultado não é confiável.

Outras ferramentas gratuitas

Ver todas as ferramentas gratuitas →