PDF OCR:让扫描版 PDF 可以搜索

导入扫描版 PDF:每一页都会经过文字识别,识别出的文字以隐藏方式加在图片下面。之后就能搜索关键词、选中和复制文字,而文档外观完全不变。

  • 免费
  • 15 种语言
  • 原图不变
  • 在你的设备上处理

把扫描版 PDF 拖到这里

扫描页面生成的 PDF(扫描仪、拍照 App 等)

选择文件

100% 隐私保护 — 一切均在您的浏览器中直接处理:您的文件、语音和图像永远不会发送到 Chatzam 的服务器。

如何对 PDF 进行 OCR 文字识别?

  1. 导入扫描版 PDF

    工具会立即找出哪些页面只是图片,哪些页面已经包含文字。

  2. 选择语言

    默认选中中文;如果文档里混有多种语言,再加上英语、日语或其他语言。

  3. 下载可搜索的 PDF

    逐页查看进度,然后下载 PDF,需要时还可以下载 .txt 纯文本。

让扫描件用起来像真正的 PDF

隐藏文字,逐词对齐

每个识别出的词都准确放在对应的图像上:搜索和选中的位置都不会错。

画质无损

页面图片既不重新压缩也不改变尺寸;已经有文字的页面保持不变。

自动纠正歪斜页面

横放或倒置扫描的页面会被检测出来,在识别前转正。

同时识别多种语言

可从 15 种语言中最多选择 5 种,包括中文、英语、日语、韩语、法语和德语。

什么是 PDF OCR?

扫描仪或扫描 App 生成的 PDF 里只有页面的照片:你看到的是文字,软件看到的却只是像素。这时无法用 Ctrl+F 查找姓名,无法复制段落,也无法让朗读软件读出文档。OCR(光学字符识别)会分析图像,找出其中的文字。本工具再把这些文字以隐藏图层的形式放进 PDF,与每个词精确对齐。文档外观完全不变,但变得可以搜索、选中和被索引,就像直接从文字处理软件生成的 PDF 一样。

怎样获得最好的识别效果?

识别质量首先取决于扫描件。以 300 dpi 扫描、光线充足、黑白或灰度模式,印刷文字的识别效果会非常好。页面按约 300 dpi 读取,即使扫描分辨率低一些也有余量。请选上文档中出现的所有语言:比如中英双语的说明书,两种都要加上,否则英文单词或数字会识别得差一些。手写字、印章以及背景很复杂的文字仍然难以识别。OCR 完成后可以测试一下:搜索文档中一个不常见的词,看能否找到。

你的文档始终留在设备上

扫描的 PDF 往往是敏感文件:身份证件、工资条、合同、处方。在这里,文件直接在你的浏览器中打开和读取,绝不会上传到服务器。只有语言模型(每种语言几 MB)会在第一次使用时下载,之后由浏览器缓存。根据设备性能,每页处理需要几秒到二十秒左右,可以随时取消。PDF 变得可搜索后,你还可以用其他 PDF 工具压缩它、转成 Word 或提取文字。

常见问题

怎样让扫描版 PDF 可以编辑?

OCR 会把识别出的文字加到 PDF 里:之后就能搜索、选中和复制。如果要修改内容,可以再用“PDF 转 Word”转换这个可搜索的 PDF,或者把文字导出为 .txt。

我的 PDF 会上传到服务器吗?

不会。PDF 完全在你的浏览器中读取和处理。只有语言模型会在第一次使用时下载,之后保存在缓存里。

得到的 PDF 会变大或者画质变差吗?

原始图片原样保留,不会重新压缩。文件只会增加添加的文字那一点大小,通常是几十 KB。

已经有文字的页面会怎么处理?

它们会被检测出来并保持不变。只有纯图片的页面才会进行文字识别。

能识别手写字吗?

本工具是为印刷体或打字文字设计的。非常工整的手写字可能部分识别出来,但结果并不可靠。

其他免费工具

查看所有免费工具 →