OCR PDF:スキャンしたPDFを検索可能にする
スキャンしたPDFを読み込むと、各ページを文字認識(OCR)で読み取り、見つかったテキストを画像の下に透明な文字として追加します。見た目はそのままで、単語の検索、選択、コピーができるようになります。
- 無料
- 15言語対応
- 元の画像はそのまま
- 端末内で処理
100% プライベート — すべてブラウザ内で直接処理されます。ファイル、音声、映像がChatzamのサーバーに送信されることはありません。
PDFをOCRする方法
-
スキャンしたPDFを読み込む
画像だけのページと、すでにテキストを含むページをすぐに判別します。
-
言語を選ぶ
最初は日本語が選択されています。英語などが混ざった文書なら、その言語も追加してください。
-
検索可能なPDFをダウンロード
ページごとの進み具合を確認し、完了したらPDFを、必要ならテキストだけを.txtでダウンロードします。
スキャンが本物のPDFのように使える
単語単位で正確な透明テキスト
認識した各単語を画像上のぴったりの位置に配置。検索や選択が正しい場所にヒットします。
画質の劣化なし
ページの画像は再圧縮もリサイズもしません。すでにテキストのあるページは変更しません。
傾いたページも自動補正
横向きや上下逆にスキャンされたページを検出し、正しい向きに直してから読み取ります。
複数言語を同時に
日本語、英語、中国語、韓国語、フランス語、ドイツ語など15言語から最大5つまで選べます。
PDFのOCRとは?
スキャナーやスキャンアプリで作ったPDFには、ページの写真しか入っていません。人間には文字が見えていても、ソフトにとってはただのピクセルです。そのため、Ctrl+Fで名前を検索したり、段落をコピーしたり、読み上げソフトで読ませたりできません。OCR(光学文字認識)は画像を解析して、そこに含まれる文字を読み取る技術です。このツールは認識したテキストを、各単語に位置を合わせた透明なレイヤーとしてPDFに追加します。見た目はまったく変わらず、ワープロから直接作ったPDFのように検索、選択、インデックス登録ができるようになります。
認識精度を上げるコツ
認識の精度は、まずスキャンの品質で決まります。300 dpiで明るく、白黒またはグレースケールでスキャンすれば、印刷された文字ならとても良い結果が得られます。ページは約300 dpiで読み取るので、少し軽めのスキャンでも余裕があります。文書に含まれる言語はすべて指定しましょう。日本語と英語が混ざった説明書なら両方を追加しないと、英単語や記号がうまく認識されにくくなります。手書き文字、印鑑、背景が複雑な文字はまだ苦手です。OCRのあとは、文書中の珍しい単語を検索して、正しく見つかるか試してみてください。
書類はあなたの端末から出ません
スキャンPDFには、本人確認書類、給与明細、契約書、処方箋など、大切な書類が多く含まれます。このツールでは、ファイルをブラウザ内で直接開いて読み取るので、サーバーに送信されることはありません。ダウンロードされるのは言語モデル(1言語あたり数MB)だけで、初回利用時に読み込まれたあとはブラウザにキャッシュされます。処理時間は端末の性能によって1ページ数秒〜20秒ほどで、いつでもキャンセルできます。検索可能になったPDFは、ほかのPDFツールで圧縮したり、Wordに変換したり、テキストを抽出したりできます。
よくある質問
スキャンしたPDFを編集できるようにするには?
OCRで認識したテキストがPDFに追加され、検索・選択・コピーができるようになります。内容を書き換えたい場合は、検索可能になったPDFを「PDFをWordに変換」で変換するか、テキストを.txtで書き出してください。
PDFはサーバーに送信されますか?
いいえ。PDFはすべてブラウザ内で読み込まれ、処理されます。ダウンロードされるのは初回の言語モデルだけで、その後はキャッシュされます。
できたPDFは重くなったり、画質が落ちたりしますか?
元の画像は再圧縮せずそのまま残します。ファイルが増えるのは追加したテキストの分だけで、通常は数十KB程度です。
すでにテキストがあるページはどうなりますか?
自動で判別し、そのまま残します。文字認識を行うのは画像だけのページです。
手書き文字も認識できますか?
このツールは印刷された文字やタイプされた文字向けです。とても丁寧な手書き文字なら一部認識できることもありますが、結果は信頼できません。