PDF OCR テキスト認識
ブラウザ上でスキャンPDFからOCRでテキストを認識・抽出します。
ファイルをドロップまたはクリックしてアップロード
Max 100 MB
OCR(光学文字認識)は、PDF の中に画像として存在する文字を、選択と検索が可能な本当のテキストに変える処理です。スキャン文書、レシートのスマホ写真、画像中心の古い PDF——どれにも効きます。OCR をかけたあとは、テキストのコピー、ファイル内検索、そして PDF から Word への変換などの他ツールへの受け渡しができます。 OCR でいちばん難しいのは言語対応です。英語を認識するのと、中国語・日本語・アラビア文字を認識するのはまったく別の問題です。本ツールは Tesseract.js を通じて 100 以上の言語に対応していますが、大きな言語パック(CJK など)は初回利用時に追加のモデルデータをダウンロードします。 OCR はすべてブラウザ内で動きます。Tesseract WASM エンジンが各ページを処理し、元の画像を残したまま PDF にテキストレイヤーを追加し、検索可能な出力を生成します。データは一切端末を離れません。
最終確認: 2026年7月
この機能について
OCR は3つの段階で進みます。まず画像前処理でページを正規化します——二値化でカラーを白黒に変え、傾き補正で歪んだスキャンをまっすぐにし、ノイズ除去で細かな汚れを取り除きます。次にレイアウト解析でページをテキスト領域と非テキスト領域(画像、線、表)に分割し、テキスト領域内でさらに個々の行と単語を特定します。3番目に文字認識では LSTM(長短期記憶)ニューラルネットワークが単語画像を文字列に変換します。現代の OCR は、高 DPI できれいに印刷されたテキストのスキャンなら驚くほど正確で、英語なら 99% を超えることも珍しくありません。手書き、低解像度画像、複雑なレイアウトでは精度が大きく落ちます。
使い方
- 1スキャンや画像ベースのページを含む PDF を選択します。もし PDF にすでに選択可能なテキストがあるなら OCR は不要です。時間を節約するには「テキスト抽出」ツールを使ってください。
- 2PDF に含まれる言語を選びます。実際に含まれる言語だけを選んでください——使わない言語まで追加すると処理が遅くなるだけで精度は上がりません。多言語混在文書では主要な言語を選択してください。
- 3処理をクリックします。ツールが言語モデルを読み込み(初回は約 10MB のモデルをダウンロードするため 10〜30 秒かかることがあります)、各ページを処理します。典型的なスキャンならページあたり 2〜5 秒です。
- 4OCR 済み PDF をダウンロードします。見た目は入力とほぼ同じですが、テキストの選択、コピー、検索ができるようになります。Ctrl+F を試して認識が正しいか確認してください。
使い方のコツ
- OCR の精度はスキャン品質に大きく依存します。印刷テキストの 300 DPI スキャンは 98〜99%。150 DPI では 85〜90% に下がります。スマホ写真は幅があり、光量が良ければ 90〜95%、悪ければ 70〜80% です。
- 初回は Tesseract WASM エンジン(約 15MB)と言語モデル(1つあたり 5〜15MB)をダウンロードします。ダウンロード後はキャッシュされ、2回目以降はずっと速くなります。
- CJK 言語(中国語、日本語、韓国語)の言語パックは明らかに大きく(1言語あたり約 15〜25MB)、初回はラテン系より時間がかかります。
- 手書き認識は本ツールが得意とするものではありません。Tesseract は印刷体には強いですが草書には弱く、手書きでは精度が 30〜60% まで落ちます。
- OCR は見える画像の下に不可視のテキストレイヤーを追加します。出力 PDF が見た目上変わっていなくても、それが正常です。テキストを選択して OCR が効いたことを確認してください。
よくある用途
- 図書館員が古い印刷レポートを検索可能なアーカイブにデジタル化し、内容を打ち直さずに済ませる。
- 弁護士がスキャンした裁判資料に OCR をかけ、特定の判例参照を全文検索できるようにする。
- 研究者が古いジャーナル PDF(画像だけのスキャン)を処理し、文献レビュー用に引用を抽出する。
- 経理チームがスキャンした請求書に OCR をかけ、監査に備えて検索可能なフォルダに保存する。
- 翻訳者がスキャンした文書を先に OCR し、抽出したテキストを翻訳ソフトに流し込む。
- ジャーナリストが漏洩文書の PDF(多くはスキャン画像)を処理し、数百ページの中から重要な人名や日付を検索する。
技術メモ
- 本ツールは Tesseract.js 7.x(WebAssembly ビルド)を Web Worker 内で実行するので、OCR 中もブラウザタブは固まりません。
- 言語モデルは初回利用時にダウンロードされ、ブラウザにキャッシュされます。ラテン系言語は 1言語あたり約 5〜8MB、CJK 言語は約 15〜25MB です。
- OCR 処理速度は、現代のデスクトップ CPU 上での 300 DPI の典型的な印刷スキャンでページあたり 2〜5 秒です。
- 出力 PDF は、元のページ画像の上に不可視のテキストレイヤーを重ねた形になります。文字は視覚的には見えませんが、選択も検索も可能です。
- 対応言語は 100 以上あり、英語、フランス語、ドイツ語、スペイン語、中国語(簡体字と繁体字)、日本語、韓国語、アラビア語、ヘブライ語、ロシア語などを含みます。
- 多言語ページに対応:複数の言語を選ぶと、Tesseract がそれぞれの言語で認識を実行します。本当に混在するページの精度は単一言語ページよりも低くなります。
プライバシーを前提に設計
このツールはブラウザ内で動作します。利用中にファイルが当社サーバーへアップロードされることはありません。
制限事項
- 手書きはうまく認識できません。Tesseract は印刷体向けに最適化されており、手書きの精度は 30〜60% で、きれいに印刷された英語の 98% 以上とは対照的です。
- 非常に低い DPI のスキャン(150 DPI 未満)は OCR 結果が悪くなります。アーカイブ品質の精度が必要なら 300 DPI で再スキャンしてください。
- 複雑なレイアウト(多段組テキスト、こだわった書式の表、サイドバー)ではテキストが予期しない読み順で抽出されることがあります。
- 初回のダウンロード(エンジン約 15MB + 言語モデル)は回線状況次第で遅くなります。ダウンロード後はブラウザにキャッシュされます。
- パスワード保護された PDF は処理できません。先に「保護」ツールでパスワードを外してください。
- とても大きな PDF(200ページ超)は処理中にブラウザメモリを圧迫することがあります。問題が出たら 50 ページずつのバッチに分けてください。
よくある質問
OCR とは何ですか?
OCR(光学文字認識)は、文字の画像を選択可能な実際のテキストに変換する技術です。スキャン PDF やスマホの写真にはピクセルはあっても文字コードはありません。OCR はそのピクセルを見てどの文字を表しているかを推測し、テキストレイヤーを追加して内容を検索可能にします。
どの言語に対応していますか?
Tesseract.js を通じて 100 以上の言語に対応しています。主なものは英語、フランス語、ドイツ語、スペイン語、中国語(簡体字/繁体字)、日本語、韓国語、アラビア語、ヘブライ語、ロシア語などです。処理前にドロップダウンから文書に含まれる言語を選んでください。
初回の OCR がとても遅いのはなぜですか?
Tesseract エンジン(約 15MB)と言語モデル(言語により約 5〜25MB)を初回利用時にダウンロードするためです。これらはブラウザにキャッシュされ、以降の実行ではダウンロードを省略してすぐに始まります。
OCR の精度はどれくらいですか?
300 DPI のきれいな印刷テキストなら、英語で 98〜99%、他のラテン系言語で 95〜97%、CJK 言語で 90〜95% です。スマホ写真や低解像度スキャンは品質により精度が 5〜15 ポイント下がります。
手書き文字も認識できますか?
あまり得意ではありません。Tesseract は印刷テキスト向けに最適化されています。手書きの認識精度は 30%(草書)から 60%(きれいなブロック体)の幅があります。手書きが多い文書には本ツールは向きません。
PDF の元画像はどうなりますか?
そのまま見えます。OCR はその下に不可視のテキストレイヤーを追加するので、見た目は同じでも検索可能になります。テキストのコピー、Ctrl+F での検索、そして OCR 後の PDF を PDF から Word への変換など他のツールに渡すことができます。
一部のページだけ OCR できますか?
はい。ページ範囲フィールドで特定のページを選べます(「1-10」や「5, 8, 12」のように)。指定したページだけが処理されるので、既にテキストがあるページが多い大きな文書では時間を節約できます。
多言語の文書にも OCR は効きますか?
はい。文書に含まれるすべての言語を選択してください。Tesseract がそれぞれの言語で認識を実行します。実際に混在するページの精度は単一言語ページよりも低くなりますが、実用範囲であることが多いです。
OCR のために PDF はサーバーへアップロードされますか?
いいえ。すべての処理は Tesseract.js(WebAssembly)を使ってブラウザ内で行われます。言語モデルも一度ダウンロードして端末内に保存されます。クラウド依存もアップロードもありません。