PDF OCR 文字识别
使用 OCR 技术在浏览器中识别并提取扫描版 PDF 中的文字,无需上传文件。
拖拽文件到此处或点击上传
Max 100 MB
OCR(光学字符识别)能把 PDF 里以图片形式存在的文字,变成真正可以选中和搜索的文本。扫描件、手机拍的收据、大量图片型的旧 PDF 都能受益——完成 OCR 之后,你可以复制文字、在文件里全文搜索,也可以把它送入 PDF 转 Word 等其他工具。 OCR 里最难的是语言覆盖:识别英文和识别中文、日文、阿拉伯文完全是两回事。本工具通过 Tesseract.js 支持 100 多种语言,不过较大的语言包(如 CJK)在首次使用时会额外下载一些模型数据。 所有 OCR 都在浏览器里完成。Tesseract WASM 引擎逐页处理,把可见图片保留下来的同时在 PDF 上叠一层文字,最终产出可搜索的输出。全程没有任何数据离开你的设备。
最后审核: 2026 年 7 月
这是什么?
OCR 分三个阶段。第一阶段是图像预处理:二值化把彩色转成黑白,倾斜校正把歪掉的扫描件摆正,去噪清理掉细小杂点。第二阶段是布局分析:把页面切成文字区和非文字区(图片、线条、表格),在文字区内再识别出一行一行、一个词一个词。第三阶段是字符识别,使用 LSTM(长短期记忆)神经网络把词图像转换为字符序列。在整洁、高 DPI 的印刷扫描件上,现代 OCR 的准确率非常高——英文常常在 99% 以上。手写、低分辨率图片和复杂布局则会显著拉低准确率。
如何使用此工具
- 1选择一份包含扫描页或图片页的 PDF。如果 PDF 里已经有可选中的文字,就不需要 OCR——请改用「提取文本」工具,能节省处理时间。
- 2选择 PDF 里实际使用的语言。只挑真正出现的语言——加入用不到的语言只会拖慢速度,无助于提高准确率。多语言混排的文档,选主要语言就行。
- 3点击处理。工具先加载语言模型(首次运行下载约 10MB 模型可能需要 10-30 秒),然后逐页处理。典型扫描件每页 2-5 秒。
- 4下载 OCR 后的 PDF。视觉上和原文件一样,但现在整份文档都可以选中、复制和搜索文字。用 Ctrl+F 试一下,就能确认识别效果。
使用建议
- OCR 准确率很依赖扫描质量。印刷体 300 DPI 的扫描件准确率通常在 98-99%;150 DPI 会掉到 85-90%。手机拍照差异很大——光线好时 90-95%,光线差时 70-80%。
- 首次运行会下载 Tesseract WASM 引擎(约 15MB)加上语言模型(每种 5-15MB)。下载后会缓存,后续运行会快得多。
- CJK 语言(中文、日文、韩文)的语言包明显更大(每种约 15-25MB)。首次运行比拉丁字母语言慢一些。
- 本工具不是为手写识别优化的。Tesseract 在印刷体上很强,但在草书上就吃力。手写识别的准确率会降到 30-60%。
- OCR 在可见图片下面加了一层不可见的文字。如果输出 PDF 看起来没变化,那是正常的——试着选中文字确认 OCR 生效。
常见使用场景
- 图书管理员把整柜的旧打印报告数字化成可搜索的档案,不必逐字重打。
- 律师给扫描版的法院文书做 OCR,之后就能在全文里搜索特定案例引用。
- 研究员处理老的期刊 PDF(纯图片扫描)以便为综述提取引文。
- 财务团队把扫描发票 OCR 之后再归档到可搜索的文件夹里,方便日后审计。
- 翻译者先给扫描件做 OCR,再把提取出来的文字送入翻译软件。
- 记者浏览泄露文档的 PDF(往往是扫描图片),在数百页里搜索关键姓名和日期。
技术说明
- 工具使用 Tesseract.js 7.x(WebAssembly 版本)在 Web Worker 里运行,OCR 不会卡住浏览器标签页。
- 语言模型在首次使用时下载并缓存在浏览器里。拉丁字母语言约 5-8MB;CJK 语言约每种 15-25MB。
- OCR 处理速度:在现代桌面 CPU 上,300 DPI 的典型印刷扫描件每页 2-5 秒。
- 输出 PDF 在原始页面图片上叠加了不可见的文字层,视觉上看不到,但可以选中和搜索。
- 工具支持 100 多种语言,包括英文、法文、德文、西班牙文、中文(简体和繁体)、日文、韩文、阿拉伯文、希伯来文和俄文。
- 支持多语言页面:勾选多种语言,Tesseract 会分别做识别。真正混排的页面比单语言页面准确率略低。
以隐私为基础
此工具在你的浏览器中运行。使用工具时,文件不会上传到我们的服务器。
限制说明
- 手写识别效果差。Tesseract 是针对印刷体优化的,手写准确率约 30-60%,而干净的印刷英文能达到 98% 以上。
- 很低 DPI 的扫描(低于 150 DPI)会得到糟糕的 OCR 结果。归档级质量请以 300 DPI 重新扫描。
- 复杂布局(多栏文字、含大量格式的表格、侧边栏)可能让文字按意料之外的阅读顺序被抽取。
- 首次运行需要下载引擎(约 15MB)+ 语言模型,在网络受限时会慢。下载后模型会缓存到浏览器里。
- 带密码的 PDF 无法处理。请先用「保护」工具去掉密码。
- 超大 PDF(200+ 页)在处理时可能耗尽浏览器内存。碰到问题请拆成 50 页一批分批处理。
常见问题
什么是 OCR?
OCR(光学字符识别)能把文字的图像转换成真正可选中的文本。扫描 PDF 和相机照片里存的是像素,不是字符——OCR 分析那些像素,推断它们代表哪些字母,再在文档上加一层文字,使内容变得可搜索。
支持哪些语言?
通过 Tesseract.js 支持 100 多种语言。常见的有英文、法文、德文、西班牙文、中文(简体和繁体)、日文、韩文、阿拉伯文、希伯来文和俄文。处理前从下拉列表里选择文档中出现的语言。
为什么第一次 OCR 这么慢?
首次使用时会下载 Tesseract 引擎(约 15MB)和语言模型(每种约 5-25MB)。之后模型会缓存在浏览器里,后续运行会跳过下载直接开始。
OCR 的准确率有多高?
在 300 DPI 的整洁印刷文本上:英文能达到 98-99%,其他拉丁字母语言 95-97%,CJK 语言 90-95%。手机拍照和低分辨率扫描会让准确率再降 5-15 个百分点,具体取决于质量。
能识别手写吗?
效果不好。Tesseract 是针对印刷体优化的,手写识别的准确率从 30%(草书)到 60%(工整的印刷体大写字母)不等。手写为主的文档不适合用本工具。
PDF 里原有的图片会怎么样?
它们照常显示。OCR 在下方加了一层不可见的文字层,PDF 看起来一模一样但已经可以搜索。你可以复制文字、用 Ctrl+F 找词,还可以把 OCR 后的 PDF 送入 PDF 转 Word 等其他工具。
可以只对部分页面做 OCR 吗?
可以。用页面范围字段选特定页面(如「1-10」或「5, 8, 12」)。只有这些页会被处理,大文档中如果多数页已经有文字,这样能省不少时间。
OCR 对多语言文档有效吗?
有效。选择文档中出现的所有语言,Tesseract 会对每种语言分别识别。真正混排的页面比单语言页面准确率略低,但通常仍可用。
PDF 会被上传到服务器做 OCR 吗?
不会。所有处理都通过 Tesseract.js(WebAssembly)在你的浏览器里完成。就连语言模型都是下载一次后存到本地。无云端依赖、无上传。