PDF 转 Word
在线提取 PDF 文字内容并转换为可编辑的 Word 文档,无需上传。
⚠️ Limitations
- Scanned PDFs (image-only) cannot be converted — text extraction only
- Complex layouts, tables, and images are not preserved
- Best results with text-heavy documents
拖拽文件到此处或点击上传
Max 100 MB
PDF 转 Word 就是把布局固定的 PDF 反向变回可编辑的 .docx 文件。这就是最经典的「文档只有 PDF 版本,但我要改」的场景——修改合同、更新简历、把内容重新包装到新文档里,都会用到。 这类转换天然带有误差。PDF 里的文字是按像素级坐标存储的,要重建段落流和语义结构,必然要靠推断。简单文档(单栏文章、直白的报告)能干净地转换,复杂文档(多栏排版、浮动文本框、大量表格)往往需要在 Word 里再做人工整理。 所有处理都在浏览器里完成。工具使用 pdfjs-dist 提取 PDF 里的文字和结构线索,再用 `docx` 库生成 Microsoft 兼容的 .docx 文件。没有上传,没有云端服务。
最后审核: 2026 年 7 月
这是什么?
PDF 是为「查看」而不是「编辑」设计的。每个字符都固定在页面坐标上,没有任何语义标记说明「这是标题」或「这是段落」。转成 Word 就是把这个过程反过来:工具把字符组合成词,根据 Y 坐标把词组合成行,再根据行间距的规律把行组合成段落。字号和粗体等信息则从 PDF 字符元数据里推断出来,用于猜测标题级别。表格是最难的一环——PDF 里可能只把表格画成坐标上的一堆文字,完全没有显式的行列结构——检测只能靠启发式规则,在复杂布局上经常失败。
如何使用此工具
- 1选择要转换的 PDF。文字型 PDF(由 Word、LibreOffice 等字处理软件生成)转换效果最好。扫描件需要先做 OCR——用 OCR 工具添加文字层,再来转换。
- 2等待文字提取完成。工具解析每一页,抽取字符和它们的坐标,再把它们组合成段落。每页需要 1-5 秒。
- 3点击处理。工具生成一份 .docx 文件,保留段落、基本格式(粗体、斜体、下划线)和识别出的标题。源 PDF 里的图片是否被保留,取决于其复杂度。
- 4下载 .docx,在 Word 或 LibreOffice 里打开。要做些收尾工作——换行可能需要调整,表格可能需要重排,复杂布局里的图片可能需要重新插入。
使用建议
- 工具对段落文字保留得不错,但精确排版经常丢失。别指望 .docx 一打开就和 PDF 完全一样。
- 扫描件必须先跑 OCR 添加文字层。没有 OCR,工具就没有文字可提取,产出的会是一份空文档。
- 编码怪异的 PDF 提取出来可能有乱码。先用「提取文本」工具跑一遍,确认文字能干净提取出来,再做完整转换。
- 多栏 PDF(比如学术论文)常常按跨栏顺序读出,而不是先读完一栏再读下一栏。在 Word 里可能需要人工重排。
- 表格是根据对齐的文字位置用启发式规则检测的。合并单元格、嵌套结构的复杂表格通常会失败,请在 Word 里手动重建。
常见使用场景
- HR 收到 PDF 版简历,需要在转发给面试官之前修改申请人的联系方式。
- 学生把讲义 PDF 转成 Word,然后重新排版做成带个人笔记的复习资料。
- 翻译人员把扫描技术文档的文字提取到 Word 里翻译,再对译文重新排版。
- 咨询顾问改写一份旧提案 PDF(源 Word 已经找不到),更新日期和数字给新客户用。
- 作者把已发表文章的 PDF 变成 Word 草稿,用来编辑并扩展成一篇更长的作品。
- 研究员从学术论文 PDF 中提取文字,直接把引文放到手稿里,不必逐字重打。
技术说明
- 工具使用 pdfjs-dist 做带位置数据的文字提取,再用 `docx` npm 库生成 .docx。
- 段落重建靠垂直坐标聚类:靠得近的行合并成一段,间距变大就断成新的段落。
- 字体样式(粗体、斜体)从 PDF 的字符级字体元数据推断出来。识别出的属性会传到 Word 的字符样式上。
- PDF 里嵌入的图片会尽量以行内图片的形式抽取并重新插入。复杂的定位(文字环绕)会丢失。
- 文字提取速度取决于页面复杂度。单栏文章每秒 5-10 页;复杂布局(多栏、大表格)每秒 1-3 页。
- 输出是标准 .docx,Word 2007 及以上、LibreOffice Writer、Google Docs 都能打开。
以隐私为基础
此工具在你的浏览器中运行。使用工具时,文件不会上传到我们的服务器。
限制说明
- 扫描件(纯图片,没有文字层)会得到一份空的 .docx。请先跑 OCR 添加文字层。
- 多栏布局的文字阅读顺序常常错乱,通常需要在 Word 里人工重排。
- 复杂表格(合并单元格、嵌套表格、跨行)很少能干净转换,请手动重建。
- 文本框、浮动图形、页眉页脚可能无法准确保留,或者出现在意料之外的位置。
- 如果 PDF 用到的自定义字体在接收方系统上不存在,Word 会用默认字体替代。
- 带密码的 PDF 无法处理。请先用「保护」工具去掉密码。
常见问题
为什么转换后的 Word 文档和 PDF 看起来不太一样?
PDF 转 Word 需要从固定的像素坐标里反推段落结构。工具在文字和基本格式上保留得比较好,但精确排版——分栏位置、表格边框、浮动元素——常常需要在 Word 里人工调整。
可以转换扫描件 PDF 吗?
需要先跑 OCR。扫描件里存的是文字的图像,不是文字字符。请用 OCR 工具先加上文字层再来转换。没有 OCR,输出的 .docx 会是空的,因为没有可提取的东西。
输出会保留表格吗?
简单表格(有明确单元格边界的网格)可以合理转换。含合并单元格、嵌套表格或大量自定义格式的复杂表格通常会失败——工具会退回到无格式的段落文字。请手动重建。
PDF 里的图片会被保留吗?
尽量保留。定位简单的图片(与文字齐行)会被抽取并重新插入。复杂的文字环绕或叠加图片可能在 .docx 里出现在意想不到的位置,甚至完全被省略。
输出可以在哪些 Word 版本里打开?
.docx 兼容 Word 2007 及以上、LibreOffice Writer、Google Docs、Apple Pages(只读模式)和其他任何兼容 DOCX 的编辑器。这是标准的 Office Open XML。
可以转换带密码的 PDF 吗?
不可以。带密码的 PDF 在解密之前无法解析。请先用「保护」工具去掉密码。
为什么有些 PDF 转起来更慢?
含多栏布局、大量表格或很多嵌入图片的复杂 PDF 需要更多时间。简单文档每秒能处理 5-10 页,复杂文档每秒 1-3 页。
如果转换质量不够好,有什么替代方案?
追求高保真的话,Adobe Acrobat Pro 的「导出到 Word」或 Google Docs 的 PDF 导入,在布局保留上都比任何浏览器端工具做得更好。本工具的定位是「快速、无需上传」的转换,用布局精度来换文字为主内容的便利。
PDF 会被发送到服务器吗?
不会。转换通过 pdfjs-dist 和 docx 库在你的浏览器里本地完成。文件不会离开你的设备。关闭标签页后所有工作数据就都被丢弃了。