# 扫描版 PDF 转 Word

在线用 OCR 把扫描件变成可以编辑的 Word 文档

### 用 OCR 把扫描版 PDF 变成可以编辑的 Word 文档

 扫描件是一页纸的照片。多数工具就让它保持这样：识别出文字，再把文字藏进图片下面一层看不见的文本里，于是文件可以搜索，却什么也改不了。这个应用选择把文档重新搭建起来。词语和它们的位置来自文字识别，页面的结构——标题、分栏、表格、图注——单独求得，然后整页以真正的文字、真正的表格和真正的图片重新写进 Word 文件（.docx）。

 因为先找出结构再放文字，扫描件里的表格回来时是带着自己列的表格，而不是一堵散落行的墙。表单回来时，字段名和取值成对对齐，和印刷时一样。标题还是标题，扫描件的每一页仍是文档的一页。

 文档语言由页面本身判断，所以德语或意大利语的扫描件不需要手动设置。识别没有把握的词会回到扫描件上重读，而不是猜测；数字和编号从不改写。文件完成后，一行文字会告诉你重建了多少页、更正了多少词、还有多少词存疑。

 你拿到的是一个 .docx，可以在 Word、Google 文档或 Pages 里打开，并像任何文档一样编辑。扫描件里的图片带替代文字一起保留，标题被标记为标题，屏幕阅读器因此能读下来——盖着隐形文本层的扫描件永远做不到这一点。

 有些限制值得知道。文字会用一种标准字体重写，所以重建后的页面不会和扫描件逐字相同：版面保留，字体排印不保留。手写并不是文字识别的目标，手写批注可能变成乱掉的词。发白、倾斜或分辨率低的扫描件会在每一步降低准确度。在依赖结果之前先检查一遍，并保留原件。

 如果你不需要编辑，只希望页面看起来分毫不差，合适的工具是“可搜索 PDF”：它保留图片，在上面铺一层隐形文字。而这个工具用精确的外观，换来一份你能修改的文档。

 一切都在浏览器里、在我们的服务器上运行：无需安装、无需注册、没有 CAPTCHA。每次最多 10 个文件，每个 10 MB。上传的文件和下载链接会在 24 小时后删除。

## 如何在线把扫描版 PDF 转成 Word

OCR 文字识别读出词语和它们的位置，页面结构单独求得，然后文档以真正的文字、表格和图片重新写进 .docx 文件。

1. 上传扫描版 PDF——把文件拖到上传区域，或点击该区域从电脑中选择文件。

2. 确认页面方向正确、内容清晰：倾斜、发白或分辨率低的扫描件会在后续每一步降低准确度。

3. 点击“转换”。每一页都会被识别、求出结构，可疑的词会回到扫描件上重读。

4. 读一读摘要行：重建了多少页、更正了多少词、还有多少词存疑。

5. 下载 .docx，在 Word、Google 文档或 Pages 中编辑，同时核对被标为存疑的词。

文件会在 24 小时后从我们的服务器删除，之后下载链接将失效。

## 常见问题

### 怎样把扫描版 PDF 转成 Word？

把扫描版 PDF 拖到白色区域，或点击该区域选择文件，然后按“转换”。页面重建完成后下载 .docx。每次最多 10 个文件，每个 10 MB。

### Word 文件会和扫描件看起来完全一样吗？

版面会保留——标题、分栏、表格和图片都还在原位——但文字会用一种标准字体重写，所以不会逐字相同。如果需要分毫不差的页面，请用“可搜索 PDF”：它保留图片并添加一层隐形文字。

### 能识别手写吗？

OCR 是为印刷文字做的。手写批注和签名可能变成乱掉的词，依赖这份文档之前请先核对。

### 最后我会得到什么？

每上传一个文件，得到一个 Word 文档（.docx），扫描件的文字、表格和图片都被重建为真实对象。

### 我的文件会怎样？

文件会在 24 小时后从我们的服务器删除，下载链接也会失效。其他任何人都无法访问。

### 可以在 Mac、Android 或 Linux 上转换扫描版 PDF 吗？

可以。全部处理都在我们的服务器上完成，任何现代浏览器都行——Chrome、Firefox、Safari 或 Opera，系统不限。

