扫描版 PDF 转 Word

在线用 OCR 把扫描件变成可以编辑的 Word 文档

将结果发送到:

用 OCR 把扫描版 PDF 变成可以编辑的 Word 文档

扫描件是一页纸的照片。多数工具就让它保持这样:识别出文字,再把文字藏进图片下面一层看不见的文本里,于是文件可以搜索,却什么也改不了。这个应用选择把文档重新搭建起来。词语和它们的位置来自文字识别,页面的结构——标题、分栏、表格、图注——单独求得,然后整页以真正的文字、真正的表格和真正的图片重新写进 Word 文件(.docx)。

因为先找出结构再放文字,扫描件里的表格回来时是带着自己列的表格,而不是一堵散落行的墙。表单回来时,字段名和取值成对对齐,和印刷时一样。标题还是标题,扫描件的每一页仍是文档的一页。

文档语言由页面本身判断,所以德语或意大利语的扫描件不需要手动设置。识别没有把握的词会回到扫描件上重读,而不是猜测;数字和编号从不改写。文件完成后,一行文字会告诉你重建了多少页、更正了多少词、还有多少词存疑。

你拿到的是一个 .docx,可以在 Word、Google 文档或 Pages 里打开,并像任何文档一样编辑。扫描件里的图片带替代文字一起保留,标题被标记为标题,屏幕阅读器因此能读下来——盖着隐形文本层的扫描件永远做不到这一点。

有些限制值得知道。文字会用一种标准字体重写,所以重建后的页面不会和扫描件逐字相同:版面保留,字体排印不保留。手写并不是文字识别的目标,手写批注可能变成乱掉的词。发白、倾斜或分辨率低的扫描件会在每一步降低准确度。在依赖结果之前先检查一遍,并保留原件。

如果你不需要编辑,只希望页面看起来分毫不差,合适的工具是“可搜索 PDF”:它保留图片,在上面铺一层隐形文字。而这个工具用精确的外观,换来一份你能修改的文档。

一切都在浏览器里、在我们的服务器上运行:无需安装、无需注册、没有 CAPTCHA。每次最多 10 个文件,每个 10 MB。上传的文件和下载链接会在 24 小时后删除。

如何在线把扫描版 PDF 转成 Word

OCR 文字识别读出词语和它们的位置,页面结构单独求得,然后文档以真正的文字、表格和图片重新写进 .docx 文件。

  1. 上传扫描版 PDF——把文件拖到上传区域,或点击该区域从电脑中选择文件。
  2. 确认页面方向正确、内容清晰:倾斜、发白或分辨率低的扫描件会在后续每一步降低准确度。
  3. 点击“转换”。每一页都会被识别、求出结构,可疑的词会回到扫描件上重读。
  4. 读一读摘要行:重建了多少页、更正了多少词、还有多少词存疑。
  5. 下载 .docx,在 Word、Google 文档或 Pages 中编辑,同时核对被标为存疑的词。

文件会在 24 小时后从我们的服务器删除,之后下载链接将失效。

常见问题