将结果发送到:
扫描件是一页纸的照片。多数工具就让它保持这样:识别出文字,再把文字藏进图片下面一层看不见的文本里,于是文件可以搜索,却什么也改不了。这个应用选择把文档重新搭建起来。词语和它们的位置来自文字识别,页面的结构——标题、分栏、表格、图注——单独求得,然后整页以真正的文字、真正的表格和真正的图片重新写进 Word 文件(.docx)。
因为先找出结构再放文字,扫描件里的表格回来时是带着自己列的表格,而不是一堵散落行的墙。表单回来时,字段名和取值成对对齐,和印刷时一样。标题还是标题,扫描件的每一页仍是文档的一页。
文档语言由页面本身判断,所以德语或意大利语的扫描件不需要手动设置。识别没有把握的词会回到扫描件上重读,而不是猜测;数字和编号从不改写。文件完成后,一行文字会告诉你重建了多少页、更正了多少词、还有多少词存疑。
你拿到的是一个 .docx,可以在 Word、Google 文档或 Pages 里打开,并像任何文档一样编辑。扫描件里的图片带替代文字一起保留,标题被标记为标题,屏幕阅读器因此能读下来——盖着隐形文本层的扫描件永远做不到这一点。
有些限制值得知道。文字会用一种标准字体重写,所以重建后的页面不会和扫描件逐字相同:版面保留,字体排印不保留。手写并不是文字识别的目标,手写批注可能变成乱掉的词。发白、倾斜或分辨率低的扫描件会在每一步降低准确度。在依赖结果之前先检查一遍,并保留原件。
如果你不需要编辑,只希望页面看起来分毫不差,合适的工具是“可搜索 PDF”:它保留图片,在上面铺一层隐形文字。而这个工具用精确的外观,换来一份你能修改的文档。
一切都在浏览器里、在我们的服务器上运行:无需安装、无需注册、没有 CAPTCHA。每次最多 10 个文件,每个 10 MB。上传的文件和下载链接会在 24 小时后删除。
OCR 文字识别读出词语和它们的位置,页面结构单独求得,然后文档以真正的文字、表格和图片重新写进 .docx 文件。
文件会在 24 小时后从我们的服务器删除,之后下载链接将失效。
把扫描版 PDF 拖到白色区域,或点击该区域选择文件,然后按“转换”。页面重建完成后下载 .docx。每次最多 10 个文件,每个 10 MB。
版面会保留——标题、分栏、表格和图片都还在原位——但文字会用一种标准字体重写,所以不会逐字相同。如果需要分毫不差的页面,请用“可搜索 PDF”:它保留图片并添加一层隐形文字。
OCR 是为印刷文字做的。手写批注和签名可能变成乱掉的词,依赖这份文档之前请先核对。
每上传一个文件,得到一个 Word 文档(.docx),扫描件的文字、表格和图片都被重建为真实对象。
文件会在 24 小时后从我们的服务器删除,下载链接也会失效。其他任何人都无法访问。
可以。全部处理都在我们的服务器上完成,任何现代浏览器都行——Chrome、Firefox、Safari 或 Opera,系统不限。