将结果发送到:
页面的图片——手机拍的照片、截图、扫描仪生成的文件——里面没有文字,只有像素。把它贴进 Word,得到的只是文档里的同一张图片:里面什么都不能选中、修改或复制。这个应用会重建页面。文字及其位置来自识别,页面结构——标题、分栏、表格、图注——单独求出,然后页面被重新写成 Word 文件(.docx)中真正的文字、真正的表格和真正的图片。
它支持页面图片通常使用的格式:JPG 和 JPEG、PNG、BMP、WEBP 和 TIFF。文档扫描仪保存的多页 TIFF 会逐帧读取。一次上传多张图片,它们会按你添加的顺序成为同一个文档的各页:逐页拍下的合同会作为一份合同返回,而不是一堆文件。
图片没有自己的纸张尺寸,所以纸张由你选择。选 A4 或 Letter 时,每张图片完整放在页面中央,纸张按图片方向设为纵向或横向;“与图片相同”保留图片本身的比例。照片会按相机记录的方向摆正,所以侧着拍的页面不会侧着返回。
因为结构在放置文字之前就已找到,图片中的表格会还原为带有自己列的表格,而不是一堆零散的行,表单会还原为成对的标签和值。语言根据页面本身判断。识别没有把握的词会回到图片上重读,而不是去猜,数字和编号从不改写。文件完成后,一行提示会告诉你重建了多少页、修正了多少词、还有多少词存疑。
有些限制值得了解。文字会用一种标准字体重写,所以页面不会与图片逐字吻合:版式保留,字体排印不保留。手写字不是识别所针对的对象。模糊、昏暗或分辨率低的图片,或者以很大角度拍摄的页面,在每一步都会降低准确度。依赖结果之前请先读一遍,并保留原件。
无需安装:处理在我们的服务器上完成,无需注册,也没有 CAPTCHA。每次最多 10 个文件,每个 10 MB。上传的文件和下载链接会在 24 小时后删除。
OCR 读取图片上的文字及其位置,页面结构单独求出,然后把页面重新写成 .docx 中真正的文字、表格和图片。
文件会在 24 小时后从我们的服务器删除,之后下载链接将失效。
把图片拖到白色区域,或点击该区域选择,选好页面尺寸,然后按“转换”。页面重建完成后下载 .docx。每次最多 10 个文件,每个 10 MB。
JPG 和 JPEG、PNG、BMP、WEBP 和 TIFF。文档扫描仪保存的那种多页 TIFF 会逐帧读取,每一帧成为文档的一页。
不会,只有一个。图片会按上传顺序成为同一个文档的各页,所以逐页拍下的合同会作为一份合同返回。
版式会保留——标题、分栏、表格和图片都留在原处——但文字会用一种标准字体重写,所以不会与图片逐字吻合。你得到的是文档,而不是图片的副本。
文件会在 24 小时后从我们的服务器删除,下载链接也会失效。其他任何人都无法访问。
可以。所有处理都在我们的服务器上进行,所以任何现代浏览器都行——Android、iOS、Windows、macOS 或 Linux 上的 Chrome、Firefox、Safari 或 Opera。
OCR 是为印刷文字做的。手写批注和签名可能变成乱掉的词,依赖这份文档之前请先核对。