Gửi kết quả đến:
Bản quét là bức ảnh của một trang giấy. Hầu hết công cụ để nguyên như vậy: chúng nhận dạng các từ rồi giấu vào một lớp vô hình bên dưới ảnh, nên tệp có thể tìm kiếm nhưng không thể thay đổi. Ứng dụng này thì dựng lại tài liệu. Các từ và vị trí của chúng đến từ nhận dạng ký tự, cấu trúc trang — tiêu đề, cột, bảng, chú thích — được xác định riêng, rồi trang được viết lại bằng văn bản thật, bảng thật và hình ảnh thật trong tệp Word (.docx).
Vì cấu trúc được tìm ra trước khi đặt chữ, một bảng trên bản quét trở lại đúng là bảng với các cột của nó, chứ không phải một bức tường những dòng rời rạc. Biểu mẫu trở lại với nhãn và giá trị xếp thành từng cặp thẳng hàng, đúng như khi in. Tiêu đề vẫn là tiêu đề, và mỗi trang của bản quét vẫn là một trang của tài liệu.
Ngôn ngữ của tài liệu được suy ra từ chính các trang, nên bản quét tiếng Đức hay tiếng Ý không cần thiết lập thủ công. Những từ mà nhận dạng không chắc chắn sẽ được đọc lại từ chính bản quét thay vì đoán, còn số và mã định danh thì không bao giờ bị viết lại. Khi tệp hoàn tất, một dòng cho biết đã dựng lại bao nhiêu trang, sửa bao nhiêu từ và còn bao nhiêu từ nghi ngờ.
Thứ bạn nhận được là tệp .docx mở được trong Word, Google Docs hoặc Pages và sửa như mọi tài liệu khác. Hình ảnh từ bản quét được chuyển kèm văn bản thay thế, tiêu đề được đánh dấu là tiêu đề, nhờ đó trình đọc màn hình có thể đi theo tài liệu — điều mà bản quét kèm lớp chữ vô hình không bao giờ cho phép.
Có những giới hạn nên biết. Văn bản được viết lại bằng một phông chữ chuẩn duy nhất, nên trang dựng lại sẽ không khớp từng chữ với bản quét: bố cục được giữ, còn kiểu chữ thì không. Chữ viết tay không phải điều mà nhận dạng được tạo ra để xử lý, và ghi chú viết tay có thể trở lại thành những từ méo mó. Bản quét mờ, lệch hoặc độ phân giải thấp làm giảm độ chính xác ở mọi bước. Hãy kiểm tra kết quả trước khi tin dùng, và giữ lại bản gốc.
Nếu bạn không cần sửa gì và muốn trang trông giống hệt đến từng điểm ảnh, công cụ đúng là «PDF có thể tìm kiếm»: nó giữ nguyên ảnh và phủ lên một lớp chữ vô hình. Công cụ này thì đánh đổi vẻ ngoài chính xác lấy một tài liệu bạn có thể thay đổi.
Mọi thứ chạy trong trình duyệt, trên máy chủ của chúng tôi: không cài đặt, không đăng ký, không CAPTCHA. Tối đa 10 tệp mỗi lần, mỗi tệp 10 MB. Tệp đã tải lên và liên kết tải xuống bị xóa sau 24 giờ.
Nhận dạng ký tự quang học (OCR) đọc các từ và vị trí của chúng, cấu trúc trang được xác định riêng, rồi tài liệu được viết lại bằng văn bản, bảng và hình ảnh thật trong tệp .docx.
Tệp bị xóa khỏi máy chủ của chúng tôi sau 24 giờ, và sau đó liên kết tải xuống ngừng hoạt động.
Kéo PDF đã quét vào vùng trắng, hoặc bấm vào đó để chọn tệp, rồi nhấn CHUYỂN ĐỔI. Khi các trang được dựng lại, hãy tải tệp .docx về. Tối đa 10 tệp mỗi lần, mỗi tệp 10 MB.
Bố cục được giữ — tiêu đề, cột, bảng và hình ảnh vẫn ở nguyên chỗ cũ — nhưng văn bản được viết lại bằng một phông chữ chuẩn duy nhất, nên sẽ không khớp từng chữ. Nếu bạn cần trang giống hệt đến từng điểm ảnh, hãy dùng «PDF có thể tìm kiếm»: nó giữ ảnh và thêm lớp chữ vô hình.
OCR được tạo ra cho chữ in. Ghi chú viết tay và chữ ký có thể trở lại thành những từ méo mó, nên hãy kiểm tra trước khi tin dùng tài liệu.
Một tài liệu Word (.docx) cho mỗi tệp bạn tải lên, với văn bản, bảng và hình ảnh của bản quét được dựng lại thành đối tượng thật.
Tệp bị xóa khỏi máy chủ của chúng tôi sau 24 giờ và liên kết tải xuống ngừng hoạt động. Không ai khác truy cập được.
Có. Mọi thứ được xử lý trên máy chủ của chúng tôi, nên chỉ cần trình duyệt hiện đại bất kỳ — Chrome, Firefox, Safari hoặc Opera, trên mọi hệ điều hành.