掃描版 PDF 轉 Word

線上用 OCR 把掃描檔變成可以編輯的 Word 文件

發送結果:

用 OCR 把掃描版 PDF 變成可以編輯的 Word 文件

掃描檔是一頁紙的照片。多數工具就讓它維持這樣:辨識出文字,再把文字藏進圖片下面一層看不見的文字裡,於是檔案可以搜尋,卻什麼也改不了。這個應用選擇把文件重新搭建起來。字詞和它們的位置來自文字辨識,頁面的結構——標題、分欄、表格、圖說——另外求得,然後整頁以真正的文字、真正的表格與真正的圖片重新寫進 Word 檔(.docx)。

因為先找出結構再放文字,掃描檔裡的表格回來時是帶著自己欄的表格,而不是一堵散落列的牆。表單回來時,欄位名稱與值成對對齊,和印刷時一樣。標題還是標題,掃描檔的每一頁仍是文件的一頁。

文件語言由頁面本身判斷,所以德文或義大利文的掃描檔不需要手動設定。辨識沒有把握的字詞會回到掃描檔上重讀,而不是猜測;數字與編號從不改寫。檔案完成後,一行文字會告訴你重建了多少頁、更正了多少字詞、還有多少存疑。

你拿到的是一個 .docx,可以在 Word、Google 文件或 Pages 裡開啟,並像任何文件一樣編輯。掃描檔裡的圖片帶替代文字一起保留,標題被標記為標題,螢幕閱讀器因此能讀下來——蓋著隱形文字層的掃描檔永遠做不到。

有些限制值得知道。文字會用一種標準字型重寫,所以重建後的頁面不會和掃描檔逐字相同:版面保留,字體排印不保留。手寫並不是文字辨識的目標,手寫註記可能變成亂掉的字詞。發白、傾斜或解析度低的掃描檔會在每一步降低準確度。在依賴結果之前先檢查一遍,並保留原件。

如果你不需要編輯,只希望頁面看起來分毫不差,合適的工具是「可搜尋 PDF」:它保留圖片,在上面鋪一層隱形文字。而這個工具用精確的外觀,換來一份你能修改的文件。

一切都在瀏覽器裡、在我們的伺服器上執行:不必安裝、不必註冊、沒有 CAPTCHA。每次最多 10 個檔案,每個 10 MB。上傳的檔案與下載連結會在 24 小時後刪除。

如何線上把掃描版 PDF 轉成 Word

OCR 文字辨識讀出字詞和它們的位置,頁面結構另外求得,然後文件以真正的文字、表格與圖片重新寫進 .docx 檔。

  1. 上傳掃描版 PDF——把檔案拖到上傳區域,或點一下該區域從電腦中選擇檔案。
  2. 確認頁面方向正確、內容清晰:傾斜、發白或解析度低的掃描檔會在後續每一步降低準確度。
  3. 按「轉換」。每一頁都會被辨識、求出結構,可疑的字詞會回到掃描檔上重讀。
  4. 讀一下摘要列:重建了多少頁、更正了多少字詞、還有多少存疑。
  5. 下載 .docx,在 Word、Google 文件或 Pages 中編輯,同時核對被標為存疑的字詞。

檔案會在 24 小時後從我們的伺服器刪除,之後下載連結將失效。

常問問題