スキャンしたPDFをWordに変換

スキャンをオンラインのOCRで編集できるWord文書に変えます

結果の送信先:

スキャンしたPDFを、OCRで編集できるWord文書に変える

スキャンはページの写真です。多くのツールはそのまま扱います。文字を認識して画像の下の見えない層に隠すため、検索はできても中身は変えられません。このアプリは代わりに文書を組み立て直します。語とその位置は文字認識から取り、ページの構造 — 見出し、段組み、表、キャプション — は別に求め、ページを本物の文字・本物の表・本物の画像として Word ファイル(.docx)に書き直します。

構造を先に見つけてから文字を置くので、スキャン上の表はばらばらな行の壁ではなく、列を備えた表として戻ります。帳票は印刷されていたとおり、項目名と値が対になって揃った形で戻ります。見出しは見出しのままで、スキャンの各ページは文書の各ページのまま残ります。

文書の言語はページ自体から判定するため、ドイツ語やイタリア語のスキャンでも手動設定は要りません。認識が自信を持てない語は推測せずスキャンから読み直し、数字や識別番号は決して書き換えません。ファイルができあがると、何ページを再構成し、何語を修正し、何語を不確かなまま残したかを1行で示します。

出来上がるのは、Word、Google ドキュメント、Pages で開けて他の文書と同じように編集できる .docx です。スキャンの画像は代替テキスト付きで引き継がれ、見出しは見出しとしてタグ付けされるので、スクリーンリーダーで文書をたどれます。見えないテキスト層を重ねただけのスキャンでは決してできないことです。

知っておくべき限界もあります。文字は1種類の標準フォントで書き直すため、再構成したページはスキャンと一字一句同じ見た目にはなりません。レイアウトは保たれますが、書体は保たれません。手書きは文字認識が想定しているものではなく、手書きのメモは崩れた語として戻ることがあります。薄い、傾いている、解像度が低いスキャンは、どの工程でも精度を下げます。結果を鵜呑みにせず確認し、原本は残しておいてください。

編集の必要がなく、見た目を1ピクセルまで同じに保ちたいなら、適した道具は「検索可能なPDF」です。画像をそのまま残し、上に見えないテキスト層を重ねます。こちらは正確な見た目と引き換えに、変更できる文書を返します。

すべてブラウザーの中、当社のサーバーで動きます。インストールも登録も CAPTCHA もありません。一度に10ファイルまで、1ファイル10 MB まで。アップロードしたファイルとダウンロードリンクは24時間後に削除されます。

スキャンしたPDFをオンラインでWordに変換する方法

OCR(光学文字認識)が語とその位置を読み取り、ページの構造は別に求められ、文書は本物の文字・表・画像として .docx に書き直されます。

  1. スキャンしたPDFをアップロードします。ドロップ領域にドラッグするか、領域をクリックしてパソコンのファイルを選びます。
  2. ページが正しい向きで読める状態か確かめます。傾いた、薄い、解像度の低いスキャンは以降のすべての工程で精度を下げます。
  3. 「変換する」を押します。各ページを認識し、構造を求め、疑わしい語はスキャンから読み直します。
  4. 要約の行を読みます。何ページを再構成し、何語を修正し、何語を不確かなまま残したかがわかります。
  5. .docx をダウンロードし、不確かとされた語を確かめながら Word、Google ドキュメント、Pages で編集します。

ファイルは24時間後に当社のサーバーから削除され、その後ダウンロードリンクは使えなくなります。

よくある質問