結果の送信先:
スキャンはページの写真です。多くのツールはそのまま扱います。文字を認識して画像の下の見えない層に隠すため、検索はできても中身は変えられません。このアプリは代わりに文書を組み立て直します。語とその位置は文字認識から取り、ページの構造 — 見出し、段組み、表、キャプション — は別に求め、ページを本物の文字・本物の表・本物の画像として Word ファイル(.docx)に書き直します。
構造を先に見つけてから文字を置くので、スキャン上の表はばらばらな行の壁ではなく、列を備えた表として戻ります。帳票は印刷されていたとおり、項目名と値が対になって揃った形で戻ります。見出しは見出しのままで、スキャンの各ページは文書の各ページのまま残ります。
文書の言語はページ自体から判定するため、ドイツ語やイタリア語のスキャンでも手動設定は要りません。認識が自信を持てない語は推測せずスキャンから読み直し、数字や識別番号は決して書き換えません。ファイルができあがると、何ページを再構成し、何語を修正し、何語を不確かなまま残したかを1行で示します。
出来上がるのは、Word、Google ドキュメント、Pages で開けて他の文書と同じように編集できる .docx です。スキャンの画像は代替テキスト付きで引き継がれ、見出しは見出しとしてタグ付けされるので、スクリーンリーダーで文書をたどれます。見えないテキスト層を重ねただけのスキャンでは決してできないことです。
知っておくべき限界もあります。文字は1種類の標準フォントで書き直すため、再構成したページはスキャンと一字一句同じ見た目にはなりません。レイアウトは保たれますが、書体は保たれません。手書きは文字認識が想定しているものではなく、手書きのメモは崩れた語として戻ることがあります。薄い、傾いている、解像度が低いスキャンは、どの工程でも精度を下げます。結果を鵜呑みにせず確認し、原本は残しておいてください。
編集の必要がなく、見た目を1ピクセルまで同じに保ちたいなら、適した道具は「検索可能なPDF」です。画像をそのまま残し、上に見えないテキスト層を重ねます。こちらは正確な見た目と引き換えに、変更できる文書を返します。
すべてブラウザーの中、当社のサーバーで動きます。インストールも登録も CAPTCHA もありません。一度に10ファイルまで、1ファイル10 MB まで。アップロードしたファイルとダウンロードリンクは24時間後に削除されます。
OCR(光学文字認識)が語とその位置を読み取り、ページの構造は別に求められ、文書は本物の文字・表・画像として .docx に書き直されます。
ファイルは24時間後に当社のサーバーから削除され、その後ダウンロードリンクは使えなくなります。
スキャンしたPDFを白い領域にドラッグするか、領域をクリックしてファイルを選び、「変換する」を押します。ページの再構成が終わったら .docx をダウンロードしてください。一度に10ファイルまで、1ファイル10 MB までです。
レイアウトは保たれ、見出し・段組み・表・画像は元の位置に残ります。ただし文字は1種類の標準フォントで書き直すため、一字一句同じ見た目にはなりません。1ピクセルまで同じ見た目が必要なら「検索可能なPDF」をお使いください。画像を残し、見えないテキスト層を加えます。
OCRは活字向けに作られています。手書きのメモや署名は崩れた語として戻ることがあるため、文書を信頼する前に確認してください。
アップロードしたファイルごとに Word 文書(.docx)が1つ。スキャンの文字・表・画像が本物のオブジェクトとして再構成されています。
ファイルは24時間後に当社のサーバーから削除され、ダウンロードリンクも使えなくなります。ほかの誰もアクセスできません。
できます。処理はすべて当社のサーバーで行うため、Chrome、Firefox、Safari、Opera など最新のブラウザーがあれば、OS を問いません。