Сканированный PDF в Word

Превратите скан в редактируемый документ Word онлайн с помощью OCR

Отправить результат в:

Превратите сканированный PDF в редактируемый документ Word с помощью OCR

Скан — это фотография страницы. Большинство инструментов так её и оставляют: распознают слова и прячут их невидимым слоем под картинкой, поэтому по файлу можно искать, но нельзя ничего изменить. Это приложение пересобирает документ заново. Слова и их позиции берутся из распознавания, структура страницы — заголовки, колонки, таблицы, подписи — определяется отдельно, и страница пишется заново настоящим текстом, настоящими таблицами и настоящими картинками в файл Word (.docx).

Структура находится до того, как расставляется текст, поэтому таблица со скана приходит таблицей со своими столбцами, а не стеной разрозненных строк. Форма возвращается подписями и значениями, выровненными парами, как они были напечатаны. Заголовки остаются заголовками, а каждая страница скана остаётся страницей документа.

Язык документа определяется по самим страницам, поэтому немецкий или итальянский скан не требует ручных настроек. Слова, в которых распознавание не уверено, перечитываются с самого скана, а не угадываются; числа и идентификаторы не переписываются никогда. Когда файл готов, одна строка говорит, сколько страниц пересобрано, сколько слов исправлено и сколько осталось под вопросом.

На выходе вы получаете .docx, который открывается в Word, Google Docs или Pages и правится как любой другой документ. Картинки со скана переносятся с alt-текстом, а заголовки размечены заголовками, поэтому документ может прочитать скринридер — чего скан с невидимым текстовым слоем не позволяет никогда.

Есть ограничения, о которых стоит знать. Текст переписывается одним стандартным шрифтом, поэтому пересобранная страница не совпадёт со сканом буква в букву: вёрстка сохраняется, типографика — нет. Рукописный текст — не то, для чего сделано распознавание, и рукописные пометки могут вернуться искажёнными словами. Бледный, перекошенный или низкого разрешения скан стоит точности на каждом шаге. Проверьте результат, прежде чем на него полагаться, и сохраните оригинал.

Если править ничего не нужно, а вид страницы важен до пикселя, вам нужен другой инструмент — «PDF с поиском по тексту»: он оставляет картинку и кладёт поверх невидимый текстовый слой. Здесь точный вид меняется на документ, который можно изменить.

Всё работает в браузере, на наших серверах: без установки, без регистрации, без CAPTCHA. До 10 файлов за раз, по 10 МБ каждый. Загруженные файлы и ссылки на скачивание удаляются через 24 часа.

Как конвертировать сканированный PDF в Word онлайн

Распознавание текста (OCR) читает слова и их места, структура страницы определяется отдельно, и документ пишется заново настоящим текстом, таблицами и картинками в файл .docx.

  1. Загрузите сканированный PDF — перетащите его в область загрузки или нажмите на неё и выберите файл на компьютере.
  2. Проверьте, что страницы не перевёрнуты и читаемы: перекошенный, бледный или низкого разрешения скан стоит точности на всех следующих шагах.
  3. Нажмите «Конвертировать». Каждая страница распознаётся, её структура определяется, а сомнительные слова перечитываются с самого скана.
  4. Прочитайте строку сводки: сколько страниц пересобрано, сколько слов исправлено и сколько осталось под вопросом.
  5. Скачайте .docx и правьте его в Word, Google Docs или Pages, проверив слова, которые остались под вопросом.

Файлы удаляются с наших серверов через 24 часа, после этого ссылки на скачивание перестают работать.

ЧаВо