Отправить результат в:
Скан — это фотография страницы. Большинство инструментов так её и оставляют: распознают слова и прячут их невидимым слоем под картинкой, поэтому по файлу можно искать, но нельзя ничего изменить. Это приложение пересобирает документ заново. Слова и их позиции берутся из распознавания, структура страницы — заголовки, колонки, таблицы, подписи — определяется отдельно, и страница пишется заново настоящим текстом, настоящими таблицами и настоящими картинками в файл Word (.docx).
Структура находится до того, как расставляется текст, поэтому таблица со скана приходит таблицей со своими столбцами, а не стеной разрозненных строк. Форма возвращается подписями и значениями, выровненными парами, как они были напечатаны. Заголовки остаются заголовками, а каждая страница скана остаётся страницей документа.
Язык документа определяется по самим страницам, поэтому немецкий или итальянский скан не требует ручных настроек. Слова, в которых распознавание не уверено, перечитываются с самого скана, а не угадываются; числа и идентификаторы не переписываются никогда. Когда файл готов, одна строка говорит, сколько страниц пересобрано, сколько слов исправлено и сколько осталось под вопросом.
На выходе вы получаете .docx, который открывается в Word, Google Docs или Pages и правится как любой другой документ. Картинки со скана переносятся с alt-текстом, а заголовки размечены заголовками, поэтому документ может прочитать скринридер — чего скан с невидимым текстовым слоем не позволяет никогда.
Есть ограничения, о которых стоит знать. Текст переписывается одним стандартным шрифтом, поэтому пересобранная страница не совпадёт со сканом буква в букву: вёрстка сохраняется, типографика — нет. Рукописный текст — не то, для чего сделано распознавание, и рукописные пометки могут вернуться искажёнными словами. Бледный, перекошенный или низкого разрешения скан стоит точности на каждом шаге. Проверьте результат, прежде чем на него полагаться, и сохраните оригинал.
Если править ничего не нужно, а вид страницы важен до пикселя, вам нужен другой инструмент — «PDF с поиском по тексту»: он оставляет картинку и кладёт поверх невидимый текстовый слой. Здесь точный вид меняется на документ, который можно изменить.
Всё работает в браузере, на наших серверах: без установки, без регистрации, без CAPTCHA. До 10 файлов за раз, по 10 МБ каждый. Загруженные файлы и ссылки на скачивание удаляются через 24 часа.
Распознавание текста (OCR) читает слова и их места, структура страницы определяется отдельно, и документ пишется заново настоящим текстом, таблицами и картинками в файл .docx.
Файлы удаляются с наших серверов через 24 часа, после этого ссылки на скачивание перестают работать.
Перетащите сканированный PDF в белую область или нажмите на неё и выберите файл, затем нажмите «КОНВЕРТИРОВАТЬ». Когда страницы будут пересобраны, скачайте .docx. До 10 файлов за раз, по 10 МБ каждый.
Вёрстка сохраняется — заголовки, колонки, таблицы и картинки остаются на местах, — но текст переписывается одним стандартным шрифтом, поэтому буква в букву со сканом он не совпадёт. Если нужен вид до пикселя, возьмите «PDF с поиском по тексту»: там картинка остаётся, а текст ложится невидимым слоем.
OCR рассчитано на печатный текст. Рукописные пометки и подписи могут вернуться искажёнными словами, поэтому проверьте их, прежде чем полагаться на документ.
Документ Word (.docx) на каждый загруженный файл: текст, таблицы и картинки скана пересобраны настоящими объектами.
Файлы удаляются с наших серверов через 24 часа, после этого ссылки на скачивание перестают работать. Доступа к ним ни у кого больше нет.
Да. Всё обрабатывается на наших серверах, поэтому подойдёт любой современный браузер — Chrome, Firefox, Safari или Opera, на любой операционной системе.