Convertir un PDF scanné en Word

Transformez un scan en document Word modifiable en ligne grâce à l’OCR

Envoyer le résultat à:

Faites d’un PDF scanné un document Word modifiable grâce à l’OCR

Un scan est une photographie de page. La plupart des outils s’en tiennent là : ils reconnaissent les mots et les cachent dans une couche invisible sous l’image, si bien que le fichier se cherche mais ne se modifie pas. Cette application reconstruit le document. Les mots et leurs positions viennent de la reconnaissance, la structure de la page – titres, colonnes, tableaux, légendes – est déterminée séparément, puis la page est réécrite en vrai texte, vrais tableaux et vraies images dans un fichier Word (.docx).

Comme la structure est trouvée avant que le texte ne soit posé, un tableau du scan revient en tableau avec ses colonnes, et non en mur de lignes éparses. Un formulaire revient avec ses libellés et ses valeurs alignés par paires, tels qu’ils étaient imprimés. Les titres restent des titres, et chaque page du scan reste une page du document.

La langue du document est déduite des pages elles-mêmes : un scan allemand ou italien ne demande aucun réglage manuel. Les mots dont la reconnaissance n’est pas sûre sont relus depuis le scan au lieu d’être devinés, et les nombres et identifiants ne sont jamais réécrits. Une fois le fichier prêt, une ligne indique combien de pages ont été reconstruites, combien de mots ont été corrigés et combien sont restés incertains.

Vous obtenez un .docx qui s’ouvre dans Word, Google Docs ou Pages et se modifie comme tout autre document. Les images du scan sont reprises avec un texte alternatif et les titres sont balisés comme titres, de sorte qu’un lecteur d’écran peut suivre le document – ce qu’un scan doublé d’une couche de texte invisible ne permet jamais.

Il y a des limites à connaître. Le texte est réécrit dans une seule police standard : la page reconstruite ne correspondra pas au scan lettre pour lettre, la mise en page est conservée, pas la typographie. L’écriture manuscrite n’est pas ce pour quoi la reconnaissance est faite, et les notes manuscrites peuvent revenir en mots déformés. Un scan pâle, de travers ou peu résolu coûte de la précision à chaque étape. Vérifiez le résultat avant de vous y fier, et gardez l’original.

Si vous n’avez rien à modifier et que la page doit rester identique au pixel près, l’outil qu’il vous faut est «PDF consultable» : il garde l’image et pose par-dessus une couche de texte invisible. Celui-ci échange l’apparence exacte contre un document que vous pouvez changer.

Tout fonctionne dans le navigateur, sur nos serveurs : sans installation, sans inscription, sans CAPTCHA. Jusqu’à 10 fichiers à la fois, 10 Mo chacun. Les fichiers envoyés et les liens de téléchargement sont supprimés au bout de 24 heures.

Comment convertir un PDF scanné en Word en ligne

La reconnaissance optique de caractères (OCR) lit les mots et leur emplacement, la structure de la page est déterminée séparément, et le document est réécrit en vrai texte, vrais tableaux et vraies images dans un .docx.

  1. Envoyez le PDF scanné : glissez-le dans la zone de dépôt ou cliquez dedans pour choisir le fichier sur votre ordinateur.
  2. Vérifiez que les pages sont droites et lisibles : un scan de travers, pâle ou peu résolu coûte de la précision à toutes les étapes suivantes.
  3. Cliquez sur CONVERTIR. Chaque page est reconnue, sa structure est déterminée et les mots douteux sont relus depuis le scan.
  4. Lisez la ligne de résumé : combien de pages reconstruites, combien de mots corrigés, combien restés incertains.
  5. Téléchargez le .docx et modifiez-le dans Word, Google Docs ou Pages, en vérifiant les mots restés incertains.

Les fichiers sont supprimés de nos serveurs au bout de 24 heures, après quoi les liens de téléchargement cessent de fonctionner.

Questions et réponses