OCR PDF

OCR PDF lit le texte présent dans les images d’un document scanné ou d’une photo, en français, en anglais ou dans les deux langues. Vous obtenez un PDF où l’on peut chercher et copier, ou un simple fichier texte.

Chargement de l’outil…

Deux sorties, deux usages

SortieContenuÀ choisir si…
PDF cherchable (par défaut)Un nouveau PDF : l’image de chaque page, avec le texte reconnu posé dessus en couche invisibleVous voulez garder l’aspect du document, avec recherche et copie
Texte brutUn fichier .txt ; au-delà d’une page, un séparateur numéroté précède chaque pageSeul le contenu compte : citation, réutilisation, archivage

En sortie texte, le résultat s’affiche aussi à l’écran avec un bouton pour le copier. Pour un PDF, chaque page est rendue à 300 pixels par pouce avant analyse ; sur une très grande page, la résolution descend pour que le rendu ne dépasse pas 4 200 pixels de côté, soit 254 pixels par pouce pour un A3 et 89 pour un A0. Le PDF cherchable garde le format des pages d’origine : un A4 reste un A4.

Trois choix de langue et un téléchargement initial

Trois choix sont proposés : Français (par défaut), Anglais, ou Les deux pour un document qui mélange ces langues. Aucune autre langue n’est disponible.

La reconnaissance repose sur tesseract.js, version pour navigateur du moteur libre Tesseract. Au premier lancement, votre navigateur télécharge depuis le CDN jsDelivr le moteur, environ 4 Mo, puis les données de la langue choisie : environ 0,7 Mo pour le français et 2,8 Mo pour l’anglais.

Les langues sont ensuite rangées dans le stockage IndexedDB du navigateur, le moteur dans son cache ordinaire : effacer les données du site oblige au moins à retélécharger les langues. Vos pages, elles, sont analysées sur votre appareil, comme l’explique le guide traitement local.

Ce qui influence la qualité de lecture

  • Le sens des pages : redressez une page à l’envers avec Pivoter PDF avant la reconnaissance.
  • Le contraste : une ombre ou un fond grisâtre gênent la lecture ; le filtre « Document N&B » de Numériser vers PDF renforce le contraste d’une prise de vue.
  • La netteté : une photo floue ou prise de trop loin donne des lettres mal formées, donc mal lues.
  • L’écriture : les caractères imprimés se lisent bien mieux qu’une écriture manuscrite, souvent mal reconnue.

Ce que l’OCR remplace dans le fichier

Le PDF cherchable est reconstruit à partir des images de pages, y compris celles qui contenaient déjà du vrai texte : ce texte d’origine, les liens, les champs de formulaire, les signets et les propriétés ne sont pas repris. Si le texte de votre PDF est déjà sélectionnable, préférez PDF vers Texte.

Le résultat peut ensuite passer dans PDF vers Word ou PDF vers Excel, erreurs de reconnaissance comprises. Pour l’alléger sans perdre la couche de texte, n’utilisez que le niveau Sans perte de Compresser PDF.

Comment faire ?

  1. Déposez un PDF scanné, ou une image JPG ou PNG : une image donne une page.
  2. Choisissez la langue du document et la sortie souhaitée.
  3. Cliquez sur « Lancer l’OCR » ; la première fois, moteur et langue se téléchargent d’abord.
  4. Suivez l’avancement page par page ; « Annuler » interrompt le traitement.
  5. Téléchargez le fichier suffixé « -ocr », ou copiez le texte affiché.

Limites à connaître

  • Deux langues seulement : le français et l’anglais.
  • Une connexion est nécessaire au premier usage, puis chaque fois que le navigateur a perdu le moteur ou les langues.
  • Le texte reconnu comporte des erreurs : relisez les chiffres, les noms propres et les montants.
  • Un seul fichier par traitement ; pour plusieurs photos, réunissez-les d’abord avec JPG vers PDF, au format A4.
  • Une image déposée seule prend la taille que lui donne sa résolution inscrite ; à défaut, 70 pixels par pouce sont supposés : 1 241 × 1 754 pixels donnent une page de 45 × 63,6 cm.

Questions fréquentes

Mon document est en espagnol ou en allemand. Puis-je quand même l’utiliser ?

Seuls le français et l’anglais sont proposés. Sur une autre langue, attendez-vous à davantage d’erreurs, notamment sur les lettres accentuées ou propres à cette langue, et relisez le résultat de près.

Combien de temps faut-il compter ?

Quelques secondes par page sur un ordinateur récent, davantage sur un téléphone ou pour une page dense, plus le téléchargement initial du moteur et de la langue.

Pourquoi le message « Aucun texte n’a été reconnu » ?

Il s’affiche en sortie Texte brut, pour une image ou un PDF d’une page, quand aucun caractère n’a été trouvé : image floue ou trop petite, contraste insuffisant, page presque vide, ou mauvaise langue choisie. Sur plusieurs pages, le fichier ne contient alors que les séparateurs.

Le téléchargement du module de langue échoue. Que faire ?

L’outil affiche alors « Impossible de télécharger le module de langue. Vérifiez votre connexion. » Contrôlez votre accès à Internet : un réseau d’entreprise ou un bloqueur qui filtre cdn.jsdelivr.net peut aussi empêcher ce téléchargement.

Guides liés

Fiche mise à jour le