Deux sorties, deux usages
| Sortie | Contenu | À choisir si… |
|---|---|---|
| PDF cherchable (par défaut) | Un nouveau PDF : l’image de chaque page, avec le texte reconnu posé dessus en couche invisible | Vous voulez garder l’aspect du document, avec recherche et copie |
| Texte brut | Un fichier .txt ; au-delà d’une page, un séparateur numéroté précède chaque page | Seul le contenu compte : citation, réutilisation, archivage |
En sortie texte, le résultat s’affiche aussi à l’écran avec un bouton pour le copier. Pour un PDF, chaque page est rendue à 300 pixels par pouce avant analyse ; sur une très grande page, la résolution descend pour que le rendu ne dépasse pas 4 200 pixels de côté, soit 254 pixels par pouce pour un A3 et 89 pour un A0. Le PDF cherchable garde le format des pages d’origine : un A4 reste un A4.
Trois choix de langue et un téléchargement initial
Trois choix sont proposés : Français (par défaut), Anglais, ou Les deux pour un document qui mélange ces langues. Aucune autre langue n’est disponible.
La reconnaissance repose sur tesseract.js, version pour navigateur du moteur libre Tesseract. Au premier lancement, votre navigateur télécharge depuis le CDN jsDelivr le moteur, environ 4 Mo, puis les données de la langue choisie : environ 0,7 Mo pour le français et 2,8 Mo pour l’anglais.
Les langues sont ensuite rangées dans le stockage IndexedDB du navigateur, le moteur dans son cache ordinaire : effacer les données du site oblige au moins à retélécharger les langues. Vos pages, elles, sont analysées sur votre appareil, comme l’explique le guide traitement local.
Ce qui influence la qualité de lecture
- Le sens des pages : redressez une page à l’envers avec Pivoter PDF avant la reconnaissance.
- Le contraste : une ombre ou un fond grisâtre gênent la lecture ; le filtre « Document N&B » de Numériser vers PDF renforce le contraste d’une prise de vue.
- La netteté : une photo floue ou prise de trop loin donne des lettres mal formées, donc mal lues.
- L’écriture : les caractères imprimés se lisent bien mieux qu’une écriture manuscrite, souvent mal reconnue.
Ce que l’OCR remplace dans le fichier
Le PDF cherchable est reconstruit à partir des images de pages, y compris celles qui contenaient déjà du vrai texte : ce texte d’origine, les liens, les champs de formulaire, les signets et les propriétés ne sont pas repris. Si le texte de votre PDF est déjà sélectionnable, préférez PDF vers Texte.
Le résultat peut ensuite passer dans PDF vers Word ou PDF vers Excel, erreurs de reconnaissance comprises. Pour l’alléger sans perdre la couche de texte, n’utilisez que le niveau Sans perte de Compresser PDF.
Comment faire ?
- Déposez un PDF scanné, ou une image JPG ou PNG : une image donne une page.
- Choisissez la langue du document et la sortie souhaitée.
- Cliquez sur « Lancer l’OCR » ; la première fois, moteur et langue se téléchargent d’abord.
- Suivez l’avancement page par page ; « Annuler » interrompt le traitement.
- Téléchargez le fichier suffixé « -ocr », ou copiez le texte affiché.
Limites à connaître
- Deux langues seulement : le français et l’anglais.
- Une connexion est nécessaire au premier usage, puis chaque fois que le navigateur a perdu le moteur ou les langues.
- Le texte reconnu comporte des erreurs : relisez les chiffres, les noms propres et les montants.
- Un seul fichier par traitement ; pour plusieurs photos, réunissez-les d’abord avec JPG vers PDF, au format A4.
- Une image déposée seule prend la taille que lui donne sa résolution inscrite ; à défaut, 70 pixels par pouce sont supposés : 1 241 × 1 754 pixels donnent une page de 45 × 63,6 cm.
Questions fréquentes
Mon document est en espagnol ou en allemand. Puis-je quand même l’utiliser ?
Seuls le français et l’anglais sont proposés. Sur une autre langue, attendez-vous à davantage d’erreurs, notamment sur les lettres accentuées ou propres à cette langue, et relisez le résultat de près.
Combien de temps faut-il compter ?
Quelques secondes par page sur un ordinateur récent, davantage sur un téléphone ou pour une page dense, plus le téléchargement initial du moteur et de la langue.
Pourquoi le message « Aucun texte n’a été reconnu » ?
Il s’affiche en sortie Texte brut, pour une image ou un PDF d’une page, quand aucun caractère n’a été trouvé : image floue ou trop petite, contraste insuffisant, page presque vide, ou mauvaise langue choisie. Sur plusieurs pages, le fichier ne contient alors que les séparateurs.
Le téléchargement du module de langue échoue. Que faire ?
L’outil affiche alors « Impossible de télécharger le module de langue. Vérifiez votre connexion. » Contrôlez votre accès à Internet : un réseau d’entreprise ou un bloqueur qui filtre cdn.jsdelivr.net peut aussi empêcher ce téléchargement.
Guides liés
- Rendre un PDF scanné cherchable grâce à l’OCR : méthode et limites
Diagnostiquer un scan, soigner la numérisation, lancer la reconnaissance de caractères, vérifier le texte obtenu et éviter de perdre la couche de texte.
- Convertir un PDF en Word : ce qui est conservé, ce qui ne l’est pas
Texte, titres et paragraphes passent dans Word ; images, colonnes et tableaux se perdent ou se déforment. Les défauts à repérer et comment les corriger.
- Extraire un tableau d’un PDF vers Excel sans fausser les chiffres
Reconstituer lignes et colonnes, rattraper les décalages, convertir les montants en nombres avec VALEURNOMBRE et contrôler les totaux : la méthode pas à pas.
Fiche mise à jour le