Le texte tel qu’il ressort
L’outil lit le texte réellement inscrit dans le fichier, page après page, et le restitue ligne par ligne : chaque ligne du PDF devient une ligne du résultat. Les mots sont séparés par une seule espace, même là où le PDF les écartait pour aligner des colonnes ou justifier un paragraphe.
Aucune ligne vide ne sépare les paragraphes d’une même page, et les mots coupés en fin de ligne gardent leur trait d’union. En-têtes, pieds de page et numéros de page figurent dans le texte, à leur place sur chaque page.
Avec ou sans « Séparer les pages »
Cochée par défaut, l’option insère entre deux pages un repère « ––– Page 2 ––– », entouré de lignes vides. C’est pratique pour retrouver l’origine d’une citation, ou pour découper le fichier par page dans un script.
Décochée, elle laisse un texte continu où les pages ne sont séparées que par une ligne vide, plus commode à coller dans un traitement de texte ou à confier à un outil d’analyse.
À quoi sert l’extraction
- Récupérer d’un bloc le contenu d’un long document, sans sélectionner les pages une à une dans une visionneuse.
- Chercher des mots-clés dans une série de documents, ou les indexer avec un éditeur de texte ou un script.
- Vérifier qu’un PDF contient du vrai texte avant de le convertir vers Word ou Excel.
- Contrôler un document caviardé : si un passage masqué réapparaît ici, il était seulement recouvert. Refaites le masquage avec Caviarder PDF et voyez pourquoi masquer une zone ne suffit pas toujours.
Résultat vide ou incohérent
Quand aucune page ne contient de texte, l’outil annonce qu’il n’a rien trouvé d’extractible et ne propose pas de fichier ; si seules certaines pages sont scannées, elles restent vides dans le résultat. L’OCR PDF reconnaît alors les caractères, et sa sortie « Texte brut » produit directement un .txt ; le guide rendre un PDF scanné cherchable aide à le régler.
Parfois, le texte sort sous forme de symboles sans rapport avec les mots affichés : le PDF ne relie pas les formes de ses lettres aux caractères qu’elles représentent. L’extraction ne peut pas deviner le texte ; l’OCR, qui relit l’image de chaque page, peut alors le récupérer.
Sur une page à plusieurs colonnes, les lignes placées à la même hauteur sont lues de gauche à droite d’un seul trait : le contenu des colonnes s’entrelace.
Comment faire ?
- Chargez le PDF dont vous voulez le texte.
- Gardez « Séparer les pages » pour conserver des repères, ou décochez-la pour un texte continu.
- Cliquez sur « Extraire le texte ».
- Copiez le résultat avec « Copier le texte », ou téléchargez le fichier .txt.
Limites à connaître
- Les pages scannées ou photographiées ne livrent aucun texte sans OCR.
- Gras, tableaux, images et alignements disparaissent : il ne reste que les mots.
- Les pages composées en plusieurs colonnes donnent un texte entrelacé.
- L’extraction échoue sur un PDF qui réclame un mot de passe pour s’ouvrir ; retirez-le d’abord avec Déverrouiller PDF si vous le connaissez.
Questions fréquentes
Dans quel encodage le fichier .txt est-il enregistré ?
En UTF-8 : accents, guillemets typographiques et symbole € sont conservés, et les éditeurs de texte actuels l’ouvrent sans réglage.
Le bouton « Copier le texte » échoue : comment faire ?
Le navigateur a refusé l’accès au presse-papiers, et l’outil l’indique. Cliquez dans la zone de texte, sélectionnez tout avec Ctrl+A (Cmd+A sur Mac), puis copiez avec Ctrl+C (Cmd+C).
Pourquoi le résultat contient-il des phrases invisibles sur la page ?
L’extraction lit tout le texte inscrit dans le fichier, visible ou non : texte recouvert par une forme, écrit en blanc sur fond blanc, ou couche invisible ajoutée par un OCR. C’est attendu, mais c’est aussi une alerte pour un document censé être caviardé.
Comment retirer les numéros de page du texte ?
Ils font partie du contenu de chaque page. Avec « Séparer les pages », ils se trouvent juste avant ou juste après chaque repère, ce qui facilite leur suppression dans un éditeur.
Peut-on extraire seulement quelques pages ?
L’outil traite tout le document. Isolez d’abord les pages voulues avec Extraire des pages, ou servez-vous des repères de page pour aller droit au passage recherché.
Guides liés
- Rendre un PDF scanné cherchable grâce à l’OCR : méthode et limites
Diagnostiquer un scan, soigner la numérisation, lancer la reconnaissance de caractères, vérifier le texte obtenu et éviter de perdre la couche de texte.
- Caviarder un PDF : pourquoi un rectangle noir ne suffit pas
Un rectangle noir posé sur un PDF laisse souvent le texte lisible par copier-coller. Où l’information survit, comment la supprimer vraiment et vérifier.
Fiche mise à jour le