Ce qui arrive dans le fichier Word
Le document produit est volontairement dépouillé : du texte courant découpé en paragraphes, avec deux niveaux de titres. Chaque page du PDF commence sur une nouvelle page Word, ce qui aide à comparer avec l’original ; une page sans texte est simplement sautée.
| Dans le PDF | Dans le .docx |
|---|---|
| Paragraphes | reconstitués ; les retours à la ligne internes disparaissent et le texte se recompose librement |
| Caractères nettement plus grands que le corps du texte | style Titre 1 ou Titre 2 |
| Taille du texte courant | reprise de façon approchée, entre 6 et 72 points |
| Police, gras, italique, couleurs | non repris |
| Images, logos, dessins | absents |
| Tableaux | contenu des cellules mis bout à bout, souvent dans un seul paragraphe |
| Liens | le texte reste, le lien disparaît |
Comment la structure est devinée
Un PDF ne contient pas de paragraphes, seulement des morceaux de texte posés à des coordonnées. L’outil les classe du haut vers le bas puis de gauche à droite, et réunit sur une même ligne ceux dont la position verticale ne s’écarte pas de plus de 60 % de la taille des caractères.
Deux lignes restent dans le même paragraphe tant que la distance entre leurs lignes de base ne dépasse pas 1,8 fois la taille du texte. La taille médiane de tous les fragments de texte du document sert ensuite de référence : un paragraphe dont la taille dépasse 1,5 fois cette médiane devient Titre 1 ; au-delà de 1,2 fois, Titre 2.
Ces deux niveaux sont les styles de titre standard du format .docx, nommés Titre 1 et Titre 2 dans un Word en français. Ils gardent l’apparence que leur fixe la bibliothèque qui génère le fichier, 16 et 13 points en bleu, quelle que soit la police du PDF.
Documents favorables, documents difficiles
Un rapport ou un courrier enregistré en PDF depuis Word ou un logiciel équivalent, sur une colonne, avec des paragraphes espacés et des titres plus grands que le corps, se retrouve presque prêt à retoucher. Les cas suivants demandent davantage de reprise :
- colonnes : les lignes situées à la même hauteur dans deux colonnes fusionnent, et les phrases se mélangent ;
- paragraphes sans espacement, marqués seulement par un retrait : ils forment un seul bloc ;
- double interligne : chaque ligne peut devenir un paragraphe à part ;
- mots coupés en fin de ligne : le trait d’union reste, suivi d’une espace ;
- en-têtes et pieds de page : ils reviennent comme texte ordinaire au début et à la fin de chaque page.
Pour changer quelques mots sans perdre la mise en page, Éditer PDF est plus adapté (possibilités et limites). Le guide convertir un PDF en Word détaille ce qui est conservé.
Comment faire ?
- Importez le PDF à convertir.
- Cliquez sur « Convertir en Word » : aucun réglage n’est nécessaire.
- Si l’outil signale qu’aucun texte n’est extractible, passez le document dans l’OCR, puis recommencez avec le PDF obtenu.
- Téléchargez le .docx, qui porte le nom du PDF.
- Dans Word, contrôlez les titres détectés et recollez les paragraphes mal découpés.
Limites à connaître
- Ni images, ni tableaux, ni mise en forme des caractères ne sont transférés.
- Les mises en page en colonnes donnent un texte entremêlé.
- Un PDF scanné ne produit rien sans passage préalable par OCR PDF.
- Si le fichier réclame un code à l’ouverture, retirez cette protection avec Déverrouiller PDF, à condition de connaître le code.
Questions fréquentes
Pourquoi mon tableau est-il devenu un bloc de texte ?
L’outil ne crée pas de tableaux Word : il lit le texte ligne par ligne, met bout à bout les cellules d’une rangée et réunit les rangées rapprochées en un paragraphe. Pour exploiter un tableau, passez plutôt par PDF vers Excel.
Pourquoi certains mots contiennent-ils une espace en trop ?
Quand la police ou la taille change au milieu d’un mot (exposant, lettre en gras), le PDF découpe ce mot en deux morceaux, que l’outil réunit avec une espace. La fonction Rechercher et remplacer de Word corrige vite les cas répétitifs.
Le message « Aucun texte extractible » apparaît : pourquoi ?
Le PDF ne contient que des images de pages, en général parce qu’il a été numérisé. Faites-le reconnaître par OCR PDF (sortie « PDF cherchable »), puis convertissez le résultat : le .docx reprendra le texte reconnu, erreurs de lecture comprises. Voir aussi OCR d’un PDF scanné.
Mon titre en gras n’est pas devenu un titre : pourquoi ?
La détection ne regarde que la taille des caractères. Un intitulé en gras de même taille que le corps du texte reste un paragraphe ordinaire : appliquez-lui le style Titre 1 ou Titre 2 dans Word.
Guides liés
- Convertir un PDF en Word : ce qui est conservé, ce qui ne l’est pas
Texte, titres et paragraphes passent dans Word ; images, colonnes et tableaux se perdent ou se déforment. Les défauts à repérer et comment les corriger.
- Rendre un PDF scanné cherchable grâce à l’OCR : méthode et limites
Diagnostiquer un scan, soigner la numérisation, lancer la reconnaissance de caractères, vérifier le texte obtenu et éviter de perdre la couche de texte.
- Modifier le texte d’un PDF existant : possibilités et limites
Corriger un mot, une date ou un montant dans un PDF : pourquoi ce n’est pas un fichier Word, ce qu’un éditeur peut changer et les précautions à prendre.
Fiche mise à jour le