Convertir un PDF en Word : ce qui est conservé, ce qui ne l’est pas

Par Jordan Javourez · Publié le · Mis à jour le

Un PDF fige l’apparence de pages ; un document Word organise un texte continu. Passer de l’un à l’autre oblige le convertisseur à deviner lignes, paragraphes et titres à partir de la position et de la taille des caractères. Voici ce qui survit à cette reconstruction, les défauts à repérer tout de suite et la façon de les corriger sans tout reprendre.

Une page figée contre un texte qui s’écoule

Le PDF est un format à mise en page fixe : il enregistre l’emplacement du texte, des images et des tracés sur chaque page, comme le rappelle l’aide de Word consacrée à l’ouverture des fichiers PDF. Le texte y prend la forme de fragments posés à des coordonnées précises. Sauf indication particulière, rien ne dit où finit un paragraphe ni quelle ligne sert de titre.

Cette indication peut exister. Le balisage permet à l’auteur d’un PDF de déclarer l’ordre de lecture voulu et la nature de chaque contenu, titre, liste ou tableau, pour en faciliter l’extraction et la réutilisation, explique la PDF Association. PDF vers Word ne lit pas ces balises : il reconstruit la structure en se fondant uniquement sur l’emplacement et le corps des caractères. La même source le souligne à propos de l’accessibilité : un logiciel qui se fie à la disposition de la page livre sa propre interprétation, pas l’intention de l’auteur.

Dernière subtilité : afficher une lettre et savoir de quelle lettre il s’agit sont deux opérations distinctes. La police fournit le dessin du caractère ; une table ToUnicode ou l’encodage de la police en donnent la signification. Quand cette correspondance fait défaut, la page s’affiche normalement mais le texte extrait est faux, comme l’explique un article de membre publié par la PDF Association.

Le test à faire avant de convertir

Ouvrez le PDF dans une visionneuse, essayez de sélectionner une phrase, puis cherchez un mot visible avec Ctrl+F (Cmd+F sur Mac). Ce que vous observez oriente la suite.

Ce que vous constatezDiagnosticMarche à suivre
La sélection et la recherche fonctionnentLe PDF contient du vrai texteConvertir directement
Rien ne se sélectionne, la recherche échoueLes pages sont des images, le plus souvent un scanPasser d’abord par l’OCR PDF, puis convertir le PDF cherchable obtenu
Le texte copié ressort en symboles sans rapportLes caractères ne sont pas reliés à leur significationRecourir à l’OCR, qui relit l’image de la page au lieu du texte enregistré
Méfiez-vous des PDF mixtes, où quelques pages scannées côtoient des pages de texte. L’outil n’avertit pas dans ce cas : une page sans texte ne produit rien et disparaît du fichier Word. Vérifiez que chaque page du PDF a son équivalent dans le résultat.

Ce que récupère l’outil, élément par élément

La conversion lit le texte de chaque page, le range de haut en bas puis de gauche à droite, assemble en lignes les fragments situés à la même hauteur, puis regroupe les lignes en paragraphes. Un nouveau paragraphe commence quand deux lignes successives sont séparées de plus de 1,8 fois la taille des caractères, écart mesuré d’une ligne de base à l’autre, c’est-à-dire entre les lignes invisibles sur lesquelles reposent les lettres. Chaque page du PDF démarre sur une nouvelle page du document.

Élément du PDFDans le fichier .docx
Texte courantConservé, avec une taille de caractères proche de l’original
Grands caractèresStyle Titre 1 au-delà de 1,5 fois la taille médiane du document, Titre 2 au-delà de 1,2 fois
Gras, italique, police, couleurPerdus
Images, logos, schémasAbsents : seul le texte est lu
TableauxAplatis : les cellules d’une même ligne sont mises bout à bout
Colonnes de texteMélangées : les lignes de même hauteur sont réunies
En-têtes, pieds de page, numéros de pagePrésents comme du texte ordinaire, sur chaque page
LiensLe texte reste, l’adresse de destination disparaît
Commentaires et signetsNon repris
Titre, auteur et autres métadonnéesNon repris : aucune propriété du PDF n’est copiée dans le fichier
Réponses tapées dans les champs d’un formulaireNon reprises : elles ne font pas partie du texte de la page

Quatre défauts vérifiés sur une page de test

Pour décrire ces défauts sans approximation, nous avons appliqué l’algorithme de conversion à une page fabriquée pour l’occasion. Chacun a sa parade.

Les colonnes s’entremêlent

Deux colonnes aux lignes alignées donnent un seul paragraphe où elles alternent : « Gauche ligne 1 Droite ligne 1 Gauche ligne 2… ». Aucun réglage ne l’évite. Pour quelques paragraphes, copiez chaque colonne séparément depuis votre visionneuse ; pour un long document en colonnes, comparez avec l’ouverture directe du PDF dans Word, décrite plus bas.

Les mots coupés gardent leur tiret

Un mot coupé en fin de ligne devient « conver- sion » : la conversion garde le tiret de coupure et lui ajoute une espace. Cherchez ce tiret suivi d’une espace avec la fonction de remplacement de votre traitement de texte, et décidez au cas par cas : « franco- allemand » doit garder son tiret, « conver- sion » doit le perdre.

Les paragraphes en retrait se soudent

Deux paragraphes distingués par un simple retrait de première ligne, sans blanc entre eux, fusionnent. Relisez les passages denses et recréez les retours à la ligne là où le propos change.

En-têtes et pieds de page s’intercalent

Le titre courant et le numéro de page subsistent en tête et en pied de chaque page convertie. Supprimez-les avant de retirer les sauts de page, sinon ils s’intercalent entre les deux moitiés des phrases qui chevauchaient deux pages.

Méthode : un document propre en peu de retouches

  1. Allégez le PDF de ce qui ne doit pas finir dans Word (couverture, annexes, pages blanches) avec Supprimer des pages.
  2. Si l’ouverture du fichier exige un mot de passe que vous connaissez, créez d’abord une copie sans protection avec Déverrouiller PDF : la conversion refuse les fichiers chiffrés de cette façon.
  3. Lancez la conversion et ouvrez le .docx obtenu.
  4. Supprimez les en-têtes et pieds de page répétés, puis les sauts de page, et recollez les phrases coupées au changement de page.
  5. Corrigez les mots coupés et séparez les paragraphes soudés.
  6. Effacez la mise en forme directe du texte courant, dont la taille a été fixée paragraphe par paragraphe, puis appliquez vos propres styles.
  7. Traitez les tableaux à part : convertissez les pages concernées avec PDF vers Excel, nettoyez-les en suivant le guide extraire un tableau vers Excel, puis collez-les dans le document.
  8. Réinsérez les illustrations utiles, exportées par exemple avec PDF vers PNG puis recadrées, et relisez chiffres, dates et noms propres face au PDF.

Quand mieux vaut ne pas convertir

  • Quelques mots à corriger : modifiez le PDF lui-même avec Éditer PDF, qui garde la mise en page. Ce guide sur la retouche du texte d’un PDF en détaille les limites.
  • Une maquette à reproduire à l’identique : demandez le fichier source à son auteur. Aucune reconstruction ne restitue exactement une mise en page riche.
  • Un document scanné : la qualité du fichier Word dépendra entièrement de la reconnaissance de caractères ; commencez par rendre le PDF cherchable.
  • Une mise en page complexe : Word sait ouvrir directement un PDF et tente d’en reproduire la disposition. Son aide prévient que le résultat peut différer de l’original et cite des éléments qui passent mal : tableaux avec espacement entre les cellules, cadres, notes de bas de page sur plusieurs pages, notes de fin, commentaires et balises PDF.

Questions fréquentes

Le fichier .docx s’ouvre-t-il avec d’autres logiciels que Word ?

Le .docx relève d’un format normalisé et publié, Office Open XML : norme ECMA-376 chez Ecma International, reprise par l’ISO/IEC sous la référence 29500. Le document produit n’utilise que des paragraphes, deux niveaux de titres et des sauts de page, ce qui limite les écarts d’affichage d’un logiciel à l’autre.

Peut-on récupérer les images du PDF ?

Pas avec cette conversion, qui ignore tout ce qui n’est pas du texte. Exportez la page voulue avec PDF vers PNG ou PDF vers JPG, puis recadrez l’illustration dans votre traitement de texte.

Pourquoi des mots contenant « fi » ou « fl » ressortent-ils abîmés ?

Beaucoup de polices dessinent ces paires de lettres d’un seul signe, une ligature, qui possède son propre code Unicode (U+FB01 pour « fi »). Quand le PDF relie correctement ce signe à ce code, la conversion le décompose en deux lettres ordinaires. Le défaut apparaît quand ce lien manque : le mot reçoit alors un caractère sans rapport. Repérez ce caractère, puis corrigez toutes ses occurrences d’un seul remplacement.

Le document est-il envoyé quelque part pendant la conversion ?

Non : la lecture du PDF et la création du .docx se déroulent dans votre navigateur. Le guide vérifier qu’un outil en ligne traite vos fichiers localement montre comment le constater par vous-même.

Sources