PDF vers Excel

Transformez le texte d’un PDF en classeur .xlsx : il est réparti en rangées et en colonnes d’après sa position sur la page, avec une feuille par page. Un aperçu des premières lignes s’affiche avant le téléchargement.

Chargement de l’outil…

Du texte positionné aux cellules

Un PDF ne contient pas de tableau à proprement parler, seulement des morceaux de texte placés à des coordonnées, parfois entourés de traits. L’outil ignore les traits et raisonne sur les coordonnées, en trois temps :

  1. Rangées : la page est lue de haut en bas, et un texte rejoint la rangée en cours s’il se trouve à 4 points au plus, soit environ 1,4 mm, de la hauteur du premier texte de cette rangée.
  2. Colonnes : les positions de départ de tous les textes de la page sont triées ; une position située à moins de 8 points (environ 2,8 mm) de la dernière colonne retenue s’y rattache, sinon elle ouvre une nouvelle colonne.
  3. Cellules : chaque texte rejoint la plus proche des colonnes qui commencent à sa gauche ; deux textes tombés dans la même case sont réunis par une espace.

Les feuilles portent le numéro de la page dont elles proviennent : « Page 1 », « Page 2 », etc.

Lire l’aperçu

Une fois le calcul terminé, l’écran indique le nombre de feuilles et montre les 15 premières lignes de la première feuille. Trois situations se reconnaissent d’un coup d’œil :

  • une information par case et des colonnes alignées : le tableau était régulier, le classeur est exploitable presque tel quel ;
  • une même colonne visuelle éclatée sur deux ou trois colonnes : c’est typique des montants alignés à droite, dont le point de départ varie avec le nombre de chiffres ;
  • des phrases entières dans une seule case : la page contient aussi du texte courant, qui occupe ses propres rangées autour du tableau.

Remettre le classeur au propre

Toutes les valeurs sont écrites comme du texte, nombres et dates compris : Excel les aligne à gauche et une somme les ignore. Pour calculer, retirez les espaces des milliers et le symbole monétaire, puis convertissez la colonne avec la fonction CNUM ou l’outil Convertir de l’onglet Données.

Supprimez ensuite les colonnes presque vides dues à un décalage et regroupez les montants éclatés. Pour un relevé de plusieurs pages, copiez les rangées des feuilles suivantes sous celles de la première, sans les en-têtes répétés ; les colonnes étant calculées page par page, vérifiez d’abord qu’elles se correspondent.

Une cellule dont le texte occupe deux lignes dans le PDF donne deux rangées dans le classeur, la seconde ne portant que la fin du texte. Repérez ces rangées incomplètes avant de trier ou de filtrer.

Selon le document, un autre outil

Pour simplement relire ou copier le contenu, PDF vers Texte évite le découpage en cellules. Le guide consacré à l’extraction de tableaux détaille les décalages courants et la conversion des textes en nombres.

Vos relevés et factures restent sur l’appareil : la lecture du PDF comme l’écriture du classeur se déroulent dans le navigateur (comment s’en assurer).

Comment faire ?

  1. Sélectionnez le PDF qui contient le tableau.
  2. Cliquez sur « Convertir en Excel ».
  3. Examinez l’aperçu de la première feuille.
  4. Téléchargez le .xlsx, puis convertissez en nombres les colonnes chiffrées.

Limites à connaître

  • Nombres et dates arrivent en texte, sans formule ni format.
  • Des colonnes très serrées, ou des textes décalés d’une rangée à l’autre, faussent le découpage.
  • Un tableau réparti sur plusieurs pages arrive en plusieurs feuilles, à recoller.
  • Un PDF verrouillé à l’ouverture doit d’abord être déverrouillé avec son mot de passe, via Déverrouiller PDF.

Questions fréquentes

Pourquoi une colonne de montants est-elle éclatée ?

Les colonnes sont fixées par l’endroit où commence chaque texte. Des montants alignés à droite démarrent plus ou moins loin selon leur longueur ; au-delà de 8 points d’écart, ils ouvrent une colonne distincte. Fusionnez-les ensuite dans Excel.

Le classeur a une feuille « Page 3 » mais pas « Page 2 » : pourquoi ?

La page 2 du PDF ne contenait aucun texte, par exemple une page blanche ou une image seule. L’outil ne crée pas de feuille vide et garde le numéro de page d’origine dans le nom.

Rien n’est extrait de mon relevé scanné : que faire ?

Un scan ne contient que des images, et l’outil vous renvoie vers OCR PDF. Sa sortie « PDF cherchable » ajoute une couche de texte que PDF vers Excel sait lire, mais chaque mot reconnu y devient un fragment distinct. Lors de notre essai, un tableau de 4 colonnes parfaitement reconnu a donné 9 colonnes : « Frais de port » occupait trois cases, « 1 234,56 » deux. Prévoyez de regrouper ces cases et de contrôler chaque chiffre.

Les bordures et couleurs du tableau sont-elles reprises ?

Non. Seul le texte est lu : traits, fonds colorés et cellules fusionnées ne sont pas analysés. Mettez le tableau en forme dans Excel une fois les données vérifiées.

Guides liés

Fiche mise à jour le