Métadonnées d’un PDF : ce qu’elles révèlent et comment les nettoyer

Par Jordan Javourez · Publié le

Un PDF transporte davantage que ses pages : le nom de son auteur, le logiciel qui l’a produit, ses dates, parfois des identifiants qui relient plusieurs versions d’un document. Ce guide explique où se logent ces informations, ce qu’elles laissent deviner, les traces qui leur échappent, puis comment nettoyer un fichier avant de le partager et contrôler le résultat.

Deux emplacements pour les mêmes informations

Le premier est le dictionnaire Info, présent dès la version 1.0 du format. Ses entrées portent des noms anglais, comme Author ou Producer, et certains logiciels y ajoutent des clés de leur choix.

Le second, apparu avec PDF 1.4, est le flux de métadonnées XMP : un paquet XML dont les propriétés suivent la spécification XMP. PDF 2.0 en fait la méthode recommandée et déprécie les entrées standard du dictionnaire Info, sauf les deux dates. Un fichier peut contenir les deux, et un logiciel qui n’en met qu’un à jour les rend contradictoires : un lecteur affiche alors le nouvel auteur, un autre outil l’ancien. La norme permet en outre d’associer un paquet XMP à un composant, par exemple une image.

Ce que ces champs laissent deviner

QuestionDictionnaire InfoPaquet XMPCe que l’on peut y lire
Qui ?Authordc:creatorUne personne, un organisme ou un service
Avec quoi ?Creator, Producerxmp:CreatorTool, pdf:ProducerLe premier logiciel employé, puis celui qui a produit le PDF
Quand ?CreationDate, ModDatexmp:CreateDate, xmp:ModifyDate, xmp:MetadataDateDate et heure de création, de modification, de retouche des métadonnées
De quoi ?Title, Subject, Keywordsdc:title, dc:description, dc:subject, pdf:KeywordsUn titre de travail, un nom de client, une référence de dossier
Quelle filiation ?aucune entréexmpMM:DocumentID, xmpMM:OriginalDocumentID, xmpMM:InstanceIDUn identifiant commun aux versions, celui de la source, celui de l’enregistrement
Quel parcours ?aucune entréexmpMM:HistoryLes actions qui ont abouti à cette version, dans l’ordre

Rien de cela ne se voit en feuilletant le document, mais la fenêtre des propriétés d’un lecteur PDF en affiche une bonne part. Une date de création vieille de plusieurs années trahit un modèle réutilisé ; un titre resté sur « Offre Lambert v2 » révèle le destinataire précédent.

Selon la spécification XMP, un fichier enregistré dans un autre format devrait recevoir un nouvel identifiant de document, tout en gardant celui de sa source dans xmpMM:OriginalDocumentID. Deux PDF tirés du même fichier, l’un nominatif, l’autre anonymisé, peuvent ainsi être rapprochés.

Hors métadonnées, le fichier peut aussi porter un identifiant de fichier : d’après la norme, sa première partie est permanente, fondée sur le contenu du fichier lors de sa création, et ne change pas quand le fichier est mis à jour.

Les traces que les métadonnées ne couvrent pas

  • Les photos intégrées. Selon la CNIL, les photos contiennent souvent, grâce à leurs métadonnées, notamment celles du GPS, le lieu et l’heure de la prise de vue. JPG vers PDF recopie les fichiers JPG tels quels, avec ces données s’il y en a, alors que Numériser vers PDF redessine chaque photo avant de l’insérer.
  • Les commentaires : leur texte, et un libellé qui, selon la norme, identifie la personne qui les a ajoutés.
  • Les pièces jointes, avec leur contenu et leurs propres métadonnées.
  • Les calques : un contenu facultatif désactivé ne s’affiche pas, mais reste dans la page.
  • Le texte invisible : couche OCR d’un scan, caractères blancs, passage recouvert par une forme, autant de cas détaillés dans le guide Caviarder un PDF.
  • Les versions antérieures : le format permet d’ajouter une modification à la fin du fichier en laissant les données d’origine intactes. Derrière la version affichée peuvent alors subsister l’ancien texte d’une page ou l’ancien auteur.

À la source : nettoyer avant l’export

Si vous disposez du fichier d’origine, agissez d’abord sur lui : ce qui en est retiré ne peut plus passer dans le PDF.

  • Word : l’Inspecteur de document (Fichier, Informations, Vérifier la présence de problèmes, Inspecter le document) repère notamment les commentaires, les marques de révision, les propriétés, le nom d’utilisateur et le texte masqué. L’aide officielle recommande de l’utiliser sur une copie, les données supprimées n’étant pas toujours récupérables. À l’enregistrement en PDF, le bouton Options permet aussi de décocher « Propriétés du document ».
  • LibreOffice : sous Outils, Options, LibreOffice, Sécurité, le bouton Options mène à la case « Supprimer les informations personnelles lors de l’enregistrement ». Selon l’aide du logiciel, elle retire les données utilisateur des propriétés, des commentaires et du suivi des modifications, remplace les noms d’auteur par des valeurs génériques et uniformise les horodatages.

Nettoyer un PDF existant avec Métadonnées PDF

Sans fichier source, Métadonnées PDF agit directement sur le PDF, dans votre navigateur ; le guide consacré au traitement local montre comment le vérifier.

  1. Partez d’une copie, l’original restant rangé à part.
  2. Chargez la copie : les six champs du dictionnaire Info affichent leurs valeurs et les dates restent en lecture seule. Si le fichier contient du XMP, un encadré indique le nombre de flux et prévient qu’ils seront supprimés.
  3. Choisissez champ par champ. Un titre neutre peut rester ; l’auteur, le sujet et les mots-clés servent rarement à un destinataire extérieur. « Tout effacer » vide les cases, sauf le producteur, remplacé par WeArePDF.
  4. Enregistrez : vos valeurs remplacent celles du dictionnaire Info et tous les flux XMP disparaissent, qu’ils soient rattachés au document, à une page, à une image ou à une police, ou que plus aucun objet ne les désigne. Un message indique ensuite combien de flux ont été supprimés.
  5. Renommez la copie si besoin : elle porte le nom initial complété par « -metadonnees ».

Ce que l’outil laisse en place

Son code, confirmé par un essai sur un fichier auquel une révision avait été ajoutée, laisse intacts :

  • les dates de création et de modification ;
  • l’identifiant de fichier ;
  • les clés supplémentaires du dictionnaire Info, que l’outil n’affiche pas ;
  • les commentaires et leur auteur, les pièces jointes, les calques et les images, EXIF compris ;
  • les restes d’une révision antérieure : le fichier est réécrit d’un seul tenant, mais tous les objets lus sont recopiés. Si la révision avait placé le nouveau contenu sous d’autres numéros d’objet, l’ancien texte de page et l’ancien auteur restent dans la copie, invisibles à l’écran ; si elle avait réutilisé les mêmes numéros, ils disparaissent.

Par ailleurs, l’outil prévient qu’un fichier PDF/A cesse de se déclarer conforme, puisque cette mention est inscrite dans le paquet XMP. Un fichier chiffré ne s’ouvre pas dans l’outil : levez d’abord son chiffrement avec Déverrouiller PDF ; cela suppose d’en avoir obtenu l’autorisation.

Vérifier le fichier nettoyé

  1. Rechargez la copie dans Métadonnées PDF : vos valeurs s’affichent et l’encadré sur les flux XMP a disparu.
  2. Ouvrez-la dans un second lecteur PDF : fenêtre des propriétés, puis listes de commentaires, de pièces jointes et de calques s’il en propose.
  3. Passez-la dans PDF vers Texte et cherchez les noms sensibles : l’extraction reprend aussi le texte invisible et les caractères blancs.
  4. Ne concluez rien d’une recherche dans un éditeur de texte : la copie range la plupart de ses objets dans des flux compressés.
Les restes d’une révision antérieure ne se repèrent qu’avec un outil d’analyse qui liste tous les objets du fichier, y compris ceux qu’aucune page n’utilise.

Quand il faut aller plus loin

  • Une mention visible (nom, numéro, signature) : retirez-la avec Caviarder PDF.
  • Des commentaires, pièces jointes ou révisions : repartez du fichier source nettoyé et exportez un nouveau PDF, qui ne contiendra aucune révision de l’ancien.
  • Aucun fichier source : OCR PDF, sortie « PDF cherchable », bâtit un fichier neuf où chaque page devient une image doublée du texte reconnu ; seul l’aspect visible des pages y passe. Sans besoin de texte cherchable, PDF vers JPG puis JPG vers PDF, en format A4 ou Lettre sans marge, aboutissent à un fichier neuf du même genre.
  • Un PDF/A exigé : corrigez le fichier source puis produisez un nouveau PDF/A, par exemple avec l’option PDF/A proposée dans les options d’enregistrement en PDF de Word.

Questions fréquentes

Les métadonnées prouvent-elles l’origine d’un document ?

Non. Tout logiciel peut les remplir ou les réécrire, Métadonnées PDF compris. Même les dates sont indicatives : la spécification XMP précise que la date de création n’a pas à correspondre à celle du système de fichiers.

Le nettoyage change-t-il l’apparence du document ?

Non. Le contenu des pages n’est pas modifié ; seule la structure du fichier est réécrite, ce qui peut faire varier son poids.

Sources