PDF en image : choisir entre JPG et PNG, et la bonne résolution
Convertir une page de PDF en image revient à trancher deux questions : combien de pixels, et quelle compression. La première dépend de l’usage final, écran, impression ou reconnaissance de caractères ; la seconde dépend du contenu de la page. Voici les calculs utiles, les pièges fréquents et une méthode pour obtenir l’image adaptée du premier coup.
Des points par pouce aux pixels
Une page de PDF ne contient pas de pixels. Ses dimensions s’expriment dans un système de coordonnées dont l’unité vaut par défaut 1/72 de pouce, rappelle la PDF Association. Au moment de la conversion, le réglage en DPI (dots per inch, points par pouce) indique combien de pixels attribuer à chaque pouce de papier : la page est dessinée à l’échelle DPI ÷ 72.
Une feuille A4 mesure 210 × 297 mm (W3C, CSS Paged Media) et un pouce vaut 2,54 cm (W3C, CSS Values and Units). D’où, pour une page A4 :
| Réglage | Image obtenue | Pixels par cm de papier | Données brutes de l’image |
|---|---|---|---|
| 96 DPI | environ 794 × 1 123 pixels | environ 38 | environ 3,4 Mo |
| 150 DPI | environ 1 240 × 1 754 pixels | environ 59 | environ 8,3 Mo |
| 300 DPI | environ 2 480 × 3 508 pixels | environ 118 | environ 33 Mo |
La dernière colonne compte quatre octets par pixel, un pour chacune des composantes rouge, verte, bleue et d’opacité, comme les données de pixels d’un canevas (MDN, ImageData). C’est l’ordre de grandeur de ce que le navigateur manipule avant compression. À 300 DPI, largeur et hauteur doublent par rapport à 150 DPI : l’image compte quatre fois plus de pixels.
Quelle résolution pour quel usage
Le plus sûr est de raisonner sur les petits caractères. Un corps de 8 points mesure 8/72 de pouce ; voici la hauteur qu’il occupe dans l’image, comparée à celle d’un corps de 10 points :
| Corps du texte | 96 DPI | 150 DPI | 300 DPI |
|---|---|---|---|
| 8 points (notes, mentions) | environ 11 pixels | environ 17 pixels | environ 33 pixels |
| 10 points (texte courant) | environ 13 pixels | environ 21 pixels | environ 42 pixels |
- 96 DPI reprend la valeur du pixel CSS, que le W3C fixe à 1/96 de pouce : affichée sans redimensionnement dans une page web, l’image mesure 21 cm en unités CSS, ce qui ne garantit pas 21 cm réels sur l’écran. Les petits caractères y restent difficiles à lire.
- 150 DPI convient pour lire une page entière à l’écran, la joindre à un message ou l’imprimer sans exigence particulière.
- 300 DPI se justifie pour une impression soignée, un agrandissement ou une reconnaissance de caractères : Tesseract, moteur d’OCR open source, fonctionne au mieux à partir de cette résolution, selon sa documentation (Improving the quality of the output).
JPG ou PNG : tout dépend du contenu de la page
Le JPEG, normalisé sous la référence ISO/IEC 10918-1, définit un format d’image avec perte, riche en options pour encoder des photographies (JPEG). Le PNG, spécifié par le W3C, compresse sans perte et accepte un canal alpha, c’est-à-dire des zones transparentes (PNG, troisième édition).
En pratique, le guide des formats d’image de MDN conseille un format sans perte pour les captures d’écran, les schémas, les logos et les dessins au trait : le flou et les franges colorées y sautent aux yeux autour du texte et des contours nets. Sur une photo, les détails perdus se remarquent beaucoup moins.
| Contenu de la page | Format | Point de départ |
|---|---|---|
| Texte, tableau, formulaire | PNG | 150 DPI, ou 300 DPI si les caractères sont petits |
| Schéma, plan, graphique | PNG | 150 ou 300 DPI selon la finesse des traits |
| Photo pleine page, scan en couleurs | JPG | 150 DPI, qualité 85 % |
| Illustration à poser sur un fond coloré | PNG avec fond transparent | 150 DPI |
| Image soumise à une limite de poids | JPG | 96 ou 150 DPI, qualité à ajuster |
Dans PDF vers JPG, le curseur de qualité va de 50 à 100 %, avec 85 % au départ. La valeur est transmise au navigateur, qui encode l’image : pour les formats avec perte, l’API du canevas attend un nombre compris entre 0 et 1 (MDN, toBlob). PDF vers PNG n’a pas de curseur, puisque rien n’y est perdu.
Le fond transparent n’efface pas le blanc
Cocher « Fond transparent » dans PDF vers PNG supprime seulement le blanc que l’outil poserait sous la page. Tout ce que le PDF dessine lui-même reste opaque : l’image d’un scan, mais aussi le rectangle blanc que certains logiciels placent sous le contenu. PDF vers JPG, lui, pose toujours un fond blanc, puisque le JPEG n’a pas de canal alpha.
Le piège de la taille d’impression
Le réglage en DPI sert à calculer les pixels, mais l’image ne le conserve pas. Le PNG prévoit bien un bloc facultatif, nommé pHYs, pour indiquer la taille physique des pixels (spécification PNG). Selon MDN, une image créée par le canevas porte toutefois une résolution de 96 DPI quand son format sait l’indiquer, jamais celle que vous avez choisie. Lors de notre essai dans un navigateur Chromium, les PNG n’avaient même aucun bloc pHYs, et les JPG un simple rapport 1:1, sans unité.
Le logiciel qui reçoit l’image applique alors sa propre valeur. Une page A4 exportée en 300 DPI, large d’environ 2 480 pixels, mesure 21 cm à 300 pixels par pouce, mais environ 66 cm si le logiciel en compte 96. Au moment d’insérer ou d’imprimer l’image, fixez vous-même sa largeur en centimètres au lieu de garder la taille proposée.
Grands formats et longs documents
- Taille maximale du canevas : chaque page est dessinée dans un canevas dont la taille admise dépend de l’appareil. Elle dépasse en général 10 000 × 10 000 pixels, mais MDN signale une limite de 4 096 × 4 096 pixels sur les appareils iOS, au-delà de laquelle le dessin ne fonctionne plus. Une page A3 (297 × 420 mm) en 300 DPI mesure environ 3 508 × 4 961 pixels : sur iPhone ou iPad, restez à 150 DPI pour ce format.
- Longs documents : les images produites restent en mémoire tant que la page de résultats est ouverte. Pour quelques pages d’un gros rapport en 300 DPI, isolez-les d’abord avec Extraire des pages. Pendant la conversion, gardez l’onglet visible : la plupart des navigateurs mettent en pause les rappels d’animation qui cadencent le dessin des pages quand l’onglet passe en arrière-plan (MDN, requestAnimationFrame).
- Texte figé : dans une image, le texte n’est plus ni sélectionnable ni cherchable. S’il doit le redevenir, il faudra une reconnaissance de caractères.
Mode d’emploi
- Déterminez l’usage final : écran, impression, OCR ou envoi soumis à une limite de poids.
- Choisissez le format d’après le contenu : PNG pour le texte et les tracés, JPG pour les photos.
- Réglez la résolution, et la qualité pour un JPG, puis lancez la conversion.
- Ouvrez une image à 100 % et vérifiez que les plus petits caractères se lisent ; sinon, recommencez un cran au-dessus.
- Téléchargez la page voulue depuis sa vignette, ou toutes les pages dans l’archive ZIP.
Questions fréquentes
DPI, PPP, PPI : quelle différence ?
Dans ces outils, aucune. PPP (points par pouce) traduit DPI ; PPI (pixels per inch) désigne plus exactement les pixels d’une image. Les trois expriment ici le même rapport entre les pixels produits et la taille de la page d’origine.
Quelle résolution pour une image destinée à l’OCR ?
300 DPI en PNG : c’est à partir de cette résolution que la documentation de Tesseract situe ses meilleurs résultats, et le PNG évite les franges de compression autour des lettres. Si le document est déjà un PDF, inutile de passer par des images : OCR PDF rend lui-même chaque page à 300 DPI, un peu moins pour les très grands formats, et en garde le format. Une image exportée ici ne porte pas la résolution choisie : déposée dans OCR PDF, elle y deviendrait une page démesurée, d’environ 90 × 127 cm pour un A4 exporté en 300 DPI sans résolution inscrite.
Pourquoi des taches entourent-elles les lettres de mon JPG ?
Ce sont des artefacts de la compression avec perte, d’autant plus visibles que les contours sont nets et la qualité basse. Remontez le curseur vers 90 % ou convertissez plutôt la page en PNG.
Les images reprennent-elles le titre ou l’auteur du PDF ?
Non. L’outil dessine la page puis l’enregistre en image : le titre, l’auteur ou le logiciel inscrits dans les propriétés du PDF ne sont pas copiés. Tout ce qui est visible sur la page passe en revanche, jusqu’à une mention imprimée en pied de page. Le guide sur les métadonnées détaille ce que ces propriétés peuvent révéler.
Sources
- PDF Association — How big can your PDF page be? (20 juillet 2023)
- W3C — CSS Paged Media Module Level 3 (formats de page ISO)
- W3C — CSS Values and Units Module Level 3 (unités absolues)
- MDN — ImageData : propriété data
- Tesseract — Improving the quality of the output
- JPEG — Overview of JPEG 1 (ISO/IEC 10918-1)
- W3C — Portable Network Graphics (PNG) Specification, Third Edition
- MDN — Image file type and format guide
- MDN — HTMLCanvasElement : méthode toBlob() (qualité, résolution de 96 DPI)
- MDN — L’élément canvas (taille maximale)
- MDN — Window : méthode requestAnimationFrame()