Comment convertir un PDF en Word (et à quoi s'attendre)

On vous a envoyé un PDF et vous devez y modifier deux lignes. Vous le passez dans un convertisseur. Vous ouvrez le fichier Word résultant. Le tableau est complètement éclaté sur la page, du texte flotte dans une zone de texte sans raison apparente, et un paragraphe entier utilise une police que vous n'avez jamais vue de votre vie. Vous passez plus de temps à corriger le résultat qu'il ne vous en aurait fallu pour tout retaper à la main.

Voilà l'expérience honnête de la conversion PDF vers Word pour beaucoup de fichiers. Ça ne se passe pas toujours ainsi, mais tout dépend du type de PDF avec lequel vous démarrez.

Natif vs scanné : la seule chose qui compte vraiment

Chaque PDF appartient à l'une de ces deux catégories : soit il contient de véritables données textuelles (les caractères sont encodés et peuvent être sélectionnés), soit il ne contient que des images de pages, sans aucun texte exploitable.

Le premier type est appelé un PDF natif. Si vous avez déjà exporté un document depuis Word, Google Docs ou un outil de design, vous avez créé un PDF natif. Le texte y est réel, la structure est réelle, et un convertisseur peut travailler avec.

Le deuxième type est ce que vous obtenez à partir d'un scanner. Le scanner photographie la page et enveloppe ces photos dans un PDF. Il n'y a rien à extraire. Le convertisseur regarde des pixels, pas du texte.

La plupart des problèmes de conversion surviennent lorsque les gens tentent de convertir des PDF scannés comme s'il s'agissait de PDF natifs. Le résultat est soit une grande image non modifiable intégrée dans un fichier Word, soit un gâchis d'approximations de l'outil de reconnaissance de caractères (OCR).

Ce que fait réellement l'OCR, et ses limites

L'OCR (Optical Character Recognition ou Reconnaissance Optique de Caractères) est la technologie qui lit les images de texte et tente de les transformer en vrais caractères. Ce n'est pas magique, et la technologie échoue de manière assez prévisible.

Cela fonctionne bien sur des documents propres, imprimés dans une police standard et numérisés à une résolution correcte (300 DPI ou plus). Du texte noir sur du papier blanc, sans ombres, sans inclinaison. La plupart des documents de bureau imprimés au cours des 20 dernières années entrent dans cette catégorie et se convertissent plutôt bien.

L'OCR s'effondre rapidement dès qu'une de ces conditions manque. L'écriture manuscrite est presque toujours mal lue, parfois de manière très comique. Les polices décoratives sont mal interprétées. Les photocopies pâlies produisent des caractères tronqués partout. Les filigranes la perturbent. Et les documents bilingues sur une même page génèrent souvent des erreurs pour les deux langues.

La règle d'or : si vous pouvez tenir une page scannée à la lumière et la lire facilement, l'OCR s'en sortira probablement bien. Si vous devez plisser les yeux, l'algorithme aussi.

Où la conversion perd réellement en qualité

Même avec un PDF natif parfait, certaines choses ne survivent pas proprement à la conversion.

La mise en page d'un PDF est absolue. Chaque élément est placé à une coordonnée X/Y précise sur la page. La mise en page de Word, elle, est basée sur un flux continu (le texte "coule"), ce qui signifie que les éléments se décalent au fur et à mesure que le contenu change. Lorsqu'un convertisseur traduit un modèle vers l'autre, il fait des suppositions. Parfois, ces suppositions tiennent la route. Souvent, elles s'effondrent.

Les tableaux sont les pires. Un simple tableau à deux colonnes dans un PDF natif se convertit généralement bien. En revanche, un tableau complexe avec des cellules fusionnées, du contenu imbriqué ou des bordures personnalisées ressort souvent sous forme de texte brut. Pire encore, il apparaît parfois comme un tableau qui a l'air correct, jusqu'à ce que vous essayiez de modifier une cellule et que tout se décale.

Les mises en page sur plusieurs colonnes (comme les newsletters ou les articles de recherche) ont tendance à être fusionnées en une seule colonne. Le texte est bon, mais l'ordre de lecture est totalement faux.

Les images sont préservées en tant qu'images, ce qui est très bien, mais leur positionnement par rapport au texte est souvent décalé. Des images qui étaient soigneusement insérées au sein du texte original finissent par flotter n'importe où dans le fichier Word.

Les en-têtes et pieds de page survivent parfois, parfois non.

La correspondance des polices est imparfaite par nature. Les PDF intègrent les métriques des polices mais pas toujours les polices elles-mêmes. Le convertisseur choisit alors la correspondance la plus proche disponible, ce qui convient généralement pour le corps du texte mais s'avère souvent erroné pour les titres ou les éléments distinctifs.

Quand ne pas s'embêter avec la conversion

Si votre PDF est un contrat signé, un formulaire gouvernemental ou tout document dont la précision de la mise en page a une valeur légale, ne le convertissez pas. Les décalages de formatage qui se produisent pendant la conversion sont minimes, mais ils peuvent modifier les sauts de ligne, les sauts de page et le regroupement visuel du contenu. Un éditeur conçu pour les PDF (comme Acrobat, PDF Expert, ou même certains outils en ligne) est l'outil adéquat.

Si vous avez simplement besoin de quelques paragraphes tirés d'un PDF natif, le chemin le plus rapide reste d'ouvrir le PDF, de sélectionner le texte, de le copier, puis de le coller dans Word. Vous perdez la mise en forme, mais vous obtenez un texte propre en une dizaine de secondes. Aucun convertisseur n'est nécessaire.

Comment fonctionne la conversion sur Converthor

Le convertisseur présent ici utilise pdf2docx, une bibliothèque Python conçue spécifiquement pour les PDF natifs. Téléchargez votre fichier, cliquez sur convertir, et vous obtenez un .docx en retour. Il gère la structure des paragraphes, les tableaux simples, les images intégrées et le formatage standard comme le gras et l'italique. Le fichier obtenu s'ouvre sans problème dans Word, LibreOffice ou Google Docs.

Le fichier est supprimé de nos serveurs immédiatement après votre téléchargement. Pas besoin de créer un compte, et il n'y a aucun filigrane.

Si vous travaillez avec un PDF scanné, l'outil tentera tout de même la conversion, mais le résultat variera énormément selon la qualité du scan. Pour les documents scannés très proprement, cela fonctionne souvent. Pour tout ce qui est plus ancien ou de plus faible résolution, attendez-vous à devoir relire et corriger attentivement.

Le processus est volontairement minimaliste :

  1. Téléchargez votre PDF (jusqu'à 50 Mo)
  2. Cliquez sur Convertir
  3. Téléchargez le fichier .docx

Si le résultat pose problème, regardez d'abord le PDF. La plupart des erreurs proviennent de ce qui se trouvait dans le fichier original, et non de la conversion en elle-même. (Vous pouvez convertir un PDF en Word sur cette page).

auto_awesome

Try it free — no signup

PDF to Word

Convert PDF documents to editable Word (DOCX) online. Extract text and layout accurately for easy editing.

arrow_back All articles