PDF → Word
Convertissez le texte d'un PDF en document .docx éditable. Gratuit, sans upload. 1 Go max · Jusqu'à 1 Go · Traité localement, jamais envoyé sur un serveur.
Le PDF est un format d’arrivée : il fige une mise en page pour qu’elle s’affiche à l’identique partout. Le jour où il faut corriger un montant dans un devis dont le fichier source a disparu, cette qualité se retourne contre vous. PDF → Word récupère alors ce qui est récupérable, c’est-à-dire le texte, et le livre dans un document .docx modifiable.
L’outil ouvre le document avec PDF.js, demande à chaque page sa couche de texte, reconstruit des lignes puis des paragraphes à partir de la position verticale de chaque fragment, et écrit un .docx minimal que JSZip assemble à la volée. Le fichier produit porte le nom du PDF, et la note indique le nombre de paragraphes.
Il faut dire aussi ce que cet outil n’est pas. Ce n’est pas une reconstruction de mise en page : ni les polices, ni les tailles, ni le gras, ni les images, ni les grilles de tableau ne passent dans le document Word. Vous récupérez un texte propre, découpé en paragraphes, à remettre en forme. Les services qui promettent la mise en page complète emploient des moteurs de reconnaissance de structure hébergés sur leurs serveurs ; ici, tout se joue dans l’onglet, à partir de la couche texte.
Mode d’emploi
- Vérifier que le PDF contient du texte Ouvrez-le et tentez de sélectionner un mot. Si la sélection est impossible, le document est un scan et l’extraction ne trouvera rien.
- Déposer le fichier et lire l’encart L’encart d’information rappelle que le texte et les paragraphes sont conservés, mais que les mises en page complexes, colonnes et images comprises, sont simplifiées.
- Lancer « Convertir en Word » L’avancement affiche la page en cours sur le total. Chaque page n’est parcourue qu’une fois, pour en récupérer les fragments de texte et leurs coordonnées.
- Ouvrir le .docx et le remettre en forme Le document arrive au format A4, avec des marges de 2,5 cm et un espacement de huit points après chaque paragraphe. Les styles restent à appliquer.
- En cas d’absence de texte, passer par l’OCR Si moins de cinq caractères sont détectés, l’outil s’arrête et renvoie vers « OCR — PDF scanné », qui reconnaît le texte des pages devenues images.
Comment les paragraphes sont reconstruits
PDF.js ne restitue pas des lignes mais des fragments, chacun accompagné de sa matrice de position. L’outil arrondit la coordonnée verticale de chaque fragment, regroupe dans une même ligne tous ceux qui tiennent dans un écart de quatre unités, puis recolle les morceaux en ramenant les espaces multiples à un seul.
Le découpage en paragraphes obéit ensuite à une règle de ponctuation : une ligne qui se termine par un point, un point d’exclamation, un point d’interrogation, deux-points, un point-virgule ou un guillemet fermant clôt le paragraphe en cours, tout comme une ligne vide. Un titre sans ponctuation finale se retrouve donc collé au paragraphe suivant, et une ligne qui s’achève sur une abréviation coupe trop tôt. Entre deux pages, un saut de page est inséré.
Ce que contient réellement le fichier .docx produit
Un .docx est une archive ZIP de pièces XML. Celle-ci en compte le strict nécessaire : la table des types de contenu, le fichier de relations et le document lui-même. Ni feuille de styles, ni numérotation, ni dossier média. Chaque paragraphe est écrit sans mise en forme, suivi d’un espacement de 160 twips, et la section finale déclare une page de 11 906 sur 16 838 twips, soit un A4, marges de 1 417 twips comprises.
Le paquet respecte la structure attendue d’un .docx et s’ouvre dans les logiciels qui lisent ce format : vos titres redeviendront des titres quand vous leur appliquerez un style, pas avant.
Les documents qui passent mal
Les mises en page sur deux colonnes sont le cas le plus délicat. Les lignes étant reconstituées par hauteur, deux colonnes situées au même niveau se retrouvent bout à bout sur une même ligne : le texte est complet, mais l’ordre de lecture ne l’est plus.
Les tableaux perdent leur grille : les cellules d’une même rangée deviennent une phrase unique. En-têtes, pieds de page et numéros de page sont extraits comme n’importe quel autre texte et réapparaissent au fil du document. Certains générateurs positionnent enfin les caractères un par un sans coder d’espace : le texte extrait présente alors des mots collés.
Quand cet outil n’est pas le bon choix
Si c’est la mise en page qui vous intéresse, ne convertissez pas : demandez le fichier source, ou annotez le PDF. Si le document est un scan, le détour par l’OCR est incontournable. Pour récupérer une illustration, PDF → JPG exporte la page entière en image, qu’il suffit de recadrer.
L’aller-retour n’est pas neutre non plus. L’outil Word → PDF, qui fait le chemin inverse avec mammoth, rend le document dans une image avant de la découper en pages : son texte n’est donc plus sélectionnable. Un document converti puis reconverti ne revient pas à son état de départ.
Questions fréquentes
Pourquoi mes titres ne sont-ils plus des titres ?
Le document généré ne contient aucune feuille de styles et chaque paragraphe est écrit sans mise en forme. Le traitement de texte applique son style par défaut à tout : la hiérarchie est à recréer.
Où sont passées les images du PDF ?
Elles ne sont pas lues, car seule la couche texte est parcourue. Pour les récupérer, exportez les pages concernées avec PDF → JPG, puis insérez-les dans le document Word.
Deux paragraphes ont fusionné, comment l’expliquer ?
La coupure dépend de la ponctuation en fin de ligne. Une ligne qui ne se termine ni par un point, ni par un point-virgule, ni par un guillemet fermant continue le paragraphe en cours.
Le nombre de paragraphes annoncé correspond-il à mon document ?
Il correspond au nombre de blocs formés par l’algorithme, sauts de page exclus, et peut s’écarter du découpage visuel du PDF.
Les accents et caractères spéciaux sont-ils préservés ?
Oui : le texte est repris tel que PDF.js le restitue, les caractères réservés du XML étant échappés avant l’écriture. Un caractère mal codé dans le PDF d’origine restera fautif.
Mon PDF est un scan, peut-on forcer l’extraction ?
Non : en dessous de cinq caractères détectés, l’outil s’arrête. Lancez « OCR — PDF scanné », puis collez le texte reconnu dans un document vierge.
Outils similaires
- Compresser PDF
- Fusionner PDF
- Diviser PDF
- PDF → JPG
- Protéger un PDF
- Signer un PDF
- OCR — PDF scanné
- Pivoter un PDF
Découvrir d’autres outils
- Supprimer le fond — Détourez un sujet sur fond uni, export PNG transparent.
- Générateur Lorem Ipsum — Faux texte par mots, phrases ou paragraphes.
- Audit SEO de page — Titre, meta, Hn, images et liens analysés en quelques secondes.
- Calcul de pourcentages — Variations, remises et proportions sans se tromper.