Convertir un PDF en Markdown : garder la structure, jeter les scories de mise en page
Un PDF décrit où l'encre se dépose sur une page. C'est littéralement tout ce que c'est. Rien dans le fichier ne dit « ceci est un titre » ou « ceci est un tableau » : juste des glyphes à des coordonnées, et un moteur de rendu qui vous donne l'impression que tout est bien rangé. D'où le fait que coller un PDF dans ChatGPT produise si souvent de la bouillie : le modèle reçoit un flux de caractères dont toute la hiérarchie visuelle a disparu.
Convertir un PDF en Markdown, c'est reconstruire cette hiérarchie. Les tailles et les
graisses de police redeviennent des titres # et ##. Les grilles de cellules
alignées redeviennent des tableaux en barres verticales. Les puces redeviennent des éléments de liste.
Vous obtenez un document dans lequel un LLM peut réellement naviguer, au lieu d'un document qu'il doit
deviner. Déposez un fichier dans l'outil ci-dessus et vous l'avez en quelques secondes — gratuit, sans
inscription, rien n'est conservé.
Ce qui survit vraiment à la conversion
Bon à savoir avant de vous lancer, parce que cela détermine ce que vous devez attendre en sortie :
- Les titres — déduits de la taille et de la graisse relatives des polices. Un rapport doté d'une échelle typographique cohérente se convertit à merveille. Un PDF conçu par un graphiste, où chaque section a son propre style, donne un résultat plus brouillon.
- Les tableaux — reconstruits en tableaux Markdown à barres verticales dès lors que la source présente un véritable alignement de lignes et de colonnes. C'est la raison numéro un de préférer le Markdown au texte brut pour les rapports financiers, les fiches techniques et les annexes de données.
- Les listes — puces et numérotations conservent leurs niveaux d'imbrication, donc les modes opératoires et les listes d'exigences restent lisibles.
- L'ordre de lecture — les articles académiques sur deux colonnes sont linéarisés en un seul flux. Généralement correct, parfois entremêlé si la source comporte des encadrés flottants ou des exergues.
- Ce qui ne survit pas — l'habillage de page. Les titres courants, les pieds de page et les numéros de page ne sont que du bruit dans un contexte d'IA : les supprimer est une fonctionnalité, pas une perte.
Markdown ou texte brut ? Une réponse franche
Choisissez le Markdown quand la forme du document porte du sens. Articles de recherche à l'argumentation découpée en sections, contrats à clauses numérotées, rapports annuels bourrés de tableaux, documentation technique avec blocs de code : dans tous ces cas, la structure est de l'information. Un LLM à qui l'on demande « que dit la clause 7.3 » doit savoir que la clause 7.3 forme une unité distincte.
Choisissez PDF vers texte brut quand seule la prose vous intéresse : alimenter un classifieur avec un corpus, faire de l'analyse de mots-clés, ou pousser le résultat dans un outil qui s'étrangle sur les caractères de syntaxe. Les barres verticales et les dièses du Markdown n'y sont que du poids mort.
Le sélecteur en haut de page bascule entre les deux et emporte avec lui le fichier que vous avez déjà choisi — vous pouvez donc convertir une fois dans chaque format et comparer, sans rien réenvoyer.
PDF natif ou scanné : pourquoi votre sortie peut être vide
Deux types de PDF portent la même extension et se comportent de façon radicalement différente.
Un PDF natif — exporté depuis Word, LaTeX, InDesign ou la boîte de dialogue d'impression d'un navigateur — contient du vrai texte embarqué. La conversion est pour ainsi dire sans perte, et rapide. Un PDF scanné est une photographie de papier emballée dans un conteneur PDF. Il n'y a aucun texte à en extraire, seulement des pixels.
Test express : ouvrez le PDF et essayez de sélectionner une phrase à la souris. Si le texte se surligne, c'est un natif et la conversion sera propre. Si vous obtenez à la place un cadre de sélection sur toute la page, c'est un scan. Pour un scan, lancez d'abord une OCR — la plupart des lecteurs PDF proposent une commande « reconnaître le texte » — puis convertissez. Cela prend une minute de plus et la différence de qualité en sortie est sans commune mesure.
Pourquoi s'embêter, au lieu d'envoyer le PDF directement ?
La plupart des assistants conversationnels acceptent désormais les PDF, la question est donc légitime. Trois raisons pour lesquelles convertir d'abord reste gagnant :
- Vous voyez ce que le modèle voit. Quand un PDF envoyé tel quel donne une mauvaise réponse, impossible de savoir si le modèle a mal raisonné ou si l'extraction a massacré la source. Avec le Markdown sous les yeux, l'ambiguïté disparaît.
- Vous pouvez retoucher avant d'envoyer. Supprimez les 40 pages de mentions juridiques, gardez les trois qui comptent. Réponses moins chères, plus rapides et sensiblement plus justes.
- Ça se combine. Du Markdown se glisse directement dans un prompt système, une chaîne RAG, un jeu de fine-tuning ou un dépôt git. Une pièce jointe PDF, non.
Le compteur de tokens sous la sortie est ici l'élément pratique. Un rapport de 60 pages tourne souvent autour de 40 000 tokens : confortable pour un modèle à long contexte, hors budget pour un plus petit. Le savoir avant de coller vaut mieux que de le découvrir dans un message d'erreur.
Là où ça sert vraiment
- Revues de littérature. Convertissez une pile d'articles, concaténez le Markdown et demandez à un modèle de repérer les désaccords méthodologiques entre eux. Les titres de section survivent, vous pouvez donc remonter de n'importe quelle affirmation à sa source.
- Relecture de contrats. Les clauses numérotées le restent, ce qui vous permet d'interroger le modèle sur des obligations précises et d'obtenir des réponses qui citent de vrais numéros de clause plutôt que des paraphrases.
- Documentation d'API et de fournisseurs. Beaucoup de SDK d'entreprise livrent encore leur documentation de référence en PDF. Convertissez-la et associez le résultat à votre dépôt GitHub en texte pour qu'un assistant de code voie à la fois la spécification et votre implémentation.
- États financiers. C'est la reconstruction des tableaux qui rend la chose possible : un modèle peut comparer des chiffres d'un trimestre à l'autre tant que lignes et colonnes sont intactes.
- Notes de cours et manuels. Convertissez le chapitre, demandez un résumé, puis générez des questions d'entraînement à partir de la même source.
Obtenir une sortie plus propre
- Si le PDF a un jumeau en format texte — la version HTML d'un article, le DOCX dont le rapport a été exporté — convertissez plutôt celui-là. Moins d'étapes de déduction, meilleure structure. Essayez Word vers Markdown ou HTML vers Markdown.
- Découpez les PDF énormes avant de convertir. Un manuel de 500 pages se convertit très bien mais ne tiendra dans aucune fenêtre de contexte d'un seul tenant, et vous obtiendrez de meilleures réponses sur le chapitre qui vous intéresse vraiment.
- Les tableaux dessinés comme des images plutôt que composés en texte ne se reconstruiront pas : rien ne peut les lire sans OCR. Vérifiez la sortie si les tableaux comptent pour vous.
- Parcourez les premières centaines de lignes avant de coller. Repérer un niveau de titre cassé prend dix secondes et vous évite une conversation confuse avec un modèle.
Questions fréquentes
Comment convertir un PDF en Markdown en ligne ?
Envoyez le PDF ci-dessus : le Markdown apparaît en dessous, prêt à copier ou à télécharger en .md. Gratuit, sans inscription, 50 Mo par fichier. Les titres reviennent sous forme de niveaux #, les listes sous forme de puces - et les tableaux en barres verticales, si bien que la structure survit jusqu'à l'outil qui lira le résultat ensuite.
La conversion d'un PDF en Markdown conserve-t-elle les tableaux ?
Oui, et c'est la principale raison de préférer le Markdown au texte brut. Un tableau devient un tableau à barres verticales dont les relations entre lignes et colonnes sont préservées : un modèle à qui l'on demande « quel était le chiffre d'affaires du T3 » peut encore dire quel nombre se trouve sous quel intitulé. Aplatissez le même tableau en texte brut et cette correspondance est irrécupérable.
Que deviennent les images contenues dans le PDF ?
Illustrations, graphiques et photographies ne sont pas repris dans le Markdown : la sortie est la couche texte, pas une archive d'actifs. Si le sens d'une page réside dans un schéma, exportez cette page en image et passez-la par image vers Markdown, qui lit les mots affichés à l'intérieur de l'image.
Existe-t-il plutôt une bibliothèque Python pour faire du PDF vers Markdown ?
Plusieurs — pymupdf4llm, marker et docling sont les plus courantes, et ce sont les bonnes réponses pour traiter dix mille fichiers dans une chaîne automatisée. Elles réclament aussi un virtualenv, des poids de modèle et du temps GPU. Pour un seul document à convertir avant votre prochain message à Claude ou ChatGPT, un onglet de navigateur l'emporte.
Pour alimenter un LLM, vaut-il mieux du PDF vers Markdown ou du PDF vers texte ?
Le Markdown, dès lors que le document est structuré. Les modèles sont entraînés sur des quantités colossales de Markdown et en lisent nativement les conventions de titres et de tableaux : « résume la section 4 » fonctionne parce que la section 4 est littéralement balisée. Ne passez au texte brut que si vous voulez vous débarrasser des caractères de syntaxe — pour du découpage destiné aux embeddings, essentiellement.
L'ordre des pages et le fil de lecture sont-ils préservés ?
Les documents sur une seule colonne ressortent dans l'ordre de lecture de façon fiable. Les mises en page académiques sur deux colonnes se linéarisent en général correctement, mais les exergues, les encadrés flottants et les blocs de notes de bas de page atterrissent parfois en plein paragraphe, parce qu'ils se situent au milieu de la page dans les coordonnées de la source. Un coup d'œil à la sortie s'impose avant de vous y fier pour quoi que ce soit de précis.
Le reste de la boîte à outils
Le PDF n'est qu'un des treize formats pris en charge ici. File2Txt les accepte tous si vous préférez ne pas choisir une page précise, ou allez directement à Excel vers Markdown pour les tableurs, PowerPoint vers Markdown pour les présentations, ou EPUB vers Markdown pour les livres numériques.
Plutôt du code ou du web ? Convertissez un dépôt avec le convertisseur GitHub vers texte, un projet GitLab, ou un dossier sur votre machine. Pour les pages web, Web2Txt récupère une URL et la rend en Markdown. Il existe aussi un article plus long sur la préparation des documents pour les LLM si vous voulez la version générale de ce raisonnement.
Repo2Txt est conçu et maintenu par v12hero, un développeur indépendant qui crée des applications natives et web respectueuses de la vie privée.