PDF naar Markdown omzetten: behoud de structuur, dump de lay-outrommel
Een PDF is een beschrijving van waar inkt op een pagina terechtkomt. Meer is het echt niet. Er zit geen "dit is een kop" of "dit is een tabel" in het bestand gebakken — alleen glyphs op coördinaten, en een renderengine die het er voor jou georganiseerd uit laat zien. Daarom levert een PDF copy-pasten in ChatGPT zo vaak pap op: het model krijgt een stroom tekens binnen waar alle visuele hiërarchie uit is gesloopt.
PDF naar Markdown converteren draait om het herbouwen van die hiërarchie. Lettergroottes
en -gewichten worden #- en ##-koppen. Uitgelijnde celrasters worden
pipe-tabellen. Opsommingstekens worden lijstitems. Je krijgt een document waar een LLM echt doorheen kan
navigeren in plaats van eentje waar hij naar moet gissen. Sleep een bestand in de tool hierboven en je
hebt het binnen een paar seconden — gratis, zonder account, er wordt niets opgeslagen.
Wat de conversie echt overleeft
Goed om te weten vóór je converteert, want het bepaalt wat je aan de andere kant mag verwachten:
- Koppen — afgeleid uit relatieve lettergrootte en -gewicht. Een rapport met een consistente typografische schaal converteert prachtig. Een designer-PDF waarin elke sectie anders is opgemaakt wordt rommeliger.
- Tabellen — gereconstrueerd tot Markdown-pipe-tabellen wanneer de bron echte rij- en kolomuitlijning heeft. Dit is dé reden om Markdown boven platte tekst te kiezen voor financiële rapporten, specificatiebladen en databijlagen.
- Lijsten — opsommingen en genummerde items behouden hun nesting, dus procedures en eisenlijsten blijven leesbaar.
- Leesvolgorde — academische papers met twee kolommen worden gelineariseerd tot één doorlopende stroom. Meestal correct, af en toe door elkaar als de bron zwevende kaders of uitgelichte citaten heeft.
- Wat het niet overleeft — paginameubilair. Doorlopende kopteksten, voetteksten en paginanummers zijn ruis in een AI-context, en die wegstrippen is een feature, geen verlies.
Markdown of platte tekst? Een eerlijk antwoord
Kies Markdown als de vorm van het document betekenis draagt. Onderzoekspapers met opgedeelde argumentatie, contracten met genummerde clausules, jaarverslagen vol tabellen, technische documentatie met codeblokken — in al die gevallen is structuur informatie. Een LLM die je vraagt "wat zegt clausule 7.3" moet weten dat clausule 7.3 een afgebakende eenheid is.
Kies PDF naar platte tekst als je alleen de proza wilt — een corpus voeren aan een classifier, trefwoordanalyse draaien, of doorsluizen naar iets dat stikt in syntaxtekens. De pipes en hekjes van Markdown zijn daar pure overhead.
De schakelaar boven aan deze pagina wisselt tussen de twee, en neemt het bestand dat je al had gekozen mee — zo converteer je één keer per kant en vergelijk je zonder opnieuw te uploaden.
Digitale PDF's versus scans: waarom je uitvoer leeg kan lijken
Er bestaan twee soorten PDF met dezelfde bestandsextensie, en ze gedragen zich totaal verschillend.
Een digitale PDF — geëxporteerd uit Word, LaTeX, InDesign of het afdrukvenster van een browser — bevat echte ingebedde tekst. Conversie is in wezen verliesvrij, en snel. Een gescande PDF is een foto van papier in een PDF-verpakking. Er zit geen tekst in om te extraheren, alleen pixels.
Snelle test: open de PDF en probeer met je cursor een zin te selecteren. Licht de tekst op, dan is hij digitaal en krijg je een schone conversie. Krijg je in plaats daarvan een selectiekader over de hele pagina, dan is het een scan. Draai bij scans eerst OCR — de meeste PDF-lezers hebben "tekst herkennen" ingebouwd — en converteer daarna. Het kost een minuut extra en het verschil in uitvoerkwaliteit is dag en nacht.
Waarom die moeite, in plaats van gewoon de PDF uploaden?
De meeste chatassistenten accepteren tegenwoordig PDF-uploads, dus dat is een terechte vraag. Drie redenen waarom eerst converteren nog steeds wint:
- Je ziet wat het model ziet. Geeft een PDF-upload een slecht antwoord, dan weet je niet of het model slecht redeneerde of de extractie de bron verhaspelde. Met Markdown voor je neus verdwijnt die onzekerheid.
- Je kunt redigeren voordat je verstuurt. Gooi de 40 pagina's juridische standaardtekst weg, houd de drie die ertoe doen. Goedkoper, sneller, en merkbaar nauwkeurigere antwoorden.
- Het laat zich combineren. Markdown-tekst valt zo in een systeemprompt, een RAG-pipeline, een finetuningset of een git-repo. Een PDF-bijlage niet.
De tokenteller onder de uitvoer is hier het praktische deel. Een rapport van 60 pagina's landt al snel rond de 40.000 tokens — prima voor een model met lange context, over budget voor een kleiner model. Het weten vóór je plakt verslaat het ontdekken via een foutmelding.
Waar mensen dit echt voor gebruiken
- Literatuuronderzoek. Converteer een stapel papers, plak de Markdown achter elkaar en vraag een model om methodologische tegenstrijdigheden ertussen te vinden. Sectiekoppen overleven, dus je kunt elke bewering terugvoeren naar waar ze vandaan kwam.
- Contractcontrole. Genummerde clausules blijven genummerd, dus je kunt naar specifieke verplichtingen vragen en antwoorden krijgen die echte clausulenummers citeren in plaats van parafrases.
- API- en leveranciersdocumentatie. Genoeg enterprise-SDK's leveren hun referentiedocs nog altijd als PDF. Converteer ze en combineer het resultaat met je GitHub-repository als tekst, zodat een codeerassistent de specificatie en jouw implementatie tegelijk ziet.
- Jaarrekeningen. Tabelreconstructie is wat dit laat werken — een model kan cijfers over kwartalen heen vergelijken wanneer de rijen en kolommen intact zijn.
- Collegedictaten en studieboeken. Converteer het hoofdstuk, vraag om een samenvatting en genereer daarna oefenvragen uit dezelfde bron.
Schonere uitvoer krijgen
- Heeft de PDF een tekstgebaseerde tweelingbroer — de HTML-versie van een paper, de DOCX waar het rapport uit is geëxporteerd — converteer die dan. Minder gokstappen, betere structuur. Probeer Word naar Markdown of HTML naar Markdown.
- Splits enorme PDF's vóór het converteren. Een handleiding van 500 pagina's converteert prima maar past in geen enkel contextvenster in één stuk, en je krijgt betere antwoorden over het hoofdstuk waar het je echt om gaat.
- Tabellen die als afbeelding zijn getekend in plaats van als tekst opgemaakt worden niet gereconstrueerd — niets kan ze lezen zonder OCR. Controleer de uitvoer als tabellen voor jou belangrijk zijn.
- Scan de eerste paar honderd regels even vóór je plakt. Een verkeerd kopniveau spotten kost tien seconden en bespaart je een verwarrend gesprek met een model.
Veelgestelde vragen
Hoe kan ik online een PDF naar Markdown converteren?
Upload de PDF hierboven en de Markdown verschijnt eronder, klaar om te kopiëren of te downloaden als .md. Gratis, zonder account, 50 MB per bestand. Koppen komen terug als #-niveaus, lijsten als --opsommingen en tabellen als pipe-tabellen, zodat de structuur overleeft in wat het hierna ook leest.
Blijven de tabellen behouden bij PDF naar Markdown?
Ja, en dat is de belangrijkste reden om Markdown boven platte tekst te kiezen. Een tabel wordt een pipe-tabel met de rij- en kolomrelaties intact, zodat een model dat je vraagt "wat was de omzet in Q3" nog kan zien welk getal onder welke kop staat. Sla dezelfde tabel plat naar tekst en die koppeling is onherstelbaar weg.
Wat gebeurt er met afbeeldingen in de PDF?
Illustraties, grafieken en foto's gaan niet mee de Markdown in — de uitvoer is de tekstlaag, geen assetbundel. Zit de betekenis van een pagina in een diagram, converteer die pagina dan apart als afbeelding via afbeelding naar Markdown, dat de woorden leest die in het plaatje zijn gerenderd.
Is er ook een Python-bibliotheek die PDF naar Markdown doet?
Meerdere — pymupdf4llm, marker en docling zijn de gangbare, en voor een batch van tienduizend bestanden in een pipeline zijn zij het juiste antwoord. Ze willen ook een virtualenv, modelgewichten en GPU-tijd. Voor dat ene document dat je geconverteerd wilt hebben vóór je volgende bericht aan Claude of ChatGPT wint een browsertabblad.
Wat is beter om een LLM te voeren: PDF naar Markdown of PDF naar tekst?
Markdown, wanneer het document gestructureerd is. Modellen zijn getraind op enorme hoeveelheden Markdown en lezen de kop- en tabelconventies moeiteloos, dus "vat sectie 4 samen" werkt omdat sectie 4 letterlijk gemarkeerd is. Grijp alleen naar platte tekst als de syntaxtekens weg moeten — vooral bij chunken voor embeddings.
Blijven paginavolgorde en leesrichting bewaard?
Documenten met één kolom komen betrouwbaar in leesvolgorde door. Academische lay-outs met twee kolommen lineariseren meestal correct, maar uitgelichte citaten, zwevende kaders en voetnootblokken landen af en toe midden in een alinea, omdat ze in de broncoördinaten midden op de pagina staan. Even doorbladeren van de uitvoer loont voordat je erop bouwt voor iets precies.
De rest van de gereedschapskist
PDF is één van de dertien formaten die hier worden verwerkt. File2Txt accepteert ze allemaal als je liever geen specifieke pagina kiest, of ga direct naar Excel naar Markdown voor spreadsheets, PowerPoint naar Markdown voor presentaties, of EPUB naar Markdown voor e-books.
Werk je juist met code of het web? Converteer een repo met de GitHub-naar-tekst-converter, een GitLab-project, of een map op je eigen machine. Voor webpagina's schraapt Web2Txt een URL naar Markdown. Er is ook een langer stuk over documenten voorbereiden voor LLM's als je de algemene versie van dit betoog wilt.
Repo2Txt wordt gebouwd en onderhouden door v12hero, een onafhankelijke ontwikkelaar die privacyvriendelijke native en webapps maakt.