Converteer PDF gratis online naar Tekst

Converteer PDF bestanden gratis naar Tekst. Upload uw bestand en ontvang direct een schone, LLM-ready uitvoer. Geen aanmelding, 50 MB per bestand, niets opgeslagen.

PDF naar tekst omzetten: voor als juist de opmaak het probleem is

Probeer maar eens diff los te laten op twee PDF's. Dat lukt niet — het is binair, en zelfs "hetzelfde" document dat opnieuw uit dezelfde bron is geëxporteerd verschilt byte voor byte, door tijdstempels en de volgorde van objecten. Haal nu de tekst uit beide en diff die: binnen twee seconden weet je precies welke drie zinnen er zijn veranderd tussen revisie 11 en revisie 14 van het contract.

Dat is in één zin het pleidooi voor PDF naar platte tekst. Het is geen "Markdown, maar dan slechter" — het is een ander gereedschap voor een andere klus. Tekst is wat je aan een classifier voert, wat je indexeert in een zoekmachine, wat je in stukken knipt voor een vectordatabase, wat je door grep haalt, waar je woorden in telt — kortom, alles wat # en | behandelt als tekens om te parsen in plaats van te negeren. Sleep een bestand in de converter hierboven en je hebt het binnen een paar seconden. Gratis, zonder account, limiet van 50 MB, er wordt bij ons niets bewaard.

Wat je wint door de opmaak weg te gooien

Een platte-tekstextractie is de woorden in leesvolgorde, en verder niets. Geen syntaxtekens, geen escape-regels, geen twijfel of een sterretje nadruk betekent of gewoon een sterretje is. Voor verrassend veel pipelines is dat geen compromis, maar precies de eis:

  • Embeddings en semantisch zoeken. Document in chunks knippen, elke chunk embedden, ophalen op gelijkenis. De pipes en hekjes van Markdown dragen niets bij aan de betekenis maar nemen wél posities in de embedding in — pure ruis. Chunks van schone proza scoren beter bij retrieval.
  • Classifiers en topicmodellen. Alles wat bag-of-words, TF-IDF of n-gram-analyse doet, behandelt ### vrolijk als een token tenzij je het er eerst uitstript. Die stap sla je over door het nooit binnen te laten.
  • Full-text-indexering. Elasticsearch, SQLite FTS, de tsvector van Postgres — ze willen allemaal kale tekst in een kolom. Markdown betekent een extra schoonmaakronde.
  • Versies vergelijken. Een regelgebaseerde diff werkt prima op proza en slecht op tabellen, omdat het wijzigen van één cel in een Markdown-tabel de hele rij herschikt en herschrijft.
  • Tokens besparen. Plak je een lang document in een model met een krap contextvenster, dan is elke pipe een token waarvoor je betaalt zonder er iets voor terug te krijgen.

En wat je verliest — goed om vooraf te weten

Platslaan is destructief, en dat is de bedoeling. Twee verliezen wegen zwaarder dan de rest.

Tabellen storten in. Een financiële tabel wordt een rij getallen gescheiden door spaties. Alle waarden staan er nog, maar bij welke kolom elk getal hoorde niet meer — en geen enkele prompt haalt dat terug. Als de tabel juist de kern van het document is, wil je PDF naar Markdown, waar pipe-tabellen rijen en kolommen intact houden.

De hiërarchie verdampt. Een sectiekop en de zin eronder worden twee aangrenzende regels waar niets ze nog van elkaar onderscheidt. Vraag een model om "sectie 4 samen te vatten" en het moet puur uit de formulering raden waar sectie 4 begint. Bij lange, gestructureerde documenten — specificaties, normen, contracten met genummerde clausules — is precies daar waar antwoorden de mist ingaan.

De formaatschakelaar boven aan deze pagina wisselt tussen tekst en Markdown en onthoudt het bestand dat je al had gekozen: beide kanten op converteren om te vergelijken kost je één klik, geen nieuwe upload.

Tekst uit een PDF halen: de eigenaardigheden die je in de uitvoer terugziet

PDF is een paginabeschrijvingstaal. Het slaat glyphs op coördinaten op, en extractie betekent daaruit zinnen reconstrueren. Daar volgen een paar artefacten uit, en wie ze kent bespaart zichzelf een half uur verwarring:

  • Harde regeleinden midden in een zin. Een PDF kent geen alinea die zich opnieuw uitvult — elke zichtbare regel is een los stuk tekst. Eén alinea komt dus binnen als zes korte regels. Dit is dé valkuil voor grep en regexwerk: zoek naar een formulering die toevallig over een regeleinde viel en je krijgt nul treffers voor tekst die er overduidelijk staat.
  • Afbrekingen blijven staan. Een woord dat aan het regeleinde is afgebroken als "beheer-" / "sing" blijft meestal afgebroken. Een zoek-en-vervang loont vóór woordtellingen of trefwoordextractie.
  • Kopteksten en paginanummers schuiven ertussen. De bedrijfsnaam en "Pagina 14 van 88" landen om de paar duizend tekens midden in je proza. Onschuldig om te lezen, licht irritant bij het chunken, en makkelijk weg te strippen met een regex van één regel zodra je het patroon ziet.
  • De kolomvolgorde kan door elkaar lopen. Academische lay-outs met twee kolommen worden meestal netjes gelineariseerd, maar zwevende kaders, uitgelichte citaten en voetnootblokken landen soms midden in een alinea.
  • Ligaturen en vreemde glyphs. In professioneel gezette PDF's zijn "fi" en "fl" vaak één glyph. De meeste komen er prima uit. Een PDF gebouwd met een subset-lettertype zonder fatsoenlijke Unicode-koppeling kan er als schijnbare wartaal uitkomen — zeldzaam, maar dan ligt het aan het bestand, niet aan de converter.

Een gescande PDF bevat geen tekst om te extraheren

Een gescande PDF is een foto van papier in een PDF-jasje. Er valt niets uit te halen behalve pixels, en tekstherkenning kijkt niet binnenin een PDF — een bestand dat alleen uit afbeeldingen bestaat komt leeg terug. (Upload diezelfde pagina als JPG of PNG en hij wordt prima gelezen; zie afbeelding naar tekst. Het is het PDF-jasje dat in de weg zit.) De test duurt twee seconden: open het bestand en probeer met je cursor een zin te selecteren. Licht de tekst op, dan zit je goed. Krijg je een rechthoek over de hele pagina, dan is het een scan.

Draai bij scans eerst OCR — Acrobat, Voorvertoning op macOS en de meeste moderne PDF-lezers hebben een commando "tekst herkennen" — en kom daarna terug om te converteren. Het kwaliteitsverschil in de uitvoer is bepaald niet subtiel.

Concrete klussen waar dit voor dient

  • Een RAG-corpus opbouwen. Honderden beleids-PDF's naar tekst, splitsen op alineagrenzen, embedden. Tekst is het formaat dat elke chunking-bibliotheek standaard verwacht.
  • Contractversies naast elkaar leggen. Extraheer twee versies, draai een diff op woordniveau, en lees de echte wijzigingen in plaats van te vertrouwen op een samenvattende e-mail.
  • Compliance en trefwoordcontroles. Grep een map met geëxtraheerde rapporten op een gedefinieerde term, een leveranciersnaam of een formulering die er niet in thuishoort. Direct, offline, zonder ander gereedschap dan de shell.
  • Leesbaarheids- en stijlanalyse. Verdeling van zinslengtes, jargondichtheid, leesbaarheidsscores — dat alles vraagt om schone proza zonder opmaaktekens in de stroom.
  • Tekst-naar-spraak voeden. Een schermlezer of TTS-engine leest je met alle plezier "hekje hekje Inleiding" voor als je hem Markdown geeft.
  • Snel de tokenprijs checken. De teller onder de uitvoer vertelt je wat een document kost voordat je het ergens plakt — nuttiger dan het te ontdekken via een afkapfout.

Veelgestelde vragen

Hoe kan ik gratis een PDF naar tekst converteren?

Sleep het bestand in de converter boven aan deze pagina en de geëxtraheerde tekst verschijnt eronder. Geen account, geen e-mailadres, geen watermerk op het resultaat. De limiet is 50 MB per bestand en er wordt niets bewaard zodra je je tekst hebt. Kopieer hem direct, of download hem als .txt.

Waarom komt de tekst uit mijn PDF er als wartaal uit?

Bijna altijd het lettertype, niet de converter. Een PDF gebouwd met een subset-lettertype zonder meegeleverde Unicode-koppeling slaat glyph-indexen op zonder aan te geven welke tekens ze voorstellen, dus de extractie geeft die indexen terug als onzinletters. Kun je de tekst in je PDF-lezer bovendien niet selecteren, dan ligt het echt aan het bestand — exporteer het opnieuw vanuit het brondocument.

Kan ik een gescande PDF naar tekst omzetten?

Niet rechtstreeks. Een scan is een foto verpakt in PDF, en er zitten geen tekens in om uit te halen, dus het resultaat komt leeg terug. Twee omwegen: draai eerst "tekst herkennen" in Acrobat of Voorvertoning op macOS en converteer daarna hier — of exporteer de pagina als PNG en gebruik afbeelding naar tekst, dat wél OCR op pixels uitvoert.

Waarom is mijn geëxtraheerde tekst midden in zinnen afgebroken?

PDF kent geen alinea die zich opnieuw uitvult — elke zichtbare regel wordt als een eigen stuk tekst opgeslagen, dus een alinea komt binnen als zes korte regels. Dat bijt het hardst bij grep en regex: een formulering die over een regeleinde viel geeft nul treffers. Plak regels die niet op een zinseinde eindigen aan elkaar voordat je gaat zoeken.

Moet ik mijn PDF naar txt of naar Markdown omzetten?

Tekst als de bestemming kale woorden parseert — embeddings, zoekindexen, classifiers, diffs. Markdown als de vorm van het document betekenis draagt, want pipe-tabellen overleven en koppen blijven gemarkeerd. Tabellen geven de doorslag: sla een financiële tabel plat naar tekst en bij welke kolom elk getal hoorde is voorgoed weg.

Wordt mijn PDF naar een server geüpload?

Het bestand wordt naar de conversieservice gestuurd, verwerkt en weggegooid — het wordt niet opgeslagen, gelogd of geïndexeerd, en er blijft niets achter zodra het antwoord terug is. Heb je conversie nodig waarbij het bestand de machine echt nooit verlaat, dan leest de lokale-mapconverter bestanden rechtstreeks in de browser.

De rest van de gereedschapskist

PDF is één van dertien ondersteunde formaten. File2Txt verwerkt ze allemaal vanuit één upload, of ga direct naar Word naar tekst voor DOCX-bestanden, HTML naar tekst voor opgeslagen webpagina's, EPUB naar tekst voor e-books, of afbeelding naar tekst voor screenshots. Werk je juist met code? Converteer een GitHub-repository naar tekst, een GitLab-project, of een lokale map. Voor live webpagina's haalt Web2Txt rechtstreeks een URL op. De gids voor het voorbereiden van documenten voor LLM's behandelt de algemene versie van dit alles.

Repo2Txt wordt gebouwd en onderhouden door v12hero, een onafhankelijke ontwikkelaar die privacyvriendelijke native en webapps maakt.