Word naar tekst omzetten: een document terugbrengen tot zijn woorden
Copy-pasten uit Word is hoe opmaak binnengesmokkeld wordt op plekken waar die niets te zoeken heeft. Plak in een CMS en je sleept fontdeclaraties en losse spans mee. Plak in een codecommentaar en de aanhalingstekens worden krul en de string matcht niet meer. Plak in een terminal en de kastlijntjes komen binnen als tekens waar je script niet op rekende. Het document zag er prima uit. De bytes waren nooit plat.
Word naar platte tekst converteren snijdt dat bij de bron af. Wat eruit komt is de proza in leesvolgorde — geen stijlen, geen kleuren, geen revisiefranje, geen onzichtbare lay-outsteigers. Het is wat je wilt wanneer je tekst uit een Word-document wilt halen voor analyse, zoeken, of alles wat opmaaktekens als te parsen data behandelt. Gratis, zonder account, limiet van 50 MB, er wordt bij ons niets bewaard.
Wat er precies wordt weggestript
Een .docx draagt veel meer mee dan de woorden. Dit belandt op de snijvloer:
- Alle visuele opmaak — vet, cursief, lettertypes, groottes, markeerkleuren, die ene alinea die iemand in Comic Sans liet staan. De nadruk is weg, en er staat geen markering waar hij zat.
- De koppenhiërarchie — een Kop 1 en de zin eronder worden twee gewone aangrenzende regels. Niets onderscheidt ze nog.
- Tabellen vallen samen tot regels tekst. De celwaarden overleven; bij welke kolom elke waarde hoorde niet. Dit is de grootste reden om naar Word naar Markdown te grijpen als je document vol tabellen staat.
- Ingesloten afbeeldingen verdwijnen volledig. Het zijn pixels in
word/media/binnen het archief, en deze converter draait geen OCR — tekst in een geplakte screenshot verschijnt dus nooit in de uitvoer. Doet die inhoud ertoe, haal de afbeelding er dan uit en gebruik er apart afbeelding naar tekst op. - Kopteksten, voetteksten, paginanummers, watermerken — weg. Tekst heeft geen pagina's.
- Opmerkingen — opgeslagen in een eigen deel van het bestand, niet in de bodytekst, dus die komen niet mee.
De onzichtbare tekens die Word achterlaat
Platte tekst betekent geen opmaak. Het betekent niet ASCII, en de autocorrectie van Word heeft jarenlang stilletjes de tekens die je typte vervangen door typografisch mooiere. Die overleven de conversie, want ze horen echt bij de tekst:
- Gekrulde aanhalingstekens — rechte
"en'worden krul: U+201C / U+201D en U+2018 / U+2019. Dit is de klassieke reden waarom een regex, een CSV-import of een gekopieerd codefragment geluidloos faalt. - Kastlijntjes en halve kastlijntjes — een getypt dubbel koppelteken wordt een em dash. Prima in proza, verrassend in een identifier of een commando.
- Harde spaties (U+00A0) — ze zien er precies uit als spaties en matchen in sommige
oudere regexsmaken niet met
\s, of met' 'in een naïeve split. - Zachte afbreekstreepjes en optionele regeleinden — tekens zonder breedte midden in woorden, onzichtbaar tot een stringvergelijking zonder aanwijsbare reden faalt.
- Beletselteken — drie getypte punten klappen samen tot het ene teken U+2026.
Niets hiervan is een conversiebug; het is getrouwe uitvoer. Maar is je pipeline kieskeurig, draai dan na het converteren een Unicode-normalisatieronde. Weten dat je erop moet letten is het halve werk.
Bijgehouden wijzigingen: accepteer ze vóór je converteert
Word slaat revisies inline op — ingevoegde tekst verpakt in w:ins, verwijderde tekst bewaard
in w:del zodat hij hersteld kan worden. Conversie lost het document op naar zijn
geaccepteerde staat: invoegingen blijven, verwijderingen verdwijnen. Dat is bijna altijd wat je wilt,
maar "bijna altijd" draagt in die zin flink wat gewicht — zeker bij een zwaar geredigeerd juridisch
concept waarvan je misschien niet weet in welke staat het verkeerde.
Doe het expliciet. Controleren → Alle wijzigingen accepteren op een kopie, opslaan, converteren. Nu is de tekst die je krijgt ondubbelzinnig de tekst waar je naar keek. Wil je juist weten wat er tussen twee concepten veranderde, dan is de betere zet om elke versie naar tekst te converteren en een diff te draaien — platte tekst difft prachtig, en precies daarvoor bestaat dit formaat.
Wanneer tekst het juiste antwoord is en Markdown niet
Markdown wint wanneer structuur betekenis draagt. Tekst wint zodra opmaak ruis zou zijn in wat het vervolgens verwerkt:
- Classifiers en tekstanalyse. TF-IDF, topicmodellering, sentimentscores,
trefwoordextractie — in de kern allemaal bag-of-words, en allemaal tokeniseren ze
**alsof het vocabulaire is, tenzij je het er eerst uitstript. - Embeddings. Chunken, embedden, ophalen. Syntaxtekens voegen posities aan de embedding toe zonder betekenis toe te voegen. Chunks van proza scoren nauwkeuriger bij retrieval dan opgemaakte.
- Zoekindexen. Postgres full-text, SQLite FTS, Elasticsearch — stuk voor stuk willen ze een kolom kale tekst. Markdown betekent alleen maar een schoonmaakstap vóór het invoegen.
- Diffen en versiebeheer. Diffs op regelniveau lezen prettig bij proza. Markdown-tabellen zijn het tegenovergestelde: wijzig één cel en de hele rij wordt herschreven, dus de diff vertelt je niets nuttigs.
- Doorsluizen naar scripts.
wc,grep,awk, een snelle Python-oneliner — tekst is voor dat alles het universele uitwisselingsformaat. - Minimale tokens. Op een krap contextbudget is elke pipe en elk hekje uitgave zonder opbrengst. De tokenteller onder de uitvoer laat het verschil meteen zien.
De formaatschakelaar boven aan deze pagina wisselt tussen tekst en Markdown en neemt je gekozen bestand mee, dus beide produceren en vergelijken kost één klik in plaats van een tweede upload. Dezelfde logica geldt elders in de suite — PDF naar platte tekst en HTML naar tekst bestaan om dezelfde redenen.
.doc, .docx en schone resultaten krijgen
Het oude .doc-formaat is een binair samengesteld bestand van vóór 2007 — een klein intern
bestandssysteem van streams waarvan de indeling per Word-versie verschoof. .docx is Open
XML: een zip-archief met netjes gespecificeerde XML. Extractie uit .docx is betrouwbaar; extractie uit
.doc is best-effort. Geeft een oud bestand rare uitvoer, open het dan in Word of LibreOffice, sla het op
als .docx en converteer dat. Hetzelfde advies geldt voor
RTF-documenten.
Nog twee gewoontes die lonen. Blader de eerste honderd regels van de uitvoer even door voordat je hem gebruikt — een slecht platgeslagen tabel spotten kost tien seconden en bespaart later een verwarrend gesprek met een model. En is de bron enorm, splits hem dan: een handleiding van 400 pagina's converteert prima maar past in geen contextvenster, en je krijgt scherpere antwoorden over het hoofdstuk waar het je echt om gaat.
Veelgestelde vragen
Hoe kan ik een Word-document naar een tekstbestand converteren?
Sleep de .docx of .doc hierboven en de tekst verschijnt eronder, te downloaden als .txt. Gratis, zonder account, 50 MB per bestand. Beide formaten werken — het moderne gezipte XML-formaat en het oudere binaire dat Word vóór 2007 gebruikte.
Kan ik meerdere DOCX-bestanden in één keer naar TXT omzetten?
Niet hier — deze pagina neemt één bestand tegelijk. Voor een map vol zet je de documenten in een directory en gebruik je de lokale-mapconverter, die een hele boom doorloopt en je in één ronde de gewenste bestanden laat aanvinken. Op de commandline is Pandoc in een shell-loop het standaardantwoord.
Wat gebeurt er met bijgehouden wijzigingen en opmerkingen?
Je krijgt het document zoals het nu leest, met de revisiemarkeringen opgelost in plaats van gereproduceerd. Opmerkingen in de kantlijn horen niet bij de bodytekst en komen niet mee. Is het doel juist te zien wat er tussen twee concepten veranderde, converteer dan beide versies naar tekst en draai een diff op woordniveau — dat toont de wijzigingen veel leesbaarder dan de zijbalk.
Gaan kopteksten, voetteksten en voetnoten mee?
De inhoud van voetnoten komt doorgaans mee, en dat wil je ook bij een document met bronvermeldingen. Herhalende kop- en voetteksten zijn paginameubilair in plaats van inhoud, dus die horen zich niet tussen de tekst te wringen zoals bij PDF-extractie — een van de echte voordelen van converteren vanuit DOCX in plaats van vanuit een geëxporteerde PDF van hetzelfde document.
Moet ik Word naar tekst of Word naar Markdown gebruiken?
Tekst als je de woorden wilt en verder niets — woordtellingen, trefwoordcontroles, embedding-chunks, een tekst-naar-spraak-engine voeden. Word naar Markdown als het document met echte kopstijlen is geschreven en je die opbouw in de uitvoer wilt laten overleven.
De rest van de gereedschapskist
Word is één van de dertien formaten hier. File2Txt accepteert ze allemaal vanuit één upload, of ga direct naar PowerPoint naar tekst voor presentaties, Excel naar tekst voor spreadsheets, of MSG naar tekst voor Outlook-e-mails. Een hele map met concepten? Zip hem en draai ZIP naar tekst om alles erin in één keer te converteren.
Voor code is er de GitHub-naar-tekst-converter, een GitLab-versie, en een lokale-directoryconverter. Voor webpagina's trekt Web2Txt een URL naar tekst. Er is ook een langere gids voor het voorbereiden van documenten voor LLM's als je het algemene betoog wilt in plaats van het Word-specifieke.
Repo2Txt wordt gebouwd en onderhouden door v12hero, een onafhankelijke ontwikkelaar die privacyvriendelijke native en webapps maakt.