Word naar Markdown: een echte omzetting, geen gokwerk
Hernoem eender welke .docx bestand naar .zip en open het. Binnenin vind je een mappenboom:
word/document.xml houdt de inhoud vast, word/styles.xml definieert de stijlen,
word/media/ bevat elke ingebedde afbeelding, en footnotes.xml en
comments.xml naast hen zitten. Een .docx is geen afbeelding van een pagina. Het is een gestructureerde XML
document in een zip-container.
Dat is enorm belangrijk voor de conversiekwaliteit. Een PDF omzetten in Markdown betekent: afleiden
structuur van lettergroottes en coördinaten. Word veranderen in Markdown betekent lezen structuur
dat is al aangegeven. Een alinea getagd w:pStyle="Heading2" wordt ##
omdat het bestand letterlijk zegt dat het een kop van niveau twee is. Dit is de reden waarom een docx naar Markdown
omvormer produceert over het algemeen schonere uitvoer dan hetzelfde document dat naar PDF wordt geëxporteerd
vandaar omgezet. Upload hierboven een bestand en zie het: gratis, geen aanmelding, limiet van 50 MB, niets opgeslagen.
Stijlen versus directe opmaak: het enige dat uw uitvoer bepaalt
Er zijn twee manieren om tekst op een kop in Word te laten lijken, en deze zijn niet gelijkwaardig.
Een stijl toepassen — klikken op "Kop 1" in het lint — schrijft een semantisch label in
de XML. De converter leest dat label en zendt uit #. Directe opmaak —
de regel selecteren, naar 16pt brengen, vetgedrukt maken - schrijft alleen visuele eigenschappen. Er is geen
"dit is een kop" ergens in het bestand, want wat Word betreft is het een normale alinea
dat is groot en gewaagd. Het wordt omgezet in een dikke regel hoofdtekst en uw document arriveert
Markdown als één vlakke wand zonder secties.
Als uw uitvoer er structureel leeg uitziet, is dit bijna altijd de reden en bevindt de oplossing zich in de broncode documenteren. Open het deelvenster Stijlen, pas echte kopstijlen toe op uw sectietitels, sla op en converteer opnieuw. Vijf minuten werk dat het resultaat transformeert – en het Word-document sindsdien ook beter maakt het navigatievenster en de automatisch gegenereerde inhoudsopgave beginnen te werken.
Bijgehouden wijzigingen, opmerkingen en voetnoten
De meeste echte Word-documenten zijn door meerdere mensen geraadpleegd en zij bevatten het bewijsmateriaal. Dit is wat gebeurt er met elke laag:
- Bijgehouden wijzigingen leven in de XML als
w:insenw:delloopt rond de betreffende tekst gewikkeld. Conversie zorgt ervoor dat het document terugkeert naar de geaccepteerde staat: invoegingen blijven behouden, verwijderingen worden verwijderd. Als de revisiegeschiedenis van een juridisch team voor u van belang is, dan is dat het geval de geschiedenis is verdwenen - converteer voor en na afzonderlijk en verdeel in plaats daarvan de twee uitgangen. - Opmerkingen bevinden zich in een apart deel van het archief en zijn verankerd aan reeksen in de lichaam. Ze zijn geen hoofdtekst en verschijnen dus niet in de geconverteerde uitvoer. Handig als het marginaal is gebabbel is lawaai, een probleem als de recensie commentaar geeft zijn wat je wilde samenvatten.
- Voetnoten en eindnoten wonen ook in hun eigen deel. Over het algemeen komen ze door als tekst maar los van hun exacte ankerpunt, aangezien Markdown geen eigen voetnootsyntaxis heeft in de basisspecificatie. Controleer de staart van de uitvoer als citaten ertoe doen.
- Kop-, voet- en paginanummers zijn gevallen. Markdown heeft geen pagina's en is actief Meubilair is sowieso lawaai in een AI-context.
- Velden — automatische nummering, kruisverwijzingen, een gegenereerde inhoudsopgave — converteren naar wat hun laatst weergegeven waarde ook was, niet naar levende referenties.
De veilige gewoonte: Controleren → Alle wijzigingen accepteren, vervolgens Opslaan als kopie en vervolgens converteren. Je weet precies wat tekst waarmee u werkt.
Tabellen, afbeeldingen en waar Markdown geen ruimte meer heeft
Woordtabellen zijn echte rasters: rijen en cellen gedeclareerd in XML, geen tekstkolommen die toevallig op één lijn staan visueel op. Ze worden dus netjes toegewezen aan Markdown pipe-tabellen, wat het sterkste argument is voor kies Markdown boven platte tekst als uw document überhaupt enige tabelinhoud bevat.
De uitzondering vormen samengevoegde cellen. Markdown tabellen hebben geen rowspan of colspan, dus een headercel die drie kolommen moeten op de een of andere manier worden afgevlakt, en complexe geneste tabellen komen eerder bij benadering uit dan exact. Eenvoudige rasters converteren perfect; Lay-outs in factuurstijl met samengevoegde bannerrijen behoeven een blik voordat je ze vertrouwt.
Ingesloten afbeeldingen zijn een moeilijkere limiet. De pixels zijn binnen word/media/, maar tekstconversie
produceert tekst – een afbeeldingsreferentie, niet de afbeelding, en zeker niet de woorden erin. Als uw
Het belangrijkste diagram van het document is een screenshot van een tabel, waarbij de inhoud onzichtbaar is voor conversie. Exporteer de
afbeelding apart en voer deze door afbeelding naar Markdown,
of beter, bouw het opnieuw op als een echte Word-tabel voordat u het converteert.
.doc en .docx hebben niet hetzelfde formaat
Ze delen drie letters en bijna niets anders. .docx arriveerde met Office 2007 en is
Open XML — de hierboven beschreven zip-of-XML, openlijk gespecificeerd en eenvoudig te parseren. De erfenis
.doc is een binair samengesteld bestand: een miniatuurbestandssysteem van streams, waarvoor reverse-engineering is uitgevoerd
decennia, met structuren die variëren afhankelijk van de Word-versie waarin ze zijn geschreven.
Praktisch resultaat: .docx-conversie is betrouwbaar, .doc-conversie is de beste inspanning. Als je raar wordt het resultaat is van een oud bestand, open het in Word of LibreOffice, sla het op als .docx en converteer dat in plaats daarvan. Het kost dertig seconden en verwijdert een hele categorie problemen. Hetzelfde geldt voor RTF-bestanden, die ouder zijn nog steeds en hebben nog minder semantische structuur.
Markdown of platte tekst? Kies op basis van wat u vervolgens gaat doen
Kies Markdown wanneer de vorm van het document betekenis draagt. Een vereistenspecificatie met geneste genummerde clausules, een beleid met een gedefinieerde sectiehiërarchie, een voorstel vol prijzen tabellen, technische documentatie met codevoorbeelden – in elk daarvan is structuur informatie. Vraag een model naar "de resultaten in sectie 3" en sectie 3 moet als eenheid bestaan.
Kies Van woord naar platte tekst wanneer je wilt de woorden en niets anders - een classificator voeden, insluitingen bouwen, indexeren voor zoeken, of twee revisies regel voor regel van elkaar verschillen. De syntaxis van Markdown is een dood gewicht in deze pijplijnen.
De schakelaar bovenaan deze pagina schakelt tussen de twee en draagt het geselecteerde bestand over, zodat jij kan beide produceren en vergelijken zonder tweemaal te uploaden. De tokenteller onder de uitvoer vertelt u wat het resultaat wordt weergegeven in het contextvenster van een model voordat u het ergens plakt.
Veelgestelde vragen
Hoe converteer ik een DOCX naar Markdown?
Upload het bovenstaande bestand en kopieer de Markdown uit, of download het als .md. Werkt met .docx en ouder .doc, 50 MB per bestand, gratis en geen account nodig. Kopstijlen worden toegewezen aan # niveaus, vet en cursief blijven bestaan als ** en *, en lijsten behouden hun nesting.
Komen mijn kopjes daadwerkelijk door?
Alleen als het echte koppen zijn. Een document waarin de auteur de stijlen Kop 1 en Kop 2 heeft gebruikt, wordt omgezet in een opschoning # en ## overzicht. In een document waarin iemand de tekst met de hand groot en vet heeft gemaakt, is helemaal geen kopinformatie opgeslagen - visueel identiek in Word, en het wordt omgezet in gewone alinea's, omdat er niets te lezen is.
Is dit goed genoeg om Word-documenten naar een documentensite te verplaatsen?
Het levert je het meeste op. Proza, koppen, lijsten en eenvoudige tabellen worden netjes genoeg geconverteerd om vastgelegd te worden. Wat achteraf een menselijke pass nodig heeft: ingebedde afbeeldingen, complexe tabellen met samengevoegde cellen, vergelijkingen en elke aangepaste stijl die betekenis droeg door conventie in plaats van door structuur.
Hoe zit het met vergelijkingen en ingebedde afbeeldingen?
Vergelijkingen overleven niet omdat LaTeX of MathML en afbeeldingen niet in een map met middelen worden geëxtraheerd: de uitvoer bestaat uit tekst en structuur. Voor documenten waarbij de wiskunde de inhoud is, kunt u ervan uitgaan dat u deze blokken opnieuw moet schrijven. Het is de moeite waard om dit te weten voordat u honderd bestanden converteert en deze in bestand negentig ontdekt.
Word naar Markdown of Word naar tekst?
Markdown als het document een overzicht heeft dat de moeite waard is om te behouden, of als het ergens heen gaat waar Markdown wordt weergegeven: een repository, een wiki, een LLM prompt. Platte tekst als de bestemming woorden parseert in plaats van opmaak, wat de meeste pijplijnen voor zoekindexering en insluiting omvat.
De rest van de gereedschapskist
Word is een van de dertien formaten die hier worden behandeld. File2Txt accepteert ze allemaal vanuit één upload, of spring er meteen naar PDF naar Markdown, PowerPoint naar Markdown voor dekken, of Excel naar Markdown voor spreadsheets. Als u een map met gemengde documenten heeft, kunt u deze zippen en gebruiken ZIP naar Markdown omzetten alles binnen in één keer.
Voor code en webinhoud is er de GitHub naar tekstconverter, een GitLab equivalent, een lokale mapconverter, en Web2Txt om pagina's in te schrapen Markdown. De gids voor het voorbereiden van documenten voor LLM's gaat dieper in op waarom dit allemaal de moeite waard is.
Repo2Txt is gebouwd en onderhouden door v12hero, een onafhankelijke ontwikkelaar die native- en web-apps bouwt die privacy voorop stellen.