Converteer HTML gratis online naar Markdown

Converteer HTML bestanden gratis naar Markdown. Upload uw bestand en ontvang direct een schone, LLM-ready uitvoer. Geen aanmelding, 50 MB per bestand, niets opgeslagen.

HTML naar Markdown: een opgeslagen pagina omzetten in iets dat de moeite waard is om te lezen

Open een willekeurige .html bestand dat u van internet hebt opgeslagen in een teksteditor en het eerste wat u doet het valt op hoe weinig het artikel is. Vijftienhonderd regels navigatiemenu's, cookiebanners, tracking pixels, inline <style> blokken, en <div class="wrapper-outer-container"> zes niveaus diep genesteld – rond misschien veertig paragrafen met daadwerkelijk schrijven. Plak dat in een chat assistent en u verbrandt het grootste deel van uw contextvenster met markeringen die niets voor het model betekenen.

Converteren HTML naar Markdown draait die verhouding om. De tags die betekenis dragen, worden vertaald; de tags die alleen de lay-out bevatten, worden verwijderd. Wat eruit komt is een document met dezelfde vorm als het originele pagina – koppen, lijsten, tabellen, links, codeblokken – in ongeveer een tiende van de tekens. Upload hierboven een bestand en je hebt het binnen een paar seconden. Gratis, geen aanmelding, niets opgeslagen.

Hoe HTML-tags worden toegewezen aan Markdown

Markdown is ontworpen als afkorting voor een subset van HTML, dus het grootste deel van de vertaling komt dicht in de buurt van één-op-één. Als u de mapping kent, weet u precies wat u in de uitvoer kunt verwachten:

  • <h1> door <h6> worden # door ######. De koersdiepte wordt letterlijk behouden, wat belangrijker is dan het klinkt: een model dat wordt gevraagd sectie voor sectie samen te vatten, moet weten welke kopjes broers en zussen zijn.
  • <ul>, <ol> en genest <li> streepje worden en nummerlijsten met inkeping die de nesting draagt.
  • <table> wordt een pijptabel, op voorwaarde dat de tabel een echte gegevenstabel is. Gebruikte tafels puur voor de lay-out – nog steeds gebruikelijk in e-mail-HTML en oudere sites – structureel omzetten in iets geldig maar semantisch nutteloos.
  • <a href> wordt [text](url), zodat de bestemmingen eerder overleven dan waardoor je een verweesde ankertekst achterlaat.
  • <code> en <pre> worden backticks en omheinde blokken. Dit is de De grootste reden waarom ontwikkelaars documentpagina's op deze manier converteren: fragmenten blijven fragmenten.
  • <strong>, <em>, <blockquote> kaart naar hun voor de hand liggende equivalenten.
  • <script>, <style>, <meta>, in lijn style= attributen, klassenamen, data-attributen - allemaal weggegooid. Niets ervan overleeft, en niets daarvan zou moeten.

Een opgeslagen pagina is niet hetzelfde als schone HTML

Er is een echt verschil tussen een HTML-bestand dat iemand heeft geschreven en een HTML-bestand dat een browser heeft gedumpt. en het verschijnt onmiddellijk in de uitvoer.

Met de hand geschreven HTML: een statische site-export, een documentatie-build, een e-mailsjabloon, een rapport gegenereerd door een rapportagetool – heeft de neiging netjes en semantisch te zijn. Koppen zijn koppen. Paragrafen zijn paragrafen. Deze vrijwel perfect omzetten.

Een pagina die is opgeslagen met Ctrl+S vanaf een moderne site is een ander dier. U krijgt de post-JavaScript DOM, compleet met de sticky header, de rail met gerelateerde artikelen, drie nieuwsbriefprompts en een voettekst-sitemap met tachtig schakels. Dat is allemaal legitieme HTML, dus het converteert allemaal. De uitvoer is correct: het is net geworden de pagina meubels erin. Twee gewoonten helpen: gebruik de leesmodus van uw browser en sla daarvan op, of converteer eerst en verwijder de boven- en onderkant van de Markdown voordat u deze gebruikt. Skimmen en trimmen duurt onder a minuut en verbetert merkbaar wat u vervolgens doet.

Wanneer het bestand naar bijna niets wordt geconverteerd

Af en toe converteer je een opgeslagen pagina en krijg je een titel en twee regels terug. Dat is geen mislukking van de converter - het is een app van één pagina.

Sites gebouwd met React, Vue, Angular en vrienden leveren vaak een HTML-shell die echt leeg is: een <div id="root"></div> en een scripttag. De inhoud die u in de browser zag, was samengesteld door JavaScript tijdens runtime en heeft nooit in het bestand bestaan. Afhankelijk van hoe je het hebt opgeslagen, kan dat wel hebben de schaal vastgelegd in plaats van het weergegeven resultaat. Open het bestand in een teksteditor en zoek naar a zin die u zich herinnert te hebben gelezen - als deze er niet is, kan de converter deze niet verzinnen.

De oplossing is om in plaats daarvan de weergegeven DOM op te slaan (klik in Chrome DevTools met de rechtermuisknop op het <html> node en kopieer de buitenste HTML naar een nieuw bestand), of om het bestand volledig over te slaan en te gebruiken Web2Txt, waarvoor een live URL nodig is, wordt geladen de pagina correct en retourneert Markdown. Dat onderscheid is de moeite waard om vast te houden: deze pagina converteert een HTML-bestand dat u al heeft, terwijl Web2Txt een pagina ophaalt die jij niet haalt.

Het relatieve linkprobleem

Deze vangt mensen op. Een pagina die linkt naar /docs/getting-started of ../api/reference.html vertrouwt erop dat de browser weet uit welk domein en welke map het komt van. Zodra het bestand zich van de server verwijdert, is die context verdwenen. De geconverteerde Markdown zal dat trouw doen bevatten [Getting Started](/docs/getting-started) – een link die nu nergens heen wijst bijzonder.

Voor LLM werk maakt dit meestal niet uit, omdat het je om het proza en de linktekst gaat, niet om de vraag of de URL's worden opgelost. Maar als u documentatie aan het samenstellen bent die u wilt publiceren, of een kennisbank waar kruisverwijzingen moeten werken, controleer de uitvoer en herschrijf de paden of verwijder de links. Afbeelding src attributen hebben hetzelfde probleem, en daarom komen de afbeeldingen van een offline pagina vaak door als gebroken referenties.

Markdown of platte tekst voor een HTML-bestand?

Kies Markdown als de structuur van de pagina deel uitmaakt van wat u wilt. Documentatie met codevoorbeelden en een hiërarchie van kopjes. Een tutorial met genummerde stappen. Een vergelijkingsartikel gebouwd rond een tafel. Een e-mail nieuwsbrief met secties. In al deze gevallen is de # en de leidingen en de omheinde blokken zijn dat wel met echte informatie, en een HTML naar Markdown converter voor LLM werkstromen doet precies wat je wilt.

Kies HTML naar platte tekst wanneer jij wil alleen de woorden: een corpus bouwen, een classificator voeden, indexeren voor zoeken of een pijplijn uitvoeren waar syntaxistekens ruis zijn. Bovenaan deze pagina bevindt zich een indelingsschakelaar waarmee u tussen de indelingen kunt wisselen de twee en draagt uw geselecteerde bestand over, zodat dezelfde pagina in beide richtingen wordt geconverteerd en de kosten worden vergeleken jij één upload.

Wat mensen hier eigenlijk mee doen

  • Documenten doorgeven aan een codeerassistent. Bewaar de pagina's van de documentatie van een bibliotheek, converteer ze naar Markdown en plak ze naast je GitHub opslagplaats als tekst. Het model ziet zowel het API-oppervlak als uw gebruik ervan, en de codeblokken blijven aan beide kanten intact.
  • Een site migreren. Statische sitegeneratoren eten Markdown. Oudere HTML-pagina's converteren is vaak de snelste eerste stap van een CMS-migratie, ook als je daarna nog even opruimt.
  • Artikelen archiveren voor latere analyse. Markdown bestanden zijn klein, diffuus en grijpbaar op een manier die een map met opgeslagen HTML nooit is.
  • E-mailsjablonen omzetten in leesbare inhoud. Marketing-HTML is tafelsoep; de Markdown versie is het daadwerkelijke bericht.
  • Promptbibliotheken bouwen. Referentiemateriaal in Markdown komt rechtstreeks in een systeem terecht prompt of een RAG-index zonder verdere verwerking.

De tokenteller onder de uitvoer is hier het praktische deel. Een documentatiepagina die er kort uitzag de browser kan verrassend zwaar zijn als er eenmaal tabellen en codeblokken zijn opgenomen en het aantal bekend is voordat je beats plakt om een afbreekfout te achterhalen.

Veelgestelde vragen

Hoe converteer ik een HTML-bestand naar Markdown?

Upload de .html of .htm bestand hierboven en het komt terug als Markdown, te downloaden als .md. Gratis, 50 MB per bestand, geen account. Koppen toewijzen aan # niveaus, lijsten blijven genest, links behouden hun URL's [text](url) vorm en codeblokken blijven omheind.

Houdt het de links en hun URL's bij?

Ja, dat is de belangrijkste reden om voor Markdown te kiezen platte tekst hier. Elk anker converteert naar [label](href), zodat de bestemmingen overleven. Als u documentatie archiveert of auditeert waar een pagina naar verwijst, is dat het verschil tussen een nuttig document en een parafrase.

Kan ik een live URL converteren in plaats van een opgeslagen bestand?

Niet van deze pagina. Web2Txt neemt een URL, haalt de pagina op en retourneert Markdown in één stap. Deze pagina is voor HTML die u al op schijf heeft staan: opgeslagen artikelen, geëxporteerde nieuwsbrieven, gegenereerde rapporten of uitvoer van een lokale build.

Is dit een redelijke manier om een site naar een statische generator te migreren?

Voor de inhoud wel. Proza, koppen, lijsten, tabellen en codeblokken worden netjes genoeg geconverteerd om vast te leggen en te bewerken. Wat het niet zal doen, is uw informatiearchitectuur opnieuw opbouwen, interne links naar nieuwe paden herschrijven of voorgrond eruit halen; dat zijn de onderdelen van een migratie die handmatig blijven, ongeacht welke converter u gebruikt.

Wat gebeurt er met tabellen en codeblokken?

Tabellen worden pipe-tabellen en afgeschermde codeblokken blijven afgeschermd, die beide meestal goed overleven omdat de bron-HTML ze expliciet markeerde. Het algemene slachtoffer is de syntaxisaccentuering, uitgedrukt via per token <span> klassen — de code is correct, maar de taalhint die de kleuring aanstuurde, kan vaak niet worden hersteld, dus voeg deze handmatig terug als het ertoe doet.

Andere formaten en hulpmiddelen

HTML is een van de formaten File2Txt handvatten - upload alles en het werkt wat te doen. Als je weet wat je hebt, ga dan direct naar PDF naar Markdown, Woord naar Markdown, JSON naar Markdown, of XML naar Markdown. Voor tabellarisch export, CSV naar Markdown bouwt pipe-tabellen uit gescheiden gegevens.

Voor code is er de GitHub naar tekstconverter, een GitLab versie, en een lokale mapconverter dat uploadt nooit wat dan ook. Er staat ook een langer stuk op het voorbereiden van documenten voor LLM's als u het algemene argument wilt in plaats van het HTML-specifieke argument.

Repo2Txt is gebouwd en onderhouden door v12hero, een onafhankelijke ontwikkelaar die native- en web-apps bouwt die privacy voorop stellen.