Converteer HTML gratis online naar Tekst

Converteer HTML bestanden gratis naar Tekst. Upload uw bestand en ontvang direct een schone, LLM-ready uitvoer. Geen aanmelding, 50 MB per bestand, niets opgeslagen.

HTML naar tekst: haal alleen de woorden uit een webpaginabestand

Soms wil je geen document. Je wilt een muur van zinnen. Trainingsgegevens voor een classificator, een corpus voor onderwerpmodellering, chunks voor een inbeddingsindex, invoer voor een samenvatter die de opmaak negeert hoe dan ook - in al deze, elke # en | en ** is een personage dat kost je iets en koopt je niets.

Daar is deze pagina voor. Kom binnen een .html of .htm bestand en je krijgt de leesbaar proza zonder de opmaak - geen tags, geen attributen, geen syntaxis. Gratis, geen aanmelding, limiet van 50 MB, en het bestand wordt daarna nergens opgeslagen. Als u in plaats daarvan de kophiërarchie en tabellen wilt behouden, HTML naar Markdown is de broer of zus pagina, en de formaatschakelaar hierboven draagt uw bestand ernaartoe zonder opnieuw te uploaden.

Wat 'strippen van tags' eigenlijk goed moet doen

Het naïef verwijderen van alles tussen punthaken levert rommel op, en het is de moeite waard om te begrijpen waarom: het is het verschil tussen bruikbare tekst en een puinhoop.

HTML heeft blokelementen en inline-elementen, en deze hebben een tegenovergestelde behandeling nodig. Wanneer een </p> sluit en de volgende <p> wordt geopend, dat is een alineagrens en moet een regeleinde worden. Wanneer een </strong> sluit midden in een zin, dat is geen a helemaal geen grens — als je daar een nieuwe regel invoegt, wordt de zin in tweeën gedeeld. Begrijp dit verkeerd en je eindigt met tekst waar the quick brown fox komt binnen als vier afzonderlijke regels omdat iemand het vetgedrukt heeft gemaakt twee van de woorden.

De andere helft van het werk is witruimte. HTML vouwt reeksen spaties, tabbladen en nieuwe regels samen tot één wanneer het wordt weergegeven, dus een bron die mooi is afgedrukt met inspringingen bevat enorme hoeveelheden witruimte dat was nooit de bedoeling om zichtbaar te zijn. Een behoorlijke HTML naar tekst conversie stort het op dezelfde manier in manier waarop de browser dat doet, en daarom leest de uitvoer hoe de pagina eruitzag in plaats van hoe het bestand eruitzag. Lijstitems krijgen hun eigen regels, <br> wordt een onderbreking en de tabelcellen worden gescheiden in plaats van samen te klonteren.

Entiteiten, slimme citaten en mysterieuze karakters

HTML codeert bepaalde tekens zodat ze niet in botsing komen met de opmaak. &amp; is een ampersand. &lt; is een minder dan teken. &nbsp; is een niet-brekende ruimte, &#8217; is een gekrulde apostrof, &mdash; is een em-streepje. In de browser kun je zie nooit de codes – je ziet de karakters.

In geëxtraheerde tekst zijn niet-gedecodeerde entiteiten vergif. Een tokeniser-traktatie &#8217; als meerdere tokens van ruis, het matchen van trefwoorden mislukt don&#8217;ten elke stroomafwaartse tekenreeks vergelijking breekt stilletjes. Entiteiten worden dus gedecodeerd als ze naar buiten gaan. Niet-brekende ruimtes zijn de stiekeme ruimtes vooral omdat ze er identiek uitzien als normale ruimtes op het scherm, terwijl ze niet allemaal werken split(" ") jij schrijft; ze komen hier door als echte ruimtes.

Codering is ook een kijkje waard. De meeste moderne bestanden declareren <meta charset="utf-8">, maar oudere pagina's en CMS-exports zijn soms vermomd in Latin-1 of Windows-1252. Als uw uitvoer ’ waar een apostrof zou moeten staan, loog het bronbestand over de codering ervan - sla het opnieuw op als UTF-8 vanuit een teksteditor en opnieuw converteren.

Tekst die nooit bedoeld was om gelezen te worden

Een pagina bevat meer woorden dan je kunt zien, en sommige daarvan verschijnen tijdens de extractie:

  • Navigatie en voettekst. Menulabels, kruimelsporen, "terug naar boven", de sitemap met tachtig links onderaan. Legitieme tekst, semantisch waardeloos. Op een opgeslagen nieuwsartikel dit kan zwaarder wegen dan het artikel zelf.
  • Cookiebanners en toestemmingskopie. Er verschijnen tweehonderd juridische standaardwoorden op elke pagina die u opslaat vanuit dat domein, wat betekent dat als u een corpus aan het bouwen bent, u dat ook gaat doen dupliceer ze duizend keer.
  • Alt-tekst en ARIA-labels. Soms waardevol (de alt-tekst van een diagram kan de enige zijn). beschrijving van de gegevens), soms slechts een "afbeelding" die veertig keer wordt herhaald.
  • Verborgen elementen. Alleen schermlezers, ingeklapte accordeonpanelen en <noscript> fallbacks bevatten allemaal echte tekst in de bron, ook al heb je ze nog nooit gezien ze weergegeven.

Beste praktijk als de bron ertoe doet: sla de pagina op vanuit de leesmodus van uw browser, die de meeste van de pagina's verwijdert het meubilair voordat het ooit in de vijl terechtkomt. Anders converteert en trimt u de kop en de staart van de uitgang. Als je eenmaal weet hoe je ernaar moet zoeken, is repetitieve standaardplaat gemakkelijk te herkennen, en het afsnijden ervan is het hoogste waardeminuut die u aan de hele pijplijn besteedt.

Waarom gewone tekst beter is dan Markdown voor NLP-werk

Dit is niet alleen "Markdown maar eenvoudiger" - voor veel pijplijnen is platte tekst de juiste keuze en Markdown is actief erger.

  • Inbedding. Een inbeddingsmodel codeert alles wat u eraan geeft, inclusief de syntaxis. Pijp karakters en kop-hashes verschuiven vectoren zonder betekenis toe te voegen, en ze vreten de modellen op invoerlimiet. Schoon proza ​​wordt schoner ingebed.
  • Classificatoren en onderwerpmodellen. Bag-of-words en TF-IDF-benaderingen zijn een traktatie **word** en word als verschillende tokens, tenzij u vooraf opschoont. Sla de over probleem geheel.
  • Zoekindexering. De meeste indexpijplijnen willen zinnen. Ze voeden Markdown betekent een stripstap schrijven die je niet nodig had.
  • Segmentatie van zinnen. Splitters zoals spaCy of NLTK werken aan proza. Tabelsyntaxis verwart ze tot fragmenten.
  • Tokenbudget. Op een lange pagina vermindert het weglaten van de markup het aantal tokens aanzienlijk — de teller onder de uitvoer laat u precies zien hoeveel, en vergelijkt de twee formaten op dezelfde manier bestand is een experiment met één klik.

Een bestand dat u heeft versus een pagina die u niet heeft

Deze tool converteert een HTML-bestand dat u uploadt. Er wordt geen URL opgehaald. Dat onderscheid is belangrijker dan het lijkt, omdat de twee situaties op verschillende manieren mislukken.

Als uw bestand afkomstig is van de functie Opslaan als van een browser op een site die veel JavaScript gebruikt, kan het bijna geen tekst bevatten: alleen een lege container-div en een bundelscript, waarbij de daadwerkelijke inhoud tijdens runtime is gegenereerd en nooit naar schijf geschreven. Het resultaat is bijna leeg en het lijkt alsof de converter kapot is. Het niet; de woorden staan ​​niet in het bestand. Zoek in de bron naar een zin die je moet bevestigen.

Als dat gebeurt, gebruik dan Web2Txt in plaats daarvan — er is een live URL voor nodig, de pagina wordt weergegeven en uit het resultaat gehaald. Gebruik deze pagina als u dat al heeft gedaan het bestand: een e-mailexport, een documentatieopbouw, een CMS-dump, een rapport gegenereerd als HTML, een gearchiveerd pagina van jaren geleden.

Typische banen

  • Het opbouwen van een trainings- of evaluatiecorpus vanuit een map met gearchiveerde pagina's, waar u willen rauw proza en consistente opmaak voor duizenden documenten.
  • Leesbaarheid en inhoudsaudits — aantal woorden, leesniveau, frequentie van trefwoorden. Allemaal deze hebben de tekst nodig zonder dat de opmaak de cijfers vertekent.
  • In scripts doorsijpelen. Er komt gewone tekst in grep, wc, een diff, of een Python-oneliner zonder enig ontsnappend drama.
  • Een lange pagina samenvattend waar je niets om structuur geeft en liever geld uitgeeft de tokens op inhoud.
  • Tekst uit een HTML-bestand extraheren voor vertaal- of transcriptiewerkzaamheden, waarbij de vertaler wil zinnen en niets anders.

Veelgestelde vragen

Hoe converteer ik een HTML-bestand naar tekst?

Laat de vallen .html of .htm bestand hierboven en de leesbare tekst komt terug met alle tags, scripts en stijlblokken verwijderd. Gratis, geen aanmelding, 50 MB per bestand. Download het als .txt of kopieer het rechtstreeks naar wat dan ook de woorden nodig heeft in plaats van de opmaak.

Kan ik een live webpagina converteren door een URL te plakken?

Niet op deze pagina. Deze gebruikt een bestand dat je al hebt. Voor een URL, Web2Txt haalt de pagina op en extraheert deze direct, waardoor het opslaan en vervolgens uploaden wordt opgeslagen. Gebruik deze pagina voor pagina's die u eerder hebt opgeslagen, geëxporteerde e-mailteksten of HTML die door iets lokaals is gegenereerd.

Verwijdert het navigatie, advertenties en cookiebanners?

Boilerplate is eerder een bekend gevaar dan een opgelost probleem. Scripts, stijlen en tags gaan altijd; of een zijbalk of een cookiemelding als inhoud telt, is een oordeel, en een opgeslagen pagina bevat alles in dezelfde DOM. Bekijk de boven- en onderkant van de uitvoer; daar verzamelt zich het navigatieafval.

Wat gebeurt er met links op de pagina?

De ankertekst overleeft als woorden en de URL's erachter niet. Een zin met de tekst "zie de installatiehandleiding" wordt precies dat omgezet, zonder enige indicatie waar deze naar verwijst. Als de bestemmingen er toe doen – een linkkaart maken, uitgaande referenties controleren – gebruik dan HTML naar Markdown, waardoor hrefs tussen haakjes staan.

Waarom staat mijn uitvoer vol met lege regels en losse tekens?

Meestal wordt een pagina opgeslagen met de volledige DOM intact: verborgen sjabloonblokken, JSON-LD-payloads, inline SVG en analysefragmenten bevinden zich allemaal in die opmaak en bevatten allemaal een soort tekst. Een regex van één regel wist het herhalende patroon zodra u het hebt opgemerkt, of slaat de pagina opnieuw op met behulp van de browserlezerweergave en converteert die in plaats daarvan.

De rest van de suite

File2Txt behandelt elke ondersteunde formaat vanuit één uploadvak als u liever niet kiest. Of ga direct: PDF naar tekst voor documenten, Van woord naar tekst voor DOCX, EPUB naar tekst voor e-boeken, en CSV naar sms voor afgebakende gegevens.

Werken met code? De GitHub naar tekstconverter, de GitLab converter en de lokale mapconverter een geheel plat maken projecteren in één bestand. En deze gids behandelt de bredere kwestie van het klaarmaken van documenten voor een LLM.

Repo2Txt is gebouwd en onderhouden door v12hero, een onafhankelijke ontwikkelaar die native- en web-apps bouwt die privacy voorop stellen.