HTML do Markdown: Zamiana zapisanej strony w coś wartego przeczytania
Otwórz dowolny .html plik zapisany z Internetu w edytorze tekstu i pierwszą rzeczą, którą zrobisz
zauważ, jak mało jest tego artykułu. Piętnaścieset linii menu nawigacyjnych, banery cookie, śledzenie
piksele, wbudowane <style> bloki i <div class="wrapper-outer-container">
zagnieżdżony na głębokości sześciu poziomów – owinięty wokół może czterdziestu akapitów faktycznego tekstu. Wklej to do czatu
Assistant, a większość okna kontekstowego zostanie spalona na znacznikach, co nie ma żadnego znaczenia dla modelu.
Konwersja HTML do Markdown odwraca tę proporcję. Tagi niosące znaczenie zostają przetłumaczone; tagi, które przenoszą tylko układ, zostaną usunięte. Wychodzi dokument o tym samym kształcie co plik strona oryginalna — nagłówki, listy, tabele, łącza, bloki kodu — w mniej więcej jednej dziesiątej znaków. Prześlij plik powyżej, a będziesz go mieć za kilka sekund. Bezpłatnie, bez rejestracji, nic nie jest przechowywane.
Jak znaczniki HTML są mapowane na Markdown
Markdown został zaprojektowany jako skrót dla podzbioru HTML, więc większość tłumaczenia jest bliska jeden do jednego. Znajomość mapowania mówi dokładnie, czego się spodziewać na wyjściu:
<h1>przez<h6>stać się#przez######. Głębokość kursu zostaje zachowana dosłownie, co ma większe znaczenie niż się wydaje — model poproszony o podsumowanie sekcja po sekcji musi wiedzieć, które nagłówki są rodzeństwem.<ul>,<ol>i zagnieżdżone<li>stać się kreską i listy numeracyjne z wcięciem niosącym zagnieżdżenie.<table>staje się tabelą potoków, pod warunkiem, że jest to rzeczywista tabela danych. Wykorzystane tabele wyłącznie dla układu — nadal powszechne w formacie HTML poczty e-mail i starszych witrynach — przekształcają się w coś strukturalnego ważne, ale semantycznie bezużyteczne.<a href>staje się[text](url), więc miejsca docelowe raczej przetrwają niż pozostawiając Cię z osieroconym tekstem zakotwiczenia.<code>i<pre>stają się kleszczami i ogrodzonymi blokami. To jest najważniejszy powód, dla którego programiści konwertują strony dokumentów w ten sposób — fragmenty pozostają fragmentami.<strong>,<em>,<blockquote>mapa do nich oczywiste odpowiedniki.<script>,<style>,<meta>, wbudowanystyle=atrybuty, nazwy klas, atrybuty danych – wszystkie odrzucone. Nic z tego nie przetrwa, i nic z tego nie powinno.
Zapisana strona to nie to samo, co czysty kod HTML
Istnieje zasadnicza różnica pomiędzy plikiem HTML napisanym przez człowieka a plikiem HTML zrzuconym przez przeglądarkę. i pojawia się natychmiast na wyjściu.
Ręcznie stworzony kod HTML — eksport statycznej witryny, kompilacja dokumentacji, szablon wiadomości e-mail, raport wygenerowany przez narzędzie do raportowania — zwykle jest uporządkowane i semantyczne. Nagłówki to nagłówki. Akapity to akapity. Te konwertować niemal idealnie.
Strona zapisana za pomocą Ctrl+S z nowoczesnej witryny to inne zwierzę. Otrzymujesz kompletny DOM post-JavaScript z przyklejonym nagłówkiem, szyną z powiązanymi artykułami, trzema monitami o biuletyn i mapą witryny w stopce osiemdziesiąt linków. Wszystko to jest legalnym kodem HTML, więc wszystko się konwertuje. Dane wyjściowe są prawidłowe — po prostu zostały otrzymane znajdujące się w nim meble strony. Pomagają dwa nawyki: korzystaj z trybu czytnika przeglądarki i zapisuj lub konwertuj najpierw i usuń górę i dół Markdown przed jego użyciem. Odtłuszczanie i przycinanie odbywa się w ramach a minutę i zauważalnie poprawia wszystko, co zrobisz dalej.
Kiedy plik konwertuje się na prawie nic
Czasami przekonwertujesz zapisaną stronę i odzyskasz tytuł i dwie linijki. To nie jest porażka konwerter — to aplikacja jednostronicowa.
Witryny zbudowane przy użyciu React, Vue, Angular i znajomych często zawierają powłokę HTML, która jest naprawdę pusta:
a <div id="root"></div> i znacznik skryptu. Treść, którą zobaczyłeś w przeglądarce to
zmontowane przez JavaScript w czasie wykonywania i nigdy nie istniały w pliku. W zależności od tego, jak go zapisałeś, możesz
przechwyciły powłokę, a nie wyrenderowany wynik. Otwórz plik w edytorze tekstu i wyszukaj plik
zdanie, które pamiętasz, że czytałeś — jeśli go nie ma, konwerter nie może go wymyślić.
Rozwiązaniem jest zapisanie wyrenderowanego modelu DOM (w Chrome DevTools kliknij prawym przyciskiem myszy plik <html>
node i skopiuj zewnętrzny kod HTML do nowego pliku) lub całkowicie pomiń plik i użyj
Web2Txt, który pobiera aktywny adres URL, ładuje się
stronę poprawnie i zwraca Markdown. Warto trzymać się tego rozróżnienia: ta strona konwertuje pliki
plik HTML, który już masz, podczas gdy Web2Txt pobiera stronę, której ty nie masz.
Problem łącza względnego
Ten przyciąga ludzi. Strona, do której prowadzi link /docs/getting-started lub
../api/reference.html polega na tym, że przeglądarka wie, z jakiej domeny i katalogu pochodzi
od. Gdy plik zostanie usunięty z serwera, kontekst zniknie. Nawrócony Markdown będzie wiernie
zawierać [Getting Started](/docs/getting-started) — link, który teraz prowadzi donikąd
szczególne.
W przypadku pracy LLM zwykle nie ma to znaczenia, ponieważ zależy Ci na prozie i tekście linku, a nie na tym, czy
adresy URL zostaną rozwiązane. Ale jeśli tworzysz dokumentację, którą zamierzasz opublikować, lub bazę wiedzy, w której
odsyłacze muszą działać, sprawdź dane wyjściowe i albo przepisz ścieżki, albo usuń łącza. Obraz
src atrybuty mają ten sam problem i dlatego często pojawiają się obrazy strony offline
jako uszkodzone odniesienia.
Markdown lub zwykły tekst w pliku HTML?
Wybierz Markdown, jeśli struktura strony jest częścią tego, czego chcesz. Dokumentacja z przykładami kodu i a
hierarchia nagłówków. Samouczek z numerowanymi krokami. Artykuł porównawczy zbudowany wokół tabeli. E-mail
biuletyn z sekcjami. We wszystkich z nich # i rury i ogrodzone bloki są
niosących prawdziwe informacje, oraz Konwerter HTML na Markdown dla LLM przepływy pracy robi
dokładnie to, czego chcesz.
Wybierz HTML na zwykły tekst kiedy ty chcę tylko słów — budowanie korpusu, dostarczanie klasyfikatora, indeksowanie w celu wyszukiwania lub uruchamianie dowolnego potoku gdzie znaki składniowe są szumem. Na górze tej strony znajduje się przełącznik formatu, który umożliwia przełączanie między formatami oba i przenosi wybrany plik w drugą stronę, więc konwertuje tę samą stronę w obie strony i porównuje koszty przesyłasz jeden.
Co ludzie właściwie z tym robią
- Przekazywanie dokumentów asystentowi kodowania. Zapisz strony dokumentacji biblioteki, przekonwertuj je na Markdown i wklej je obok pliku GitHub repozytorium jako tekst. Modelka widzi zarówno powierzchnia API, jak i sposób jej wykorzystania, a bloki kodu pozostają nienaruszone po obu stronach.
- Migracja witryny. Generatory witryn statycznych jedzą Markdown. Konwersja starszych stron HTML to często najszybszy pierwszy przebieg migracji CMS, nawet jeśli później wszystko posprzątasz.
- Archiwizowanie artykułów do późniejszej analizy. Pliki Markdown są małe, można je różnicować i greppable w sposób, w jaki nigdy nie jest to folder z zapisanym kodem HTML.
- Przekształcanie szablonów e-maili w czytelną treść. Marketingowy HTML to zupa stołowa; the Wersja Markdown to właściwy komunikat.
- Tworzenie bibliotek podpowiedzi. Materiał referencyjny w Markdown wpada bezpośrednio do systemu monit lub indeks RAG bez dalszego przetwarzania.
Licznik żetonów pod wynikami jest tutaj praktycznym elementem. Strona dokumentacji, która wyglądała na krótką przeglądarka może być zaskakująco ciężka, jeśli uwzględni się tabele i bloki kodu oraz zna liczbę zanim wkleisz beaty, dowiesz się o błędzie obcięcia.
Często zadawane pytania
Jak przekonwertować plik HTML na Markdown?
Prześlij plik .html lub .htm plik powyżej i wraca jako Markdown, do pobrania jako .md. Bezpłatnie, 50 MB na plik, bez konta. Nagłówki mapują do # poziomach, listy pozostają zagnieżdżone, linki zachowują swoje adresy URL [text](url) formie, a bloki kodu pozostają ogrodzone.
Czy przechowuje linki i ich adresy URL?
Tak — to jest główny powód, dla którego warto wybrać Markdown zwykły tekst tutaj. Każda kotwica konwertuje do [label](href), aby miejsca docelowe przetrwały. Jeśli archiwizujesz dokumentację lub sprawdzasz, gdzie wskazuje strona, na tym polega różnica między użytecznym zapisem a parafrazą.
Czy mogę przekonwertować aktywny adres URL zamiast zapisanego pliku?
Nie z tej strony. Web2Txt pobiera adres URL, pobiera stronę i zwraca Markdown w jednym kroku. Ta strona jest przeznaczona dla kodu HTML, który już masz na dysku — zapisanych artykułów, wyeksportowanych biuletynów, wygenerowanych raportów lub danych wyjściowych z lokalnej kompilacji.
Czy to rozsądny sposób na migrację witryny do generatora statycznego?
Jeśli chodzi o treść, tak. Proza, nagłówki, listy, tabele i bloki kodu są konwertowane na tyle czysto, że można je zatwierdzać i edytować. To, czego nie zrobi, to odbudowa architektury informacji, przepisanie wewnętrznych linków do nowych ścieżek lub wyodrębnienie treści frontowych — to elementy migracji, które pozostają ręczne, niezależnie od używanego konwertera.
Co dzieje się z tabelami i blokami kodu?
Tabele stają się tabelami potokowymi, a chronione bloki kodu pozostają odgrodzone, przy czym oba te elementy zwykle dobrze przetrwają, ponieważ źródłowy kod HTML wyraźnie je oznaczył. Częstą ofiarą jest podświetlanie składni wyrażone za pomocą poszczególnych tokenów <span> klasy — kod jest poprawny, ale podpowiedzi językowej odpowiedzialnej za kolorowanie często nie da się odzyskać, więc jeśli ma to znaczenie, dodaj ją ponownie ręcznie.
Inne formaty i narzędzia
HTML jest jednym z formatów File2Txt uchwyty — prześlij wszystko i ustalimy, co robić. Jeśli wiesz, co masz, przejdź od razu do PDF do Markdown, Słowo do Markdown, JSON do Markdownlub XML do Markdown. Dla tabelarycznych eksport, CSV do Markdown buduje tabele rur z rozdzielonych danych.
W przypadku kodu jest to GitHub na konwerter tekstu, a Wersja GitLab, oraz konwerter folderów lokalnych które nigdy się nie przesyła cokolwiek. Jest też dłuższy kawałek przygotowywanie dokumentów do LLM jeśli chcesz argumentu ogólnego, a nie specyficznego dla HTML.
Repo2Txt jest zbudowany i utrzymywany przez v12hero, niezależny programista tworzący aplikacje natywne i internetowe dbające o prywatność.