Bild in Markdown umwandeln: wenn die Form des Aufgenommenen zählt
Manche Bilder sind einfach Bilder. Andere sind Dokumente, die zufällig in einem Bild festsitzen – eine Rechnung, die jemand abfotografiert und gemailt hat, eine Folie aus einem Foliensatz, den Sie nie bekommen werden, ein von Hand ausgefülltes Formular, die Seite eines Buchs auf Ihrem Schreibtisch, ein Whiteboard voller Entscheidungen, die sonst nirgends festgehalten wurden. Bei solchen Bildern geht es um die Wörter, und ebenso um deren Anordnung.
Laden Sie so eines hier hoch, dann wird die Schrift erkannt und Ihnen als Markdown zurückgegeben. Echte optische Zeichenerkennung, direkt auf den Pixeln. Eine abfotografierte Rechnung kommt mit Rechnungsnummer, Firma, Datum, jeder Position samt Betrag und der Endsumme zurück – dem tatsächlichen Inhalt also, nicht einer Beschreibung davon. JPG, JPEG, PNG, GIF, BMP, TIFF, TIF und WebP laufen alle. Kostenlos, ohne Anmeldung, 50 MB pro Datei, nach der Konvertierung bleibt nichts liegen.
Text aus Screenshot extrahieren: was genau zurückkommt
Die Ausgabe ist der erkannte Text und sonst nichts. Keine Kameradaten, keine Dateieigenschaften, kein technisches Vorwort, an dem Sie erst vorbeiscrollen müssen, bis der nützliche Teil beginnt. Sie laden das Foto eines Dokuments hoch, Sie bekommen die Wörter des Dokuments. Wer einen Kopfblock über das Bild selbst erwartet hat, ist hier falsch – gelesen wird, was im Bild steht.
Die Erkennungsqualität hängt an der Qualität der Vorlage, um es ehrlich zu formulieren. Ein scharfer Screenshot oder ein sauberer Export wird sehr gut gelesen. Das hastige Foto eines Laptop-Bildschirms aus schrägem Winkel, mit einem Fenster darin gespiegelt, ist der schwierigere Fall, und dort sehen Sie gelegentlich ein falsches Zeichen. Handschrift, Schreib- und Zierschriften sowie Schrift auf unruhigem Hintergrund sind ehrlich schwer. Nichts davon macht das Werkzeug bei einem schlechten Bild nutzlos – es heißt nur, dass Sie die Ausgabe lesen und nicht einfach glauben sollten.
Markdown oder reiner Text? Der tatsächliche Unterschied
Hier etwas, das die meisten Konverter-Seiten verschweigen. Bei einem einfachen Bild – dem Screenshot eines Absatzes, dem Foto einer handschriftlichen Notiz, einem Schild – liefern Markdown und reiner Text praktisch dasselbe Ergebnis. Erkannter Text kommt zeilenweise, und in einem Block Fließtext gibt es keine Struktur, die Markdown abbilden könnte und die reinem Text verloren ginge. Wenn Sie bei einem einfachen Bild das „falsche“ Format erwischen, haben Sie schlicht gar nichts verloren.
Wichtig wird die Entscheidung, sobald das Abgebildete eine Form hat. Eine Tabelle, ein Formular mit Bezeichnern und Werten, ein Kassenbon mit Positions- und Preisspalten, eine Dokumentseite mit Überschriften und Abschnitten. Genau dort spielt Markdown seine Stärke aus, denn Pipes und Rauten tragen ein Raster oder eine Hierarchie, die eine flache Ausgabe nur über Abstände andeuten kann. Wenn Sie einen Screenshot in eine Markdown-Tabelle umwandeln wollen, sind Sie auf dieser Seite richtig. Brauchen Sie bloß die Wörter für ein Suchfeld, ist Bild zu Text die Schwesterseite und das einfachere Werkzeug für die einfachere Aufgabe.
Der Umschalter am Seitenanfang springt zwischen beiden Formaten hin und her und nimmt die bereits gewählte Datei mit, sodass Sie dasselbe Bild in beide Richtungen laufen lassen und sich selbst überzeugen können.
Worauf sich das Draufhalten lohnt
- Rechnungen und Belege. Der Klassiker. Ein Lieferant schickt eine abfotografierte Rechnung statt einer Datei, und Sie brauchen die Positionen irgendwo, wo man sie zusammenzählen kann. Konvertieren, die Summen gegen das Bild prüfen, in eine Tabelle einfügen oder das Markdown einem Modell hinlegen und um eine Aufstellung bitten.
- Formulare und Anträge. Gedruckte Formulare mit ausgefüllten Feldern werden zu Bezeichner-Wert-Paaren, mit denen sich tatsächlich arbeiten lässt. Getippte Einträge werden weit besser erkannt als handschriftliche – gut zu wissen, bevor Sie zweihundert Stück einscannen.
- Folien, die Sie nur als Bild haben. Das Konferenzfoto einer Folie oder der Screenshot aus einem aufgezeichneten Vortrag. Liegt der Foliensatz im Original vor, nehmen Sie PowerPoint zu Markdown – die Quelle ist immer vorzuziehen. Wenn nicht, holen Sie den Inhalt so heraus.
- Buch- und Zeitschriftenseiten. Das Foto einer Seite, die Sie zitieren, zusammenfassen oder auseinandernehmen wollen. Überschriften und Absatzgrenzen überstehen den Weg so, dass am Ende etwas Lesbares steht und keine Wand aus Text.
- Whiteboards und Flipcharts. Frontal, bei brauchbarem Licht und mit leserlicher Schrift bekommen Sie ein verwertbares Protokoll der Besprechung. Krakelige Markerschrift aus schrägem Winkel ergibt ein lückenhaftes. Immer noch schneller, als selbst abzutippen.
- Dashboards und Berichte als Screenshot. Zahlen in einem Raster werden zu einer Tabelle, die Sie gegen den Vormonat halten können. Existieren die zugrunde liegenden Daten als Datei, schlagen Excel zu Markdown oder CSV zu Markdown jeden OCR-Durchgang, weil dort nichts geraten werden muss.
Die Behälter-Regel, und warum sie Ihnen einen vergeblichen Upload spart
Diesen Teil sollten Sie verinnerlichen, denn er erklärt drei Überraschungen auf einmal. Die Texterkennung läuft hier auf der Bilddatei, die Sie hochladen. Sie läuft nicht auf Bildern, die in einer anderen Datei eingewickelt sind. Reist das Bild als Passagier in einem größeren Behälter mit, wird der Behälter gelesen und das Bild übersprungen.
- Gescannte PDFs kommen leer zurück. Ein PDF, das in Wahrheit die Fotografie von Papier ist, enthält keinen Text, und die Schrifterkennung greift nicht durch die PDF-Hülle hindurch. Lassen Sie zuerst „Text erkennen“ darüberlaufen – Acrobat, die Vorschau unter macOS und die meisten modernen PDF-Reader haben das –, was daraus ein durchsuchbares PDF macht, und nehmen Sie dann PDF zu Markdown oder PDF zu Text. Ein Umweg von einer Minute, und der korrekte Weg für gescannte Dokumente.
- Bilder in einem ZIP werden nicht erkannt. Die Archivkonvertierung listet den Dateinamen und geht weiter. ZIP zu Markdown ist hervorragend für einen Ordner voller Dokumente und Tabellen; bei Fotos von Dokumenten entpacken Sie diese und laden jedes Bild einzeln hoch.
- Bilder in Word, PowerPoint, RTF, EPUB oder E-Mails werden ebenfalls nicht erkannt. Sie landen als Bildplatzhalter in der Ausgabe, nicht als Text. Eine aus Screenshots gebaute DOCX-Datei wird mit Word zu Markdown also zum umgebenden Fließtext plus einer Reihe von Lücken. Ziehen Sie die Bilder aus dem Dokument heraus und konvertieren Sie sie hier als Bilddateien.
In einem Satz: Wenn die gesuchten Wörter in einem Bild stecken, muss das Bild die hochgeladene Datei sein.
Aus einer schwierigen Vorlage mehr herausholen
- Lieber ein Screenshot als das Abfotografieren eines Bildschirms, wann immer Sie die Wahl haben. Ein Screenshot hat perfekten Kontrast, keine Spiegelung, keine perspektivische Verzerrung und kein Verwackeln. Das ist der größte einzelne Qualitätsgewinn, der Ihnen offensteht.
- Auf die Schrift zuschneiden. Eine Tabelle, die ein Fünftel eines breiten Fotos einnimmt, hat weniger Pixel pro Zeichen als dieselbe Tabelle formatfüllend – und das sieht man im Ergebnis.
- Das Bild aufrecht und frontal halten. Wer eine Seite schräg aufnimmt, verbiegt die Textzeilen, und eine Schräglage lässt sich schlechter in Zeilen zerlegen – was ausgerechnet die Tabellen trifft, wegen derer Sie hier sind.
- Gleichmäßig ausleuchten. Ein harter Schatten quer über einem Beleg oder ein Glanzfleck auf einem laminierten Formular schluckt alles, was darunter liegt.
- Die Ausgabe lesen, bevor Sie sich darauf verlassen. Bei Zahlen tun Fehler am meisten weh, prüfen Sie also Summen und Referenzcodes gegen das Bild. Der Token-Zähler unter der Ausgabe verrät Ihnen, wie viel Sie gleich in ein Modell einfügen – praktisch, wenn Sie mehrere Seiten in einem Prompt stapeln.
Häufige Fragen
Wie wandle ich ein Bild in Markdown um?
Laden Sie das Bild oben hoch; der erkannte Text kommt mit angewandter Markdown-Struktur zurück. Unterstützt werden JPG, JPEG, PNG, GIF, BMP, TIFF, TIF und WebP, bis 50 MB, kostenlos und ohne Konto. Die Ausgabe ist .md, das Sie in eine README, eine Doku-Seite oder einen Modell-Prompt einfügen können.
Wann ist Markdown bei einem Bild wirklich besser als reiner Text?
Wenn das Abgebildete eine Form hat. Der Screenshot eines Absatzes wird in beide Richtungen identisch konvertiert – in Fließtext steckt keine verborgene Struktur, die Markdown auszeichnen könnte. Der Screenshot einer Tabelle, eines Formulars, einer Preisliste oder einer Seite mit Überschriften hat dagegen eine Anordnung, deren Erhalt sich lohnt, und nur Markdown kann sie tragen. Für flachen Fließtext ist Bild zu Text die einfachere Wahl.
Erkennt das Werkzeug eine Tabelle im Screenshot?
Es versucht sich an einer Pipe-Tabelle, und das Ergebnis hängt daran, wie sauber die Vorlage ist. Screenshots echter Tabellen mit sichtbaren Gitternetzlinien und gleichmäßigen Spaltenabständen werden meist korrekt rekonstruiert. Tabellen, deren Spalten nur durch großzügigen Leerraum getrennt sind oder deren Zellen auf zwei Zeilen umbrechen, sind die Fälle, in denen Spaltengrenzen falsch geraten werden – prüfen Sie die Kopfzeile, bevor Sie den Zahlen trauen.
Kommt das Werkzeug mit dem Screenshot von Code zurecht?
Die Zeichen kommen durch, behandeln Sie das Ergebnis aber als Entwurf. OCR kennt keine Syntax und merkt deshalb nicht, dass es 0 gelesen hat, wo in der Vorlage ein O stand, oder dass in einem Python-Block eine Ebene der Einrückung verloren ging. Für einen Stacktrace, den Sie durchsuchen wollen, reicht das. Zum Einfügen in eine Datei und Ausführen nicht.
Werden die Bilder selbst im Markdown eingebettet?
Nein – die Ausgabe ist der Text, der im Bild gefunden wurde, kein Verweis der Form  auf das Bild. Es wird nichts zu einem CDN hochgeladen und es werden keine Bildlinks erzeugt; das Markdown ist damit in sich geschlossener reiner Text ohne externe Abhängigkeiten.
Der Rest des Werkzeugkastens
Bilder sind eines von dreizehn Formaten, die hier verarbeitet werden. File2Txt nimmt jedes davon entgegen, falls Sie sich nicht vorher für eine Seite entscheiden möchten. Für Code gibt es den Konverter für GitHub-Repositories zu Text und einen Konverter für lokale Verzeichnisse, wenn ein Ordner auf Ihrem eigenen Rechner ansteht, und der Leitfaden zur Vorbereitung von Dateien für LLMs behandelt den allgemeinen Fall ausführlicher.
Repo2Txt wird entwickelt und gepflegt von v12hero, einem unabhängigen Entwickler, der native und Web-Apps mit Datenschutz an erster Stelle baut.