Markdown fürs LLM
Aus Bild oder PDF wird sauberer Markdown-Fließtext – ohne Kopf-/Fußzeilen-Müll. Direkt als Kontext für ein Sprachmodell nutzbar.
x2text wandelt Bilder und PDF-Dateien in sauberes Markdown und ein Positions-JSON um – mit einem Qualitäts-Score von 0–100. So bereitest du ein PDF als LLM-Kontext auf, ohne Layout-Müll. Die Verarbeitung läuft rein lokal, ohne Cloud-KI.
Kostenloses Konto: 30 Dokumente pro Tag, jpg/png/pdf bis 50 MB, 1 Dokument gleichzeitig. Anmeldung mit E-Mail-Bestätigung.
Aus Bild oder PDF wird sauberer Markdown-Fließtext – ohne Kopf-/Fußzeilen-Müll. Direkt als Kontext für ein Sprachmodell nutzbar.
Je Seite die erkannten Textblöcke mit Koordinaten (Bounding-Boxen) und Signalen. So ist maschinell nachvollziehbar, wo ein Text steht.
Ein ehrlicher Score je Seite und Dokument aus messbaren Signalen (u. a. Wort-Konfidenz). Bei schwacher Vorlage sinkt er – mit klaren Warnungen.
Scans, Fotos und Bild-PDFs werden per Texterkennung (Tesseract, Deutsch + Englisch) ausgelesen – inklusive Wort-Konfidenz für den Score.
PDF mit eingebettetem Text wird direkt mit Koordinaten übernommen. Ausfüllbare Formulare (AcroForm) liefern Feldname, Wert, Typ und Position.
Die Verarbeitung läuft ausschließlich auf dem Server mit lokalen Programmen. Keine Übermittlung an Sprachmodelle oder Cloud-Dienste, keine Tracker.
Bild oder PDF wählen (jpg, png, pdf – bis 50 MB). Die Verarbeitung startet in einer Warteschlange auf dem Server.
x2text erkennt Text und Struktur lokal und berechnet einen Qualitäts-Score. Der Fortschritt wird live angezeigt.
Ergebnis ansehen und herunterladen: dokument.md (Markdown) und dokument.json (Positions-JSON).
x2text ist eine Web-App, die Bilder und PDF-Dateien in maschinenlesbares Markdown und ein Positions-JSON umwandelt. Die Verarbeitung läuft rein lokal auf dem Server (Texterkennung/OCR), ohne Übermittlung an Sprachmodelle oder Cloud-Dienste.
PDF hochladen, x2text extrahiert den Text als sauberes Markdown. Dieses Markdown lässt sich direkt als Kontext in ein Sprachmodell (LLM) einfügen – ohne Layout-Müll, Seitenzahlen oder Trennartefakte. Zusätzlich gibt es ein Positions-JSON, falls die Herkunft einzelner Textblöcke gebraucht wird.
Reines OCR liefert einen Textstrom. x2text erzeugt daraus strukturiertes Markdown (Überschriften, Absätze, Listen) plus ein Positions-JSON mit Koordinaten und einen Qualitäts-Score 0–100. Bei Maschinen-PDF mit eingebettetem Text wird dieser direkt genutzt, statt das Dokument neu zu erkennen.
Ja. Neben dem Markdown liefert x2text ein Positions-JSON: je Seite die erkannten Textblöcke mit ihren Koordinaten (Bounding-Boxen) sowie Qualitäts-Signale. Damit lässt sich maschinell nachvollziehen, wo im Dokument ein Text steht.
Eingaben sind JPG, PNG und PDF. Im kostenlosen Konto sind Dateien bis 50 MB und 30 Dokumente pro Tag möglich, 1 Dokument wird gleichzeitig verarbeitet.
Datei hochladen, die Verarbeitung läuft in einer Warteschlange auf dem Server mit Live-Fortschritt. Ergebnis sind zwei Dateien: dokument.md (Markdown) und dokument.json (Positions-JSON) plus ein Qualitäts-Score. Beides lässt sich ansehen und herunterladen.
Der Score schätzt die Erkennungsqualität je Seite und je Dokument aus messbaren Signalen (etwa der Wort-Konfidenz der Texterkennung). Er ist bewusst ehrlich: bei schwacher Vorlage sinkt der Score und es erscheinen Warnungen, statt ein scheinbar perfektes Ergebnis vorzutäuschen.
Nein. Die Dokumente werden ausschließlich auf dem Server mit lokal ausgeführten Programmen verarbeitet. Eine Übermittlung an Sprachmodelle (KI), Cloud-Dienste oder sonstige externe Verarbeiter findet nicht statt. Das ist ein bewusstes Kernmerkmal des Dienstes.
Ja. Scans, Fotos und Bild-PDFs werden per Texterkennung (OCR mit Tesseract) ausgelesen. Maschinen-PDF mit eingebettetem Text wird ohne OCR direkt übernommen. In beiden Fällen entstehen Markdown, Positions-JSON und Score.
Ja. Bei ausfüllbaren PDF-Formularen (AcroForm) liest x2text die Felder mit Name, Wert, Typ und Position aus, statt nur das sichtbare Bild zu erkennen.
Die OCR ist standardmäßig auf Deutsch und Englisch eingestellt (Tesseract deu+eng). Gemischte deutsch-englische Dokumente werden dadurch zuverlässig erkannt.
Die Nutzung ist kostenlos. Nach Registrierung mit E-Mail-Bestätigung stehen 30 Dokumente pro Tag zur Verfügung, je Datei bis 50 MB, 1 Dokument gleichzeitig.
Registrieren, E-Mail bestätigen, erstes Dokument hochladen – Markdown und Positions-JSON in wenigen Sekunden.
Kostenlos registrieren