Text aus DjVu extrahieren

Stellen Sie den versteckten OCR-Text wieder her, der bereits in ein DjVu-Dokument eingebettet ist, als UTF-8-Nurtext oder begrenztes Positions-XML. Dies ist Extraktion, nicht neu OCR.

Private Ergebnisse · keine Netzwerksuche · keine Qualitätsminderung · Dateien bis zu 1 GB

XML ist eine begrenzte DjVuLibre-Engine-Darstellung. Es ist nicht ALTO oder hOCR und garantiert keine Lesereihenfolge.

Rechte- und Datenschutzerinnerung: Verarbeiten Sie nur Dokumente, die Sie verwenden dürfen. Versteckter Text, Anmerkungen und Scans können privates oder urheberrechtlich geschütztes Material enthalten. Die Ergebnisse verbleiben im privaten Job des Uploaders und werden im Rahmen der bestehenden Aufbewahrungsfrist als no-store Anhänge bereitgestellt.

Was das Toolkit DjVu macht

Begrenzte Inspektion

Berichtet Seitenanzahl, native Abmessungen, DPI und gamma bei Offenlegung, gebündelte Struktur, versteckten Text, Anmerkungen, Miniaturansichten sowie Vordergrund-, Hintergrund- und Maskenebenen.

Von der Quelle abgeleiteter Text

Textgenauigkeit und Sprache stammen vollständig aus der hochgeladenen Quelle. Convertr verbessert, übersetzt, verändert oder sendet extrahierten Text nicht in den Upstream.

Natives Seitenrendering

Ausgewählte Seiten werden durch den angehefteten Build ddjvu in ihren vollen nativen Abmessungen dekodiert. Die unsichere Erweiterung schlägt explizit fehl, anstatt die Ausgabe zu kürzen oder zu verkleinern.

Indirekte DjVu-Dokumente mit ungelösten Komponentenverweisen werden abgelehnt. Das Toolkit folgt niemals Komponenten-URLs. Es legt niemals Komponenten-IDs offen. Es akzeptiert niemals Befehlsskripte. Es bietet niemals Zuschneide- oder Qualitätsschalter an.

Text aus DjVu extrahieren

Stellen Sie nur den versteckten OCR-Text wieder her, der bereits in ein DjVu-Dokument eingebettet ist.

Eingabe
Eine signaturverifizierte .djvu- oder .djv-Datei und eine TXT- oder positionelle XML-Ausgabe.
Ausgabe
Vollständiger UTF-8-Text oder bereinigter, begrenzter Positionstext XML.
Reale Einschränkungen
Dadurch wird kein neues OCR erstellt, die Genauigkeit verbessert, Text übersetzt oder die Lesereihenfolge garantiert.
Datenschutz und Datenverarbeitung
Eine signaturverifizierte .djvu- oder .djv-Datei und eine TXT- oder positionelle XML-Ausgabe werden erst auf einen kompatiblen Convertr-Worker hochgeladen, nachdem Sie den Vorgang gestartet haben. Die Verarbeitung erfolgt automatisiert und temporäre Quell- und Ergebnisdateien werden nach der Verarbeitung automatisch gelöscht und nicht dauerhaft gespeichert.

Wie man dieses Tool verwendet

  1. Wählen Sie eine signaturverifizierte .djvu- oder .djv-Datei und eine TXT- oder positionelle XML-Ausgabe aus und warten Sie, bis die Seite sie validiert.
  2. Setzen Sie die verfügbaren Ausgangs- oder Inspektionsoptionen, dann starten Sie die Verarbeitung.
  3. Überprüfen Sie das gemeldete Ergebnis und laden Sie den vollständigen UTF-8-Text oder den bereinigten, begrenzten Positionstext XML herunter, bevor der temporäre Link abläuft.

Einheitliche Versagenmodes

Eine fehlende Textebene, ein ungültiger UTF-8, eine unsichere XML-Erweiterung, ein fehlerhaftes Dokument oder eine Erschöpfung des Arbeitsbereichs führen zu einem expliziten Fehler.

nützliches Beispiel

Laden Sie einen DjVu mit eingebettetem Text hoch und laden Sie die genaue djvutxt UTF-8-Ausgabe herunter.