Extrage text din DjVu

Recuperați textul ascuns OCR deja încorporat într-un document DjVu ca text simplu UTF-8 sau XML pozițional delimitat. Aceasta este extracție, nu nou OCR.

Rezultate private · fără căutare în rețea · fără reducere a calității · fișiere până la 1 GB

XML este o reprezentare de motor delimitată DjVuLibre. Nu este ALTO sau hOCR și nu garantează ordinea de citire.

Memento privind drepturile și confidențialitatea: Procesați numai documentele pe care aveți voie să le utilizați. Textul ascuns, adnotările și scanările pot conține materiale private sau protejate prin drepturi de autor. Rezultatele rămân în slujba privată a persoanei care a încărcat și sunt difuzate ca no-store atașamente în perioada de păstrare existentă.

Ce face setul de instrumente DjVu

Inspecție delimitată

Numărul de pagini ale rapoartelor, dimensiunile native, DPI și gamma când sunt expuse, structură grupată, text ascuns, adnotări, miniaturi și straturi de prim-plan, fundal și masca.

Text derivat din sursă

Precizia textului și limba provine în întregime din sursa încărcată. Convertr nu îmbunătățește, traduce, modifică și nu trimite text extras în amonte.

Redare pagină nativă

Paginile selectate sunt decodificate de build-ul ddjvu fixat la dimensiunile lor native complete. Expansiunea nesigură eșuează în mod explicit în loc de trunchierea sau reducerea la scară a ieșirii.

Documentele indirecte DjVu cu referințe de componente nerezolvate sunt respinse. Setul de instrumente nu urmărește niciodată adresele URL ale componentelor, nu expune identificatorii componentelor, nu acceptă scripturi de comandă sau nu oferă comutatoare de decupare și calitate.

Extrage text din DjVu

Recuperează numai textul OCR ascuns deja încorporat într-un document DjVu.

Intrare
Un fișier .djvu sau .djv verificat prin semnătură și ieșire TXT sau XML pozițional.
Ieșire
Text UTF-8 complet sau XML pozițional delimitat igienizat.
Limitări reale
Acest lucru nu creează OCR nou, nu îmbunătățește acuratețea, nu traduce textul și nu garantează ordinea de citire.
Confidențialitatea și gestionarea datelor
un fișier .djvu sau .djv verificat prin semnătură și ieșire TXT sau XML pozițional este încărcat pe un worker Convertr compatibil doar după ce începi operația. Procesarea este automatizată, iar fișierele sursă și rezultat temporare sunt șterse automat după procesare, fără a fi păstrate ca stocare permanentă.

Cum să utilizați acest instrument

  1. Alege un fișier .djvu sau .djv verificat prin semnătură și o ieșire TXT sau pozițională XML și așteaptă ca pagina să îl valideze.
  2. Setați opțiunile de ieșire sau inspecție disponibile, apoi începeți procesarea.
  3. Examinați rezultatul raportat și descărcați text UTF-8 complet sau XML pozițional delimitat igienizat înainte ca linkul temporar să expire.

Moduri comune de eșec

Un strat de text lipsă, un UTF-8 nevalid, o extindere nesigură a XML, un document malformat sau epuizarea spațiului de lucru produce o eroare explicită.

Exemplu util

Încărcați un DjVu cu text încorporat și descărcați rezultatul exact djvutxt UTF-8.