Wyodrębnij tekst z numeru DjVu

Odzyskaj ukryty tekst OCR już osadzony w dokumencie DjVu jako zwykły tekst UTF-8 lub ograniczony pozycyjny kod XML. Jest to ekstrakcja a nie nowa OCR.

Wyniki prywatne · brak wyszukiwania sieci · brak obniżania jakości · pliki do 1 GB

XML to ograniczona reprezentacja silnika DjVuLibre. Nie jest to ALTO ani hOCR i nie gwarantuje kolejności odczytu.

Przypomnienie o prawach i prywatności: Przetwarzaj tylko te dokumenty, z których możesz korzystać. Ukryty tekst, adnotacje i skany mogą zawierać materiały prywatne lub chronione prawem autorskim. Wyniki pozostają w prywatnej pracy przesyłającego i są udostępniane jako załączniki no-store w ramach istniejącego okresu przechowywania.

Co robi zestaw narzędzi DjVu

Ograniczona kontrola

Raportuje liczbę stron, wymiary natywne, DPI i gamma po odsłonięciu, strukturę pakietową, ukryty tekst, adnotacje, miniatury oraz warstwy pierwszego planu, tła i maski.

Tekst pochodzi ze źródła

Dokładność tekstu i język pochodzą w całości z przesłanego źródła. Convertr nie poprawia, nie tłumaczy, nie mutuje ani nie wysyła wyodrębnionego tekstu w górę.

Natywne renderowanie strony

Wybrane strony są dekodowane przez przypiętą kompilację ddjvu w ich pełnych, natywnych wymiarach. Niebezpieczna ekspansja kończy się jawnym niepowodzeniem zamiast obcinania lub zmniejszania skali danych wyjściowych.

Pośrednie dokumenty DjVu z nierozwiązanymi odniesieniami do komponentów są odrzucane. Zestaw narzędzi nigdy nie podąża za adresami URL komponentów. Nigdy nie ujawnia identyfikatorów komponentów. Nigdy nie akceptuje skryptów poleceń. Nigdy nie oferuje przełączników kadrowania ani jakości.

Wyodrębnij tekst z numeru DjVu

Odzyskaj tylko ukryty tekst OCR już osadzony w dokumencie DjVu.

Wejście
Jeden plik .djvu lub .djv zweryfikowany sygnaturą i wyjście TXT lub pozycyjne XML.
Wyjście
Kompletny tekst UTF-8 lub oczyszczony, ograniczony pozycyjny XML.
Prawdziwe ograniczenia
Nie tworzy to nowego OCR, nie poprawia dokładności, nie tłumaczy tekstu ani nie gwarantuje kolejności czytania.
Prywatność i przetwarzanie danych
jeden zweryfikowany podpisem plik .djvu lub .djv i wyjście TXT lub pozycyjne XML są przesyłane do kompatybilnego workera Convertr dopiero po rozpoczęciu operacji. Przetwarzanie jest zautomatyzowane, a tymczasowe pliki źródłowe i wynikowe są automatycznie usuwane po przetworzeniu, a nie przechowywane w postaci trwałej.

Jak wykorzystać ten narzędzie

  1. Wybierz jeden plik .djvu lub .djv zweryfikowany sygnaturą oraz wyjście TXT lub pozycyjne XML i poczekaj, aż strona go zatwierdzi.
  2. Ustaw dostępne opcje wyjścia lub kontroli, a następnie rozpocznij przetwarzanie.
  3. Przejrzyj raportowany wynik i pobierz pełny tekst UTF-8 lub oczyszczony, ograniczony pozycyjnie XML, zanim tymczasowe łącze wygaśnie.

Wspólne tryby niepowodzenia

Brakująca warstwa tekstowa, nieprawidłowy UTF-8, niebezpieczne rozszerzenie XML, zniekształcony dokument lub wyczerpanie obszaru roboczego powoduje wyraźny błąd.

Przykład przydatny

Prześlij plik DjVu z osadzonym tekstem i pobierz dokładne dane wyjściowe djvutxt UTF-8.