DjVu에서 텍스트 추출

DjVu 문서에 이미 포함된 숨겨진 OCR 텍스트를 UTF-8 일반 텍스트 또는 제한된 위치 XML로 복구합니다. 이것은 새로운 OCR이 아닌 추출입니다.

비공개 결과 · 네트워크 조회 없음 · 품질 저하 없음 · 최대 1 GB 파일

XML은 제한된 DjVuLibre 엔진 표현입니다. ALTO이나 hOCR가 아니며 읽는 순서를 보장하지 않습니다.

권리 및 개인정보 보호 알림: 사용이 허용된 문서만 처리하세요. 숨겨진 텍스트, 주석 및 스캔에는 개인 자료 또는 저작권이 있는 자료가 포함될 수 있습니다. 결과는 업로더의 비공개 작업에 유지되며 기존 보존 기간에 따라 no-store 첨부 파일로 제공됩니다.

DjVu 툴킷의 기능

제한된 검사

노출된 경우 페이지 수, 기본 크기, DPI 및 gamma, 번들 구조, 숨겨진 텍스트, 주석, 축소판, 전경, 배경 및 마스크 레이어를 보고합니다.

소스 파생 텍스트

텍스트의 정확성과 언어는 전적으로 업로드된 소스에서 나옵니다. Convertr는 추출된 텍스트를 업스트림으로 개선, 번역, 변형 또는 전송하지 않습니다.

기본 페이지 렌더링

선택한 페이지는 고정된 ddjvu 빌드에 의해 전체 기본 크기로 디코딩됩니다. 출력을 자르거나 축소하는 대신 안전하지 않은 확장이 명시적으로 실패합니다.

해결되지 않은 구성 요소 참조가 있는 간접 DjVu 문서는 거부됩니다. 툴킷은 구성 요소 URL을 따르거나, 구성 요소 식별자를 노출하거나, 명령 스크립트를 허용하거나, 자르기 및 품질 스위치를 제공하지 않습니다.

DjVu에서 텍스트 추출

DjVu 문서에 이미 포함된 숨겨진 OCR 텍스트만 복구합니다.

입장
서명이 확인된 .djvu 또는 .djv 파일 1개와 TXT 또는 위치 XML 출력.
출력
완전한 UTF-8 텍스트 또는 삭제된 경계 위치 XML.
실제 제한
이는 새로운 OCR를 생성하거나 정확성을 높이거나 텍스트를 번역하거나 읽기 순서를 보장하지 않습니다.
개인정보 및 데이터 처리
서명이 확인된 .djvu 또는 .djv 파일 하나와 TXT 또는 위치 XML 출력은 작업을 시작한 후에만 호환 가능한 Convertr 작업자에 업로드됩니다. 처리가 자동화되고, 임시 소스 및 결과 파일은 영구 저장소로 보관되지 않고 처리 후 자동으로 삭제됩니다.

이 도구를 어떻게 사용해야 하는지

  1. 서명이 확인된 .djvu 또는 .djv 파일과 TXT 또는 위치 XML 출력 중 하나를 선택하고 페이지에서 이를 확인할 때까지 기다립니다.
  2. 사용 가능한 출력 또는 검사 옵션을 설정한 다음 처리 시작합니다.
  3. 보고된 결과를 검토하고 임시 링크가 만료되기 전에 전체 UTF-8 텍스트 또는 삭제된 경계 위치 XML를 다운로드하세요.

일반적인 실패 모드

누락된 텍스트 레이어, 유효하지 않은 UTF-8, 안전하지 않은 XML 확장, 잘못된 문서 또는 작업 공간 소진으로 인해 명시적인 오류가 발생합니다.

유용한 예제

텍스트가 포함된 DjVu를 업로드하고 정확한 djvutxt UTF-8 출력을 다운로드하세요.