ტექსტის ამოღება DjVu-დან

DjVu დოკუმენტში ჩაშენებული ფარული OCR ტექსტის აღდგენა UTF-8 ჩვეულებრივი ტექსტის ან შეზღუდული პოზიციური XML-ის სახით. ეს არის ამოღება, არა ახალი OCR.

პირადი შედეგები · ქსელის მოთხოვნის გარეშე · ხარისხის შემცირების გარეშე · ფაილები 1 GB-მდე

XML არის DjVuLibre ძრავის შეზღუდული წარმოდგენა. ის არ არის ALTO ან hOCR და არ იძლევა წაკითხვის თანმიმდევრობის გარანტიას.

უფლებებისა და კონფიდენციალურობის შეხსენება: დაამუშავეთ მხოლოდ ის დოკუმენტები, რომელთა გამოყენების უფლება გაქვთ. ფარული ტექსტი, ანოტაციები და სკანირებები შეიძლება შეიცავდეს პირად ან საავტორო უფლებებით დაცულ მასალას. შედეგები რჩება ატვირთვის პირად სამუშაოში და მიეწოდება no-store დანართების სახით არსებული შენახვის ვადის განმავლობაში.

რას აკეთებს DjVu ინსტრუმენტების ნაკრები

შეზღუდული ინსპექცია

აჩვენებს გვერდების რაოდენობას, ორიგინალურ ზომებს, DPI-სა და gamma-ს (თუ ხელმისაწვდომია), შეკრულ სტრუქტურას, ფარულ ტექსტს, ანოტაციებს, მინიატურებს, ასევე წინა, ფონურ და ნიღბის ფენებს.

წყაროდან მიღებული ტექსტი

ტექსტის სიზუსტე და ენა მთლიანად ატვირთული წყაროდან მოდის. Convertr არ აუმჯობესებს, არ თარგმნის, არ ცვლის და არ აგზავნის ამოღებულ ტექსტს ზემოთ.

მშობლიური გვერდის რენდერი

არჩეული გვერდები იშიფრება მიბმული ddjvu აგებულებით მათი სრული ორიგინალური ზომებით. უსაფრთხო გაფართოების შეცდომა ცხადად ვლინდება, გამომავალი არ იჭრება ან არ მცირდება.

არაპირდაპირი DjVu დოკუმენტები გადაუჭრელი კომპონენტის მითითებებით უარყოფილია. ინსტრუმენტარიუმი არასდროს მიჰყვება კომპონენტის URL-ებს, არ ამხელს კომპონენტის იდენტიფიკატორებს, არ იღებს ბრძანების სკრიპტებს და არ გვთავაზობს crop ან quality გადამრთველებს.

დაკავშირებული დოკუმენტისა და PDF ინსტრუმენტები

DjVu PDF-შიგადაიყვანე დოკუმენტი PDF-ად. ტექსტური ფენის შენარჩუნება ცალკე უნდა შემოწმდეს. დოკუმენტის გადამყვანიდაათვალიერეთ დოკუმენტებისა და ელექტრონული წიგნების კონვერტაციის ინსტრუმენტები. OCR ხელსაწყოებიშექმენით ახალი OCR მხარდაჭერილი სურათებისა და PDF-ებისთვის, როდესაც ტექსტის ფენა არ არსებობს. DjVu გვერდების ამოღებაარჩეული გვერდების ორიგინალური გარჩევადობით გადაქცევა. DjVu ინსპექტორიდოკუმენტის სტრუქტურის გადახედვა რაიმეს ამოღებამდე. PDF გამყოფიარჩეული გვერდების გაყოფა შესაბამისი დოკუმენტის PDF-ად გარდაქმნის შემდეგ. სურათების ამოღება PDF-დანაღადგინეთ PDF-ში ჩაშენებული სურათები.

ტექსტის ამოღება DjVu-დან

აღადგინეთ მხოლოდ DjVu დოკუმენტში უკვე ჩაშენებული ფარული OCR ტექსტი.

შეყვანა
ერთი ხელმოწერით დამოწმებული .djvu ან .djv ფაილი და TXT ან პოზიციური XML გამომავალი.
გამომავალი
სრული UTF-8 ტექსტი ან სანიტიზებული შეზღუდული პოზიციური XML.
რეალური შეზღუდვები
ეს არ ქმნის ახალ OCR-ს, არ აუმჯობესებს სიზუსტეს, არ თარგმნის ტექსტს და არ იძლევა წაკითხვის თანმიმდევრობის გარანტიას.
კონფიდენციალურობა და მონაცემთა დამუშავება
ერთი ხელმოწერით დამოწმებული .djvu ან .djv ფაილი და TXT ან პოზიციური XML გამომავალი აიტვირთება თავსებად Convertr სერვერზე მხოლოდ ოპერაციის დაწყების შემდეგ. დამუშავება ავტომატურია, ხოლო დროებითი წყაროსა და შედეგის ფაილები ავტომატურად იშლება დამუშავების შემდეგ, ვიდრე ინახება მუდმივ საცავში.

როგორ გამოვიყენოთ ეს ინსტრუმენტი

  1. აირჩიეთ ერთი ხელმოწერით დამოწმებული .djvu ან .djv ფაილი და TXT ან პოზიციური XML გამომავალი და დაელოდეთ გვერდის ვალიდაციას.
  2. დააყენეთ ხელმისაწვდომი გამომავალი ან შემოწმების პარამეტრები, შემდეგ დაიწყეთ დამუშავება.
  3. განიხილეთ მოხსენებული შედეგი და ჩამოტვირთეთ სრული UTF-8 ტექსტი ან გაწმენდილი შეზღუდული პოზიციური XML, სანამ დროებითი ბმული არ ვადაგასულია.

საერთო წარუმატებლობის რეჟიმები

დაკარგული ტექსტის ფენა, არასწორი UTF-8, არაუსაფრთხო XML გაფართოება, არასწორად ჩამოყალიბებული დოკუმენტი ან სამუშაო სივრცის ამოწურვა იწვევს აშკარა წარუმატებლობას.

სასარგებლო მაგალითი

ატვირთეთ DjVu ჩაშენებული ტექსტით და ჩამოტვირთეთ ზუსტი djvutxt UTF-8 გამომავალი.