ამოიღეთ ტექსტი DjVu-დან

აღადგინეთ დამალული OCR ტექსტი, რომელიც უკვე ჩაშენებულია DjVu დოკუმენტში, როგორც UTF-8 ჩვეულებრივი ტექსტი ან შეზღუდული პოზიციური XML. ეს არის ექსტრაქცია და არა ახალი OCR.

პირადი შედეგები · ქსელის ძიება · ხარისხის შემცირება · ფაილები 1 GB-მდე

XML არის შეზღუდული DjVuLibre ძრავის წარმოდგენა. ეს არ არის ALTO ან hOCR და არ იძლევა კითხვის თანმიმდევრობის გარანტიას.

უფლებებისა და კონფიდენციალურობის შეხსენება: დაამუშავეთ მხოლოდ დოკუმენტები, რომელთა გამოყენების უფლება გაქვთ. ფარული ტექსტი, ანოტაციები და სკანირება შეიძლება შეიცავდეს პირად ან საავტორო უფლებებით დაცულ მასალას. შედეგები რჩება ამტვირთველის პირად სამუშაოში და ემსახურება no-store დანართად არსებული შენახვის პერიოდში.

რას აკეთებს DjVu ინსტრუმენტარიუმი

შემოსაზღვრული შემოწმება

მოხსენებები გვერდების რაოდენობას, მშობლიურ ზომებს, DPI და gamma გამოფენისას, შეფუთული სტრუქტურა, ფარული ტექსტი, ანოტაციები, ესკიზები და წინა პლანი, ფონი და ნიღბის ფენები.

წყაროდან მიღებული ტექსტი

ტექსტის სიზუსტე და ენა მთლიანად ატვირთული წყაროდან მოდის. Convertr არ აუმჯობესებს, თარგმნის, მუტაციას ან აგზავნის ამოღებულ ტექსტს ზემოთ.

მშობლიური გვერდის რენდერი

შერჩეული გვერდები დეკოდირებულია ჩამაგრებული ddjvu კონსტრუქციით მათი სრული ძირითადი ზომებით. არაუსაფრთხო გაფართოება აშკარად ვერ ხერხდება გამომავალი შემცირების ან მასშტაბის შემცირების ნაცვლად.

არაპირდაპირი DjVu დოკუმენტები გადაუჭრელი კომპონენტების მითითებით უარყოფილია. ხელსაწყოთა ნაკრები არასოდეს მიჰყვება კომპონენტების URL-ებს. ის არასოდეს ავლენს კომპონენტის იდენტიფიკატორებს. ის არასოდეს იღებს ბრძანების სკრიპტებს. ის არასოდეს გვთავაზობს ჩამოჭრის ან ხარისხის გადამრთველებს.

დაკავშირებული დოკუმენტი და PDF ხელსაწყოები

DjVu PDF-ზეგადაიყვანეთ დოკუმენტი PDF-ად. ტექსტის ფენის დაცვა ცალკე უნდა გადამოწმდეს. დოკუმენტის გადამყვანიდაათვალიერეთ დოკუმენტების და ელექტრონული წიგნების კონვერტაციის ხელსაწყოები. OCR ინსტრუმენტებიშექმენით ახალი OCR მხარდაჭერილი სურათისთვის და PDF შეყვანისთვის, როცა ტექსტის ფენა არ არსებობს. ამონაწერი DjVu გვერდებიშერჩეული გვერდების რენდერი ორიგინალური გარჩევადობით. DjVu ინსპექტორიგადახედეთ დოკუმენტის სტრუქტურას რაიმეს ამოღებამდე. PDF-ის გაყოფაარჩეული გვერდების გაყოფა შესაბამისი დოკუმენტის PDF-ად კონვერტაციის შემდეგ. სურათების ამოღება PDF-დანPDF-ში ჩაშენებული სურათების აღდგენა.

ამოიღეთ ტექსტი DjVu-დან

აღადგინეთ მხოლოდ ფარული OCR ტექსტი, რომელიც უკვე ჩაშენებულია DjVu დოკუმენტში.

INPUT
ერთი ხელმოწერით დამოწმებული .djvu ან .djv ფაილი და TXT ან პოზიციური XML გამომავალი.
output წავიდეთ
დაასრულეთ UTF-8 ტექსტი ან გაწმენდილი შემოსაზღვრული პოზიცია XML.
რეალური ბრალდებები
ეს არ ქმნის ახალ OCR-ს, არ აუმჯობესებს სიზუსტეს, არ თარგმნის ტექსტს და არ იძლევა კითხვის თანმიმდევრობის გარანტიას.
Privacy and Data Processing (რუსთავი 2 მილიარდ დოლარი)
ერთი ხელმოწერით დამოწმებული .djvu ან .djv ფაილი და TXT ან პოზიციური XML გამომავალი აიტვირთება თავსებად Convertr მუშაკზე მხოლოდ ოპერაციის დაწყების შემდეგ. დამუშავება ავტომატიზირებულია და დროებითი წყარო და შედეგების ფაილები ავტომატურად იშლება დამუშავების შემდეგ, ვიდრე ინახება მუდმივ მეხსიერებად.

როგორ გამოიყენოთ ეს ტექნოლოგიური ინსტრუმენტი

  1. აირჩიეთ ერთი ხელმოწერით დამოწმებული .djvu ან .djv ფაილი და TXT ან პოზიციური XML გამოსავალი და დაელოდეთ გვერდის დადასტურებას.
  2. გამოგზავნილია: 16 May 2018, 14:44 #517417 · პროფილი · პირადი მიმოწერა · ჩატი · ელფოსტა
  3. გადახედეთ მოხსენებულ შედეგს და ჩამოტვირთეთ სრული UTF-8 ტექსტი ან გაწმენდილი შემოსაზღვრული პოზიციური XML დროებითი ბმულის ვადის ამოწურვამდე.

Common Failure Mode-ის გამოყენებით

დაკარგული ტექსტის ფენა, არასწორი UTF-8, არაუსაფრთხო XML გაფართოება, არასწორი დოკუმენტი ან სამუშაო სივრცის ამოწურვა იწვევს აშკარა მარცხს.

გამოყენებული გამოცდილება

ატვირთეთ DjVu ჩაშენებული ტექსტით და ჩამოტვირთეთ ზუსტი djvutxt UTF-8 გამომავალი.