从 DjVu 中提取文本

将已嵌入 DjVu 文档中的隐藏 OCR 文本恢复为 UTF-8 纯文本或有界位置 XML。这是提取,不是新的 OCR。

私人结果·无网络查找·无质量降低·文件最多1 GB

XML 是有界的 DjVuLibre 引擎表示。它不是 ALTO 或 hOCR,并且不保证读取顺序。

权利和隐私提醒: 仅处理您被允许使用的文档。隐藏文本、注释和扫描可能包含私人或受版权保护的材料。结果保留在上传者的私人作业中,并在现有保留期内作为 no-store 附件提供。

DjVu 工具包的作用

有界检查

报告页数、原始尺寸、暴露时的 DPI 和 gamma、捆绑结构、隐藏文本、注释、缩略图以及前景、背景和遮罩层。

来源文本

文本准确性和语言完全来自上传的来源。 Convertr 不会改进、翻译、变异或向上游发送提取的文本。

原生页面渲染

选定的页面由固定的 ddjvu 版本以其完整的原始尺寸进行解码。不安全扩展显式失败,而不是截断或缩小输出。

带有未解析组件引用的间接 DjVu 文档将被拒绝。该工具包从不访问组件 URL,从不公开组件标识符,从不接受命令脚本,也从不提供裁剪或质量开关。

从 DjVu 中提取文本

仅恢复已嵌入 DjVu 文档中的隐藏 OCR 文本。

输入
一个经过签名验证的 .djvu 或 .djv 文件和 TXT 或位置 XML 输出.
输出
完整的 UTF-8 文本或已清理的有界位置 XML.
真正的限制
这不会创建新的 OCR、提高准确性、翻译文本或保证阅读顺序。
隐私与数据处理
仅在开始操作后,一个经过签名验证的 .djvu 或 .djv 文件以及 TXT 或位置 XML 输出才会上传到兼容的 Convertr 工作程序。处理是自动化的,临时源文件和结果文件在处理后会自动删除,而不是保留为永久存储。

如何使用此工具

  1. 选择一个经过签名验证的 .djvu 或 .djv 文件以及 TXT 或位置 XML 输出,然后等待页面对其进行验证。
  2. 设置可用的输出或检查选项,然后开始处理。
  3. 查看报告的结果并在临时链接过期之前下载完整的 UTF-8 文本或经过清理的有界位置 XML。

常见的失败模式

丢失的文本层、无效的 UTF-8、不安全的 XML 扩展、格式错误的文档或工作空间耗尽会产生显式失败。

有用的例子

上传带有嵌入文本的 DjVu 并下载准确的 djvutxt UTF-8 输出。