ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OCRmyPDF 处理速度慢时如何用 --optimize 0、--output-type pdf 等设置提速

OCRmyPDF 处理速度慢时如何用 --optimize 0、--output-type pdf 等设置提速 OCRmyPDF 处理速度慢时如何用 --optimize 0、--output-type pdf 等设置提速【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF如果你发现 OCRmyPDF 当前版本比旧版本6.x 及更早慢原因很明确从 6.x 之后OCRmyPDF 在 OCR 完成后新增了图像优化这一后处理步骤并且默认开启。docs/performance.md 中给出了针对性的提速设置。本文介绍如何在保持 OCR 结果的前提下通过命令行参数关掉这些默认的后处理缩短整体运行时间。以下命令均以标准用法ocrmypdf input.pdf output.pdf为基础input.pdf和output.pdf换成你的实际文件。先加 --optimize 0 和 --output-type pdfdocs/performance.md 列出的第一组提速设置ocrmypdf --optimize 0 --output-type pdf input.pdf output.pdf--optimize 0禁用文件体积优化。优化器默认以-O1级别运行无损优化如把图像转码为更高效的格式、启用 PDF 对象流设为 0 后这部分后处理基本不再执行。docs/optimizer.md 还给出了简写形式-O0两者等价。--output-type pdf禁用 PDF/A 生成。生成 PDF/A 会经过 Ghostscript 转换并附带一些 JPEG 等有损优化改用pdf后不产生 PDF/A也没有这类有损优化见 docs/optimizer.md 中 Lossy optimizations 一节。--output-type从 17.0.0 起默认值是auto若已安装 veraPDFauto会尝试不经过 Ghostscript 的试探性 PDF/A 转换未安装 veraPDF 时则回退到 Ghostscript见 docs/advanced.md 中 Speculative PDF/A conversion 一节。如果你本来就只想要普通 PDF 而不需要 PDF/A 归档显式指定--output-type pdf行为最确定。进一步关闭 fast web view 与大图处理如果前两项还不够docs/performance.md 继续建议--fast-web-view 999999禁用 fast web view 优化即 PDF 线性化把资源按顺序显示需要的方式排列。docs/optimizer.md 说明使用ocrmypdf --optimize 0 ...或-O0时该优化会一并被禁用。--skip-big当某些页面含有超大图像、导致 OCR 时间过长时用--skip-big N跳过超过 N 百万像素的图像。docs/advanced.md 给出的参考300 DPI 的 8.5×11 英寸页面约 8.4 百万像素并提供了文档示例命令ocrmypdf --tesseract-timeout 300 --skip-big 50 bigfile.pdf output.pdf文档未给出--skip-big的默认值实际应跳过多大尺寸的图像需按你的文件自行决定被跳过的页面会不做 OCR 地插入输出。避免额外加重的选项docs/performance.md 除了上述四项设置还建议避免两类选项--force-ocr新写法--mode force把所有页面栅格化为图像再整体 OCR包括本来已有文本的页面。docs/advanced.md 说明该模式会丢弃隐藏 OCR 文本、栅格化可打印文本并压平表单字段代价是所有页面都要重走一遍栅格化与识别流程。图像预处理--deskew、--clean、--clean-final等选项见 docs/cookbook.md 的 Image processing 一节。它们用于改善识别质量但会增加处理时间。如果速度是首要目标且扫描质量尚可不必开启。可选只处理部分页面若慢只集中在文件的某几页还可以用--pages把 OCR 限制到指定页面逗号分隔、连字符表示范围支持end表示最后一页docs/cookbook.md Process only certain pages 一节ocrmypdf --pages 2,3,13-17 input.pdf output.pdf注意 docs/cookbook.md 同时提醒无论--pages怎么指定OCRmyPDF 仍会对整个文件执行优化和 PDF/A 转换这些是全文件操作。因此想同时跳过这两步文档给出的组合示例是ocrmypdf --pages 1 --output-type pdf --optimize 0 input.pdf output.pdf限制与结果检查即使使用--optimize 0也不是完全没有优化。docs/optimizer.md 指出OCRmyPDF 始终会自动把 RLE、LZW 等旧压缩方案替换为 Deflate并把单色图像转为 CCITT G4同时压缩其他未压缩对象——这一步是无损的没有任何方式可以禁用它。优化发生在 OCR 之后且只在 OCR 成功时进行docs/optimizer.md。判断本次运行是否正常可看 stderr 输出docs/advanced.md Return code policy 一节说明OCRmyPDF 的所有消息都写到 stderr且返回码属于稳定用户接口的一部分。命令正常结束、stderr 中没有错误信息即表示该文件处理完成。--optimize 0与--output-type pdf的代价是输出不再经过体积优化也不会生成 PDF/A 归档格式。若你本来就需要 PDF/A 长期存档这些提速设置就不能照搬只能在接受速度的前提下运行。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表