ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OCRmyPDF 使用指南:给扫描版 PDF 加文本层的完整路径

OCRmyPDF 使用指南:给扫描版 PDF 加文本层的完整路径 OCRmyPDF 使用指南给扫描版 PDF 加文本层的完整路径【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描版 PDF 打开就是一张图片全文搜索搜不到复制粘贴只剩空格想引一句原文只能手敲。OCRmyPDF 是干这件事的标准答案——它给扫描页面上的图片加一层不可见的 OCR 文本文件看起来还是原来的样子却能被搜索、选中、复制。上面这种纯图像文档就是它最典型的输入。为什么工具选它做过 PDF OCR 的坑前人基本都踩过一遍文本层位置偏移导致复制出来一坨乱序、重音符号和多语言字符直接丢失、嵌入图片分辨率被偷偷重采样、输出文件大得离谱。OCRmyPDF 的思路反过来——它把原 PDF 当底座只对每页按需栅格化、跑 Tesseract 识别、再把文本层嵌回原位其余内容尽量不动。几个值得记住的硬指标输出默认是 PDF/A-2b归档标准美国法院系统都强制用它存扫描件同时输入输出都会做有效性校验文本层按原图精确分辨率生成复制粘贴顺序正确支持 Tesseract 的 100 种语言可混合识别自带图像优化输出文件经常比输入还小官方演示里压掉了 53.8%全程本地运行扫描件不离开你的机器多核并行数千页的文档也能扛住什么人会用到它个人用户手里存着几十 GB 扫描合同、病历、老票据想找某条信息只能一页页翻。跑一遍 OCRmyPDF以后CtrlF就是答案归档的还能顺手变成 PDF/A。扫描室和档案整理员面对的是整批文件一个目录几百份扫描件配 GNU Parallel 批量跑两三个命令处理完整个目录树还能按文件名追踪每份的输出。写自动化的开发者则直接当 Python 库用ocrmypdf.ocr()一行调起把它嵌进自己的流水线不用管子进程和命令行拼装。快速上手装包、装语言、跑第一个文件安装走系统包管理器Linux 用apt install ocrmypdfmacOS 用brew install ocrmypdf也提供 x64 和 ARM 的 Docker 镜像。识别什么语言取决于 Tesseract 的语言包装完要补上对应的包比如 Debian 系apt-get install tesseract-ocr-chi-sim就是简体中文。截图里就是一次完整运行的样子扫内容、并行 OCR、后处理最后报出压缩率和 PDF/A 校验结果。ocrmypdf -l engfra --deskew --rotate-pages input.pdf output.pdf这一行做三件事按英语法语识别、校正歪斜、自动转正旋转页面输出一个经过校验的 PDF/A。跑完用任何 PDF 阅读器打开CtrlF即可验证文本层已经就位。想省掉中间文件直接把输出写成同名文件就行处理失败时原文件不会被覆盖。高频问题速查识别结果全是乱码 → 语言选错了-l参数换成文档实际语言英文中文混排写-l engchi-sim输出比输入大 → 加--optimize 2并调低--jpeg-quality大多数情况能压回甚至更小终端出现 lots of diacritics 之类的 warning → 只是 Tesseract 的提示不代表失败看退出码为准文档本来就是数字生成的 PDF → 不用跑它只对含扫描图像的页面动刀纯文本页会自动跳过几百份文件 → 别手动循环find或parallel批量处理参考 批处理文档常用参数组合忘了 → 内置 cookbook 里按场景列好了现成命令进阶批量自动化与插件体系把 OCR 变成无人值守的流水线仓库里的 misc/batch.py 是一个现成的批量脚本样例misc/watcher.py 更进一步监听目录文件一出现就自动处理适合扫描仪输出文件夹这种场景。容器化部署看 docs/docker.md跨机器、CI 场景都能直接套。插件按项目口味改造处理链OCRmyPDF 内置插件机制可以替换栅格化器、OCR 引擎、过滤器等处理环节。仓库里 src/ocrmypdf/builtin_plugins/ 就是官方实现照着写一个自己的插件只需几十行插件规范详见 docs/plugins.md。对开发者而言它既是 CLI 工具也是可编程的 Python 库docs/api.md。命令行工具解决的是这一次插件加批量脚本解决的是每一次。对扫描件多的团队来说这套组合就是长期档案的搜索能力来源——装好它你的 PDF 就再也不会只有一张图了。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表