ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

3条命令把扫描PDF变成可搜索文档:OCRmyPDF上手指南

3条命令把扫描PDF变成可搜索文档:OCRmyPDF上手指南 3条命令把扫描PDF变成可搜索文档OCRmyPDF上手指南【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描件里翻找一条合同条款你得一页页人肉盯着看。OCRmyPDF 给扫描PDF加一层OCR文本让它能被搜索和复制。读完本文你可以装好它跑通第一条命令并掌握批量和多语言用法。值不值得用先对号入座适合谁经常处理扫描PDF、需要全文检索或复制文字的人。典型场景合同条款定位、教材电子化、票据归档、学术文献管理。边界它处理的是图片化的PDF。如果文件本身就是可复制的文本PDF或你需要的是把文字改成可编辑Word它帮不上忙。60秒上手安装第一条命令先按系统装好它Linux/Windows/macOS/FreeBSD 都支持apt install ocrmypdf # Debian/Ubuntu brew install ocrmypdf # macOS装好依赖的 Tesseract OCR 引擎和 Ghostscript 后跑第一份文件ocrmypdf input.pdf output.pdf一句人话它把input.pdf里每页的图片做一次文字识别输出一份看起来不变、但能搜索的output.pdf。上面是一张典型的扫描输入纯图像、没有文本层。跑完命令后同样的页面就带上了可复制的文字。核心能力拆解1. 给扫描件垫一层隐形文字识别出的文字被精确排在原图正下方肉眼看不到但复制、搜索都按文字来。相当于给扫描件垫了一张透明底稿。ocrmypdf --deskew --rotate-pages input.pdf output.pdf一句人话--deskew把歪掉的页拉正--rotate-pages把横竖放错的页转正识别前先摆正准确率更稳。2. 一次认多种语言它靠 Tesseract 的语言包认字支持 100 语言。ocrmypdf -l engchi_sim mixed.pdf searchable.pdf一句人话-l后跟语言代码用连多个。中文需先装对应语言包例如apt-get install tesseract-ocr-chi-sim。3. 输出更耐存的 PDF/A它默认倾向输出符合长期存档标准的 PDF/A并顺带优化图片、常常让文件比输入还小。ocrmypdf --output-type pdfa --optimize 2 big.pdf small.pdf一句人话--optimize0~3 控制压缩力度--output-type pdfa让结果适合归档。实战场景批量转换一整个文件夹假设./scans/下是一堆待处理扫描件一条命令搞定find ./scans -name *.pdf -exec ocrmypdf {} {}.ocr.pdf \;一句人话找到每个*.pdf处理后的文件加.ocr.pdf后缀不会覆盖原件。常用参数对照按需组合参数作用什么时候用--deskew校正页面倾斜扫描页普遍歪斜时--rotate-pages自动转正页面页面横竖放错--force-ocr强制对所有页识别原文件已有部分文本、想统一重建--oversample 600提高识别分辨率原始扫描偏糊、字太小--jobs 4用多核并行大文件、图多想快一点常见问题现象识别一堆乱码怀疑是识别错。原因没告诉它语言或该页文字太糊。 解决指定语言并提高采样。ocrmypdf -l chi_sim --oversample 600 bad.pdf fixed.pdf现象页面歪斜文字认不准。原因扫描时页面没放正。 解决识别前先摆正。ocrmypdf --deskew --rotate-pages slanted.pdf straight.pdf现象文件里本来就有文本不想重复识别。原因默认模式会智能处理已有文本层。 解决用--skip-text跳过已有文字或--redo-ocr重建。ocrmypdf --skip-text partial.pdf out.pdf现象想留一份纯文本备份。原因默认只出 PDF。 解决用--sidecar额外生成文本文件。ocrmypdf --sidecar text.txt input.pdf output.pdf小结回到开头的场景那条合同条款现在用搜索框就能定位。想继续深入可以看内置帮助ocrmypdf --help或翻 docs/index.md 的完整文档。装上它跑通第一条命令你就有了一份能搜索、能复制的扫描文档。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表