
Umi-OCR 免费离线文字识别截图取字、批量图片识别与 PDF 文档处理指南【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源的离线 OCR光学文字识别软件图片不上传、全程不联网截图取字、批量图片识别、扫描件 PDF 转可搜索文档都在本地完成。读完这篇你能独立跑通截图 → 识别 → 复制把一整个文件夹的图片批量转成 txt 和 Excel还能用一行命令把识别能力挂进自己的自动化流程。首次跑通4 步见到文字结果解压发布包。发布版是.7z压缩包或自解压的.7z.exeWindows 7 x64 和 Linux x64 都能用没有安装器。你会看到一个解压出的完整目录里面有Umi-OCR.exe、umi-ocr.sh和UmiOCR-data文件夹。双击Umi-OCR.exe启动Linux 下运行umi-ocr.sh。你会看到主窗口弹出界面语言跟随系统设置自动切换。打开截图OCR标签页按快捷键该页设置里可改鼠标框选一块文字区域。你会看到屏幕变暗、出现选框随时可按Esc取消。等识别完成点击右侧记录面板里那条结果。你会看到文本被复制进剪贴板左侧预览栏也能直接用鼠标划选文字。结果落在哪里剪贴板里就是这段文字CtrlV 粘到哪里都能用。进阶场景一代码截图带缩进原样取出谁会遇到这堵墙你经常在文档截图、视频帧里看到代码想直接贴进 IDE但普通 OCR 认完字就把缩进和行内空格拍平了贴回去还得手动重排。操作步骤在截图OCR标签页框选代码区域。右侧设置面板里把排版解析选成单栏-保留缩进。等识别完成选中这条记录复制。怎么算成功把结果贴进 IDE 或 Markdown 预览缩进层级和原图一致、没有多余空格就算过关。容易踩的坑默认排版解析是多栏-按自然段换行那是给普通文档用的套在代码上会打乱层级。原因很简单OCR 引擎只负责认字排版解析负责把字块按阅读顺序拼回去方案选错输出自然不对味。进阶场景二把一整个文件夹丢进批量识别操作步骤切到批量OCR标签页点选择图片或直接拖入文件夹几百张也能一次导入。核对输入格式jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff输出格式勾选txt / jsonl / md / csv (Excel)。点开始任务。你会看到左侧列表逐张显示耗时和置信度任务结束后每个文件都有对应的输出产物。怎么算成功随机抽 3 张图对比左侧预览和右侧记录置信度0~1低于0.8的那几张重点人工核对。容易踩的坑每张图固定位置有水印或 LOGO 时在右侧设置里进入忽略区域编辑器按住右键画矩形框住它。画得稍微大一点更安全因为只有完整落在框内的文本块才会被丢弃。像素超大的长图或小字多的大图到设置 → 文字识别 → 限制图像边长把数值调高默认960可选2880或4320否则大图先被压缩小字容易糊。扫描件 PDF 走文档识别标签页v2.1.4 及以上支持拖入文档支持pdf / xps / epub / mobi / fb2 / cbz同样能设忽略区域排除页眉页脚。产物是双层可搜索 PDF原图在底下文字藏在上层。用CtrlF搜一个只有正文才出现的词能直接跳到对应页就说明文字层写对了。进阶场景三把识别挂进脚本和流水线谁需要这一层你想把 OCR 放进定时任务、打包脚本或者自己的 Web 服务里不想再靠人手点界面。操作步骤在全局设置确认 HTTP 服务已开启主机保持仅本地默认端口1224。用命令行走法umi-ocr是Umi-OCR.exe的简写umi-ocr --screenshot --clip umi-ocr --path D:/docs --output 结果.txt umi-ocr --qrcode_read D:/code.png用 HTTP 走法先GET http://127.0.0.1:1224/api/ocr/get_options查参数定义再POST http://127.0.0.1:1224/api/ocr提交 base64 编码的图片。options字段放语言模型、排版解析等选项完整参数表在图片识别接口文档里。怎么算成功命令行跑完文本出现在剪贴板或你指定的文件里浏览器访问get_options能看到 JSON 参数定义。没反应的话九成是 HTTP 服务没开回全局设置查一下。容易踩的坑命令行任务沿用截图OCR标签页的参数设定。不希望任务执行时弹出主窗口就在那个标签页里关掉对应选项。真正要动的参数就这几个设置项默认值什么时候该动为什么排版解析多栏-按自然段换行识别代码截图时换成单栏-保留缩进引擎只管认字缩进和阅读顺序全靠它限制图像边长960大图、小字多时调到2880或4320默认值会先压缩大图小字容易糊识别语言/模型库简体中文纯英文、纯代码文档中文模型认纯英文容易出怪字符HTTP 服务主机仅本地需要局域网内其他机器调用时切到任何可用地址才对外开放OCR 引擎插件Rapid-OCR自带识别精度不够时再切换自带引擎兼容性好、够快所有界面改动会自动存进UmiOCR-data/.settingsini 格式也可以手动改改完执行umi-ocr --reload重新加载。结果不对时怎么办遇到什么多半是一步解决识别顺序错乱、读不通默认排版解析不适合这张图的排版换排版解析方案代码选单栏-保留缩进大图里的小字认错边长限制 960 先压缩了图片限制图像边长调到2880以上水印、LOGO 文字混进结果水印里的文本块被一起识别批量页画忽略区域把水印整块框住命令行 / HTTP 没反应HTTP 服务没开全局设置里允许 HTTP 服务主机选仅本地识别出的文字能搜但版面丢了生成的是单层 PDF文档识别里选择输出双层可搜索 PDF收尾Umi-OCR 像个放在本地的文字识别工具箱免费、不联网截图、批量、PDF 一次做完还留了命令行和 HTTP 两个口子给你接自动化。想继续深入命令行手册、HTTP 接口手册 和 Python 源码目录UmiOCR-data/py_src/就是完整参考。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考