
Umi-OCR 免费离线文字识别3 步上手截图、批量、PDF、脚本一次讲清【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 软件截图取字、批量图片识别、扫描版 PDF 转可搜索文档全部在本地完成不联网、图片不上传解压即用无需安装。读完这篇你能独立完成 Umi-OCR 截图识别的全流程把一个文件夹的扫描图批量转出 txt 和 Excel还能把识别能力挂进自己的脚本和 Web 服务。主界面左侧截图预览支持划选文字右侧记录栏按时间保存每次识别结果4 步跑通一次截图识别解压发布包。发布版是.7z压缩包或免装压缩软件的.7z.exe自解压包支持 Windows 7 x64 和 Linux x64没有安装器。解压后你会看到一个完整目录程序全在里面。启动程序。Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。你会看到主窗口弹出界面语言跟随系统设置自动切换。唤起截图。打开截图 OCR标签页按该页可自定义的快捷键。屏幕变暗、出现选框框住一块文字即可随时按Esc取消。拿到文字。识别完成后右侧记录面板多出一条文本点一下记录就复制到剪贴板左侧预览栏也支持直接划选。到这里最短路径已通截图 → 识别 → 复制。顺手可以进全局设置切换语言、主题或添加桌面快捷方式、设置开机自启。全局设置页可切换界面语言与主题管理桌面快捷方式和开机自启提取代码截图缩进原样贴进 IDE场景文档、视频帧里的代码想直接进 IDE普通 OCR 会吞掉缩进和行内空格。做法在截图 OCR页框选代码区域。右侧设置面板里把排版解析改为单栏-保留缩进。识别完成后在记录栏选中该条结果复制、粘贴。验收贴进 IDE 或 Markdown 预览缩进层级与原图一致、无多余空格即通过。避坑现象缩进全被拍平成一行行紧贴左边缘。原因默认排版解析是多栏-按自然段换行面向普通文档排版。解法代码类截图一律切换为单栏-保留缩进。引擎只负责认字排版解析负责把字块按阅读顺序拼回去两者分工不同方案选错结果就会不对味。记录面板支持划选多条记录批量复制、编辑后再复制右键菜单可删除单条或清空全部。截图 OCR 页左侧预览栏可划选文字右侧面板设置排版解析等参数识别记录面板右键菜单可复制、删除单条记录或清空全部批量导出识别结果整个文件夹一次出 txt 和 Excel练熟了单张截图就可以整批地喂。做法切到批量 OCR标签页点选择图片或直接把文件夹拖进来几百张图也能一次导入。核对输入格式jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff输出格式勾选txt / jsonl / md / csv (Excel)。点开始任务。你会看到左侧列表逐张显示耗时与置信度结束后每个文件都有对应产物。验收随机抽 3 张图对比左侧预览和右侧记录置信度0~1低于0.8的重点人工核对。避坑现象固定位置的水印、LOGO 文字混进结果。原因水印中的文本块被一起识别。解法右侧设置里打开忽略区域编辑器按住右键画矩形框住水印只有完整落在框内的文本块会被丢弃框画得略大一点更安全。现象像素超大的长图里小字认错。原因默认限制图像边长为960大图先被压缩小字糊掉。解法在设置 → 文字识别中把该值调到2880或4320。批量 OCR 页左侧列表逐张显示耗时和置信度右侧是识别记录把扫描 PDF 变成可搜索文档做法切到文档识别标签页v2.1.4 及以上版本支持拖入pdf / xps / epub / mobi / fb2 / cbz文件。产物是双层可搜索 PDF原图在底层识别出的文字藏在顶层能搜、能选版面不损失。同样可以设置忽略区域排除页眉页脚。验收打开生成的 PDF按CtrlF搜一个只在正文出现的词能直接跳到对应页说明文字层写对了。避坑现象页眉页脚的重复文字被识别进文本层。原因默认不排除固定区域。解法任务前进入忽略区域编辑器把页眉页脚位置框住再启动任务。把识别挂进脚本和流水线做法在全局设置确认 HTTP 服务已开启默认开启主机保持仅本地即可默认端口1224。命令行最简两条umi-ocr --screenshot --clip截图并复制结果umi-ocr --path D:/docs --output 结果.txt识别整个文件夹并写入文件。完整参数见 命令行手册。HTTP 走法先GET http://127.0.0.1:1224/api/ocr/get_options查参数定义再POST http://127.0.0.1:1224/api/ocr提交请求体 JSON 里base64放图片编码、options放语言模型与排版解析等选项。完整参数以 图片识别接口文档 和 HTTP 接口手册 为准文档识别也有对应的上传、查询、下载接口。验收命令行跑完文本出现在剪贴板或你指定的文件里浏览器访问get_options能看到 JSON 参数定义。避坑现象命令行任务时主窗口被弹出。原因命令行任务沿用截图 OCR标签页的参数设定。解法在该标签页里关掉弹出主窗口的对应选项。现象长时间连续调用偶发ECONNREFUSED。原因后端对并发支持较差。解法串行调用、失败重试一次即可具体注意事项以官方 HTTP 手册为准。参数速览真正值得动的就这几个参数默认值建议值原因排版解析多栏-按自然段换行代码截图选单栏-保留缩进缩进和阅读顺序全靠它默认方案会拍平代码缩进限制图像边长9602880 或 4320大图先被压缩小字容易糊语言/模型库简体中文纯英文、纯代码换models/config_en.txt中文模型认纯英文容易出怪字符OCR 引擎插件Rapid-OCR自带保持默认自带引擎兼容性好、速度快无需折腾所有界面改动会自动存进UmiOCR-data/.settingsini 格式也可以手动改完执行umi-ocr --reload重新加载。识别结果不对时先查这张表现象原因处理识别顺序错乱、读不通排版解析方案与该图排版不匹配换方案代码截图选单栏-保留缩进大图里小字认错默认边长限制 960 压缩了图片限制图像边长调到 2880 以上水印、LOGO 文字混入结果水印文本块被一并识别批量页画忽略区域把水印整块框住命令行 / HTTP 没反应HTTP 服务未开启全局设置中允许 HTTP 服务主机选仅本地连续调用偶发连接报错后端并发能力有限改为串行调用失败重试一次下一步从文档到源码Umi-OCR 是一个放在本地的 OCR 工具箱免费、离线截图、批量、PDF 一次覆盖还预留了命令行和 HTTP 两个口子给自动化。建议先在截图页练熟再去批量页处理文件夹想深入时命令行手册 与 HTTP 接口手册 是完整参考Python 源码在UmiOCR-data/py_src/目录可以直接翻。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考