Umi-OCR|免费离线文字识别:从截图到批量 PDF 文本提取

【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。 【免费下载链接】Umi-OCR 项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源(MIT 协议)的离线文字识别软件,专门解决"图片里的字怎么变成可编辑文本"的问题。它内置 PaddleOCR 和 RapidOCR 两套引擎,解压即用,全程不需要联网,文档不会离开你的电脑。

截图里的代码、扫进来的文档、带水印的发票

  • 从 API 文档截图里复制一段代码,粘贴出来却是一团乱序文本,换行和缩进全靠手动补。
  • 几十张扫描的纸质文档要归档成可搜索的文本,在线 OCR 要么排队、要么收费,敏感内容传上云不太放心。
  • 页面角落的水印、页眉页脚,总会混进识别结果,还得一条条手动删。

核心能力:四个标签页覆盖主要场景

Umi-OCR 支持 Windows 7 x64 与 Linux x64,下载 .7z 压缩包解压后运行 Umi-OCR.exe(Linux 用 umi-ocr.sh)即可,无需安装依赖。界面首次启动会自动匹配系统语言,也支持在"全局设置"里切换繁中、英语、日语等。

截图识别,排版解析自动排好文字顺序

打开"截图OCR"标签页,按界面提示的快捷键即可框选屏幕任意区域,识别结果列在右侧记录栏,可以编辑、划选、复制;在别处复制的图片也能直接粘贴进来识别。真正的亮点是"排版解析方案":多栏-按自然段换行单栏-保留缩进多栏-无换行等预设,会按你选的规则重排文字块,横排、竖排都能处理。代码截图选"保留缩进",就能拿到格式基本完好的文本。

批量导入图片,画矩形框排除水印

批量识别页支持把图片或文件夹直接拖进去,格式涵盖 jpg、png、webp、bmp、tiff 等,几百张图一次提交也没有数量上限,结果可保存为 txt、jsonl、md、csv(Excel)四种格式。如果图片带水印或页眉,可以在右栏设置里打开"忽略区域"编辑器,按住右键把干扰区域框起来,任务中框内的文字块会被整体跳过,不用识别完再手动删。

Umi-OCR 批量识别界面

识别 PDF,输出双层可搜索文档

文档识别页支持 pdf、xps、epub、mobi、fb2、cbz 格式:扫描件走 OCR,原有文本直接提取,也可以两者混合处理。输出可以选择"双层可搜索PDF"——保留原样外观的同时叠一层可选中、可搜索的文本,方便归档和全文检索。同样支持忽略区域排除页眉页脚,任务跑完还能设置自动关机或休眠。

二维码既能识别也能生成

二维码页可以截图、粘贴或拖入本地图片来扫码,支持一图多码和 19 种协议(QRCode、DataMatrix、EAN13、PDF417 等);反过来,输入一段文本也能生成二维码图片,协议、纠错等级等参数都可以调。

三个任务,照着做就行

任务一:截取屏幕上的一段文字。 打开截图OCR标签页,按快捷键框选区域,左侧看图片预览、右侧看识别结果,编辑后直接复制走。在别处复制过的图片,也可以粘贴进软件直接识别。

任务二:把一文件夹扫描图片转成文本。 打开批量OCR标签页,把整个文件夹拖进去,选好输出格式(txt 或 csv),提交任务。有水印的图先用忽略区域编辑器画好框再跑;如果图特别大,先在页面设置里把"限制图像边长"调高,否则精度会受影响。

任务三:PDF 扫描件转成可搜索文档。 文档识别页拖入 pdf 或 epub,勾选输出"双层可搜索PDF",提交后就能得到既保留版面、又能全文检索的文件。

选对引擎和排版方案,再用命令行 / API 自动化

选项适用场景说明
PaddleOCR 引擎复杂文档、多语言、倾斜文本发行版速度稍快,支持方向分类纠偏
RapidOCR 引擎日常截图、批量任务兼容性更好,占用低
排版:单栏-保留缩进代码截图保留行首缩进和行内空格
排版:多栏-按自然段换行论文、杂志等多栏版面自动识别栏序再按段落换行
输出 csv(Excel)需要进表格汇总的批量结果默认 ansi 编码,兼容 Office Excel

命令行调用。想跳过界面直接跑任务时,主程序本身就是命令行入口(Windows 下可简写为 umi-ocr,Linux 下为 umi-ocr.sh):

umi-ocr --path "D:/scan"            # 识别文件夹内所有图片
umi-ocr --screenshot --clip         # 截图识别,结果进剪贴板
umi-ocr --screenshot --output r.txt

HTTP 接口集成。把识别能力嵌进自己的脚本或系统时,在全局设置里允许 HTTP 服务(默认开启),即可向 http://127.0.0.1:1224 发请求:

import base64, requests
b64 = base64.b64encode(open("a.png","rb").read()).decode()
r = requests.post("http://127.0.0.1:1224/api/ocr",
    json={"base64": b64, "options": {"data.format": "text"}})
print(r.json()["data"])

完整的接口参数、文档识别的上传/轮询/下载流程,见仓库内的 命令行手册HTTP 接口手册

常见问题速查

你遇到的现象怎么处理
识别结果换行、顺序是乱的换一个排版解析方案,代码选"单栏-保留缩进"
水印、页眉混进了结果批量/文档页里打开忽略区域编辑器,把水印框起来
超大图识别精度差页面设置里把"限制图像边长"调高
Linux 下启动失败改用 umi-ocr.sh 启动脚本
截图时界面闪烁、错位全局设置 → 界面和外观 → 切换渲染器,或关闭硬件加速
外文识别不准切换引擎的识别语言模型库到对应语言

先解压发行版跑起来,打开截图识别标签页,按界面提示的快捷键截一段屏幕上的文字试试;有批量需求再把文件夹拖进批量页。更多功能说明可以看 README更新日志

【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。 【免费下载链接】Umi-OCR 项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

更多推荐