
Umi-OCR 離線 OCR 實踐指南從下載到首次識別4 步處理批量圖片與 PDF【免費下載鏈接】Umi-OCROCR software, free and offline. 開源、免費的離線OCR軟件。支持截屏/批量導入圖片PDF文檔識別排除水印/頁眉頁腳掃描/生成二維碼。內置多國語言庫。項目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免費、開源、完全離線的 OCR 文字識別工具截圖識別、批量圖片識別、掃描版 PDF 轉文本、二維碼掃描與生成全部在本機完成。不聯網、不注冊、不上傳圖片識別次數不設上限。如果你經常截圖取字或者有一批圖片、一整本掃描 PDF 要處理這篇文章的完整流程大約 10 分鐘可以走通。第一次出結果從下載到首次截圖識別主界面由截圖OCR、批量OCR、文檔識別、二維碼、全局設置幾個標簽頁組成右上角可鎖定標簽頁防止誤關。按下面 4 步走拿發布包。到項目的 Release 頁下載.7z壓縮包沒有解壓軟件就選.7z.exe自解壓包雙擊即可解開。需要源碼時執行git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。解壓到純英文路徑。軟件無需安裝解壓即用。建議放D:\Tools\Umi-OCR這類目錄路徑里避開中文和空格。提示軟件內置 OCR 引擎和運行庫部分殺軟會誤報先把目錄加入白名單再啟動。啟動。Windows 雙擊Umi-OCR.exeLinux 自 v2.1.3 起支持運行umi-ocr.sh。首次啟動按系統語言自動切換界面要改界面語言進全局設置→語言/Language支持簡中、繁中、英文、日文、俄語、葡萄牙語等。跑第一個任務。打開截圖OCR標簽頁按快捷鍵喚起截圖框劃出屏幕上的文字區域識別結果立刻出現在右側記錄欄。按Esc可隨時取消截圖。把量提起來從一張截圖到一整本 PDF識別的量從單張擴到整批、整本標簽頁和設置各自對應下面是按規模遞進的三種用法。當你要處理單張截圖或一張復制來的圖片。截圖只是取圖的方式之一在別處復制一張圖片比如聊天窗口里的圖切回 Umi-OCR 直接粘貼效果相同。記錄欄里的文字支持直接編輯劃選多條記錄可一次復制。另外兩個順手的功能二維碼標簽頁支持截圖、粘貼、拖入圖片三種方式掃碼一張圖里多個碼一次讀出覆蓋 QRCode、EAN13、Code128 等 19 種碼制生成方向可選碼制和糾錯等級把文本直接輸出成二維碼圖片。當你要處理幾百張圖片。切到批量OCR標簽頁把圖片直接拖進窗口沒有數量上限。項目支持范圍輸入格式jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff輸出格式txt、jsonl、md、csv可直接用 Excel 打開長任務任務完成后自動關機/待機v2.1.2 起支持暫停任務不退出軟件時待機/休眠后可恢復右側面板逐張顯示耗時、置信度和識別結果跑完按上表選輸出格式。圖片角落的水印、LOGO 會混進結果處理方式批量頁右側設置里打開忽略區域編輯器按住右鍵在圖片上繪制多個矩形框。機制記死一條——只有整個文本塊完全落在框內才忽略按單個字符不算所以框要畫得足夠大把水印所有可能落位包住。當你要處理一整本文檔。v2.1.0 起文檔識別標簽頁支持pdf、xps、epub、mobi、fb2、cbz掃描版 PDF 是典型場景。處理邏輯是先挑現成的再補缺的解析器區分 PDF 自帶的文本層和掃描圖片層自帶文本的頁面直接提取只有純掃描頁才交給本地 OCR 引擎也可以反向操作整頁強制 OCR或只提取原文本。兩種成品輸出雙層可搜索 PDF底層保留原圖上層疊加透明文字層外觀與掃描件一致但可搜索、可復制適合合同歸檔、論文數字化。單層純文本 PDFv2.1.2 起文件更小、方便后續編輯只要文字的話選它。文檔識別同樣支持忽略區域v2.1.1 起可指定頁碼范圍把統一位置的頁眉頁腳一次性排除也支持任務完成后自動關機/待機。一整柜掃描舊書轉可搜索存檔這個標簽頁是主力。識別不理想按順序排查質量不滿意時別亂調參數按下面 3 個問題依次過一遍大部分問題定位到第三步就能解決。引擎選對了嗎判斷依據內置兩套引擎切換入口在全局設置的 OCR 插件選項里。識別不準、或干脆報錯先切到Rapid-OCR它是兼容性好的一套。追求速度用PaddleOCRv2.1.4 起默認把內存占用限制在系統總內存的一半以內想再壓低就在插件配置里調低線程數。順帶分清兩個概念界面語言管菜單按鈕顯示什么文字識別語言庫管引擎認哪種文字在各標簽頁的文字識別設置里單獨選擇或下載。界面用中文、日常識別日文書籍這種組合完全成立。排版方案對了嗎判斷依據字都認對了但行序混亂、段落粘連問題出在排版解析不在引擎。OCR 引擎吐出的是散裝文本塊排版解析器負責決定誰先誰后。內置預設按這個決策路徑選兩欄/三欄的論文、書籍 →多欄-按自然段換行默認后續要按行處理 →多欄-總是換行代碼截圖 →單欄-保留縮進保留行首縮進和行中空格拿不準 → 保持默認所有方案都自動處理橫排和豎排從右到左的排版。參數卡在哪對照現象定位參數現象調整位置做法長截圖/大圖識別不完整頁面設置 → 文字識別 →限制圖像邊長默認 960調高到 2880、4320 或無限制不要靠放大原圖解決過度放大引入噪聲內存占用偏高PaddleOCR 插件配置調低線程數截圖時屏幕閃爍、界面錯位全局設置→界面和外觀→渲染器切換渲染方案或關閉硬件加速接進你的自動化流程兩條程序化通道命令行和本地 HTTP 接口。命令行入口就是主程序Umi-OCR.exeLinux 為umi-ocr所有指令支持前綴簡寫--screenshot可寫成--sc。指令通過本地 HTTP 環回服務傳給后臺進程該服務默認開啟、僅監聽本地環回、不經過物理網卡軟件沒開或入口用錯RUN_GUI.bat這類備用啟動器不支持命令行指令就石沉大海。3 個最小可用示例umi-ocr --screenshot --clip截圖識別結果直接進剪貼板。umi-ocr --path D:\scans -- all.txt遞歸識別整個文件夾含子目錄結果追加到all.txt--等價于--output_append--是覆蓋寫入。umi-ocr --qrcode_create https://example.com D:\qr.png 256生成 256×256 像素的二維碼圖片末尾數字也可分開指定寬、高。需要程序化收結果時走 HTTP 接口更穩軟件運行期間本地 HTTP 服務暴露 OCR、文檔識別、二維碼等接口默認端口1224命令行受環境限制系統的管道重定向符、|可能失效。接口清單見 docs/http/README.md完整命令參數見 docs/README_CLI.md。常見問題命令行指令沒有任何反應原因指令靠本地 HTTP 服務傳遞服務被關了或入口不是主程序RUN_GUI.bat備用啟動器不支持命令行。 解決確認全局設置里 HTTP 服務處于開啟狀態默認開啟用Umi-OCR.exe作為入口重新執行。忽略區域畫了水印文字還在結果里原因矩形框只包住了文本塊的一部分或配置沒保存。機制是整塊忽略包住一半等于沒包。 解決把框畫到完全包含整個文本塊確認配置已保存后再跑任務。代碼截圖的縮進全亂了原因默認排版方案會合并空格。 解決排版解析方案切到單欄-保留縮進縮進和行中空格原樣保留。長圖識別結果缺頭少尾原因限制圖像邊長默認 960邊長超限的圖片被壓縮后才送進引擎。 解決頁面設置 → 文字識別里調高該數值2880、4320 或無限制不要直接放大原圖。旋轉了方向的掃描件提取出的文字位置錯位原因文檔識別提取 PDF 自帶文本層時早期版本沒有處理頁面旋轉。 解決v2.1.5 已修復升級到最新版再跑。拖入幾萬個文件的文件夾界面卡死原因超大文件夾同步加載占滿界面線程。 解決v2.1.5 起改為異步加載并顯示進度等進度跑完再操作加載期間不要連續提交任務。截圖時屏幕閃爍、界面錯位原因顯卡加速渲染在你的機器上不兼容。 解決全局設置→界面和外觀→渲染器切換渲染方案或直接關閉硬件加速。下一步拿到最新版 v2.1.5完成一次截圖識別讓第一條結果落在記錄欄里。在批量OCR頁把常用水印位置的忽略區域畫好并保存之后整批圖片直接拖入。要自動化的話先跑通umi-ocr --screenshot --clip這條命令確認命令行通道可用再接 HTTP 接口封裝成自己的小服務。【免費下載鏈接】Umi-OCROCR software, free and offline. 開源、免費的離線OCR軟件。支持截屏/批量導入圖片PDF文檔識別排除水印/頁眉頁腳掃描/生成二維碼。內置多國語言庫。項目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考