
OCRmyPDF 完整上手指南給掃描版 PDF 加上可搜索的文字層【免費(fèi)下載鏈接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched項(xiàng)目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一個(gè)命令行 OCR 工具它給掃描版 PDF 添加一層可搜索的文字而不改動(dòng)原有頁(yè)面外觀。適合手里有一堆掃描 PDF、想把它們變成可搜索、可復(fù)制文檔的人。本文帶你從零裝好它并跑通第一份可搜索 PDF。它解決什么問題識(shí)別出的文字精確壓在圖片下方復(fù)制粘貼不會(huì)錯(cuò)位默認(rèn)輸出 PDF/A 格式適合長(zhǎng)期存檔基于 Tesseract 引擎支持 100 多種語言可自動(dòng)校正歪斜頁(yè)面并用滿所有 CPU 核心三步裝好運(yùn)行環(huán)境以下以 LinuxDebian/Ubuntu為例macOS 與 Windows 的思路相同。# Debian / Ubuntu apt install ocrmypdf # macOS brew install ocrmypdfWindows 或 WSL 用戶先安裝 Tesseract OCR 與 Ghostscript再執(zhí)行pip install ocrmypdf需要 Python 3.11 及以上。裝完驗(yàn)證一下ocrmypdf --version ocrmypdf --help能看到版本號(hào)就說明環(huán)境就緒。如果后續(xù)想讀源碼主體代碼在 src/ocrmypdf/ 目錄命令行入口在 src/ocrmypdf/cli.py。一條命令跑通第一個(gè)掃描 PDF準(zhǔn)備一份純掃描的 PDF或一張掃描照片然后執(zhí)行ocrmypdf input.pdf output.pdf運(yùn)行后你會(huì)看到進(jìn)度條依次顯示 Scanning、OCR、Postprocessing、PDF/A conversion 等階段最后得到一份通常比原文件更小、卻能用閱讀器搜索和復(fù)制文字的 PDF。常用參數(shù)速查處理外文或掃描質(zhì)量不佳的文件時(shí)調(diào)整參數(shù)是關(guān)鍵參數(shù)作用示例值-l/--language指定識(shí)別語言可多語言疊加eng、engfra、chi_sim--rotate-pages自動(dòng)旋轉(zhuǎn)放倒的頁(yè)面無需值--deskew校正傾斜的頁(yè)面無需值--optimize壓縮等級(jí)0 不壓縮1默認(rèn)、2、3--output-type輸出格式默認(rèn)即為 PDF/Apdfa、pdfa-2?? 提示語言代碼用錯(cuò)會(huì)直接報(bào) Language data not available先用系統(tǒng)包管理器安裝對(duì)應(yīng)語言包再運(yùn)行。參數(shù)還不夠用時(shí)可以在腳本里直接調(diào) API把它集成進(jìn)自己的流水線import ocrmypdf ocrmypdf.ocr(input.pdf, output.pdf, languageeng)高頻報(bào)錯(cuò)與修復(fù)page already has text! – aborting→ 文件里已有文字層OCRmyPDF 默認(rèn)拒絕重復(fù)識(shí)別 → 用ocrmypdf --force-ocr強(qiáng)制重做或用--skip-text跳過已有文字的頁(yè)Input file is not a valid PDF→ 文件損壞或傳輸不完整 → 用 Ghostscript 重寫gs -o output.pdf -dSAFER -sDEVICEpdfwrite input.pdfTesseract cannot open its config file hocr→ 手動(dòng)拼裝的 tessdata 目錄缺少 configs 配置 → 改用系統(tǒng)包管理器安裝完整的 Tesseract?? 提示如果識(shí)別結(jié)果為空但沒有報(bào)錯(cuò)多半是語言數(shù)據(jù)不完整排錯(cuò)細(xì)節(jié)可參考項(xiàng)目文檔 docs/errors.md。下一步可以做什么查閱 docs/ 官方文檔了解批量處理、PDF 安全等進(jìn)階用法嘗試 Docker 部署見 docs/docker.md適合跑大批量文件參考 misc/batch.py 的批量腳本思路把自己的掃描件整理成流水線【免費(fèi)下載鏈接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched項(xiàng)目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考