OCRmyPDF 是一个为扫描 PDF 文件添加 OCR 文本层的工具,使文档可搜索和复制。

所在地:
美国
语言:
en
收录时间:
2026-08-27
OCRmyPDFOCRmyPDF

核心定位

OCRmyPDF 是一款命令行工具,专门用于为扫描版 PDF 添加 OCR 文本层。处理后的文件在视觉上与原扫描件一致,但文字内容变为可搜索、可复制、可索引。

解决什么问题

扫描仪或手机拍摄生成的 PDF 本质上是图像集合,不包含任何文字信息。这导致:

  • 无法使用全文搜索定位内容
  • 无法复制粘贴其中的文字
  • 屏幕阅读器无法朗读,影响无障碍访问
  • 文档管理系统的索引功能失效

OCRmyPDF 通过在图像下方嵌入一层不可见的文字层来解决上述问题,同时保持原始页面渲染不变。

主要特性

特性 说明
OCR 引擎 默认使用 Tesseract,支持 100 多种语言
输出优化 可选生成 PDF/A 格式,适合长期归档
图像预处理 自动去歪斜、去噪、调整对比度以提升识别准确率
多页并行 利用多核 CPU 加速处理
元数据处理 保留或更新文档元数据、书签和注释

典型用法

基本命令十分简洁:

ocrmypdf input.pdf output.pdf

常用参数包括:

  • --language eng+chi_sim:指定 OCR 语言组合
  • --deskew:校正页面倾斜
  • --clean:清理扫描噪点
  • --skip-text:跳过已含文本层的页面,避免重复处理
  • --pdfa-image-compression jpeg:控制归档格式的压缩方式

适用场景

以下情况适合使用 OCRmyPDF:

  • 法律、医疗、财务等行业的纸质档案数字化
  • 学术文献扫描件的整理与检索
  • 政府信息公开中历史文件的电子化
  • 个人文档管理,如合同、票据、信件的归档

安装与依赖

OCRmyPDF 支持 Linux、macOS 和 Windows(通过 WSL 或原生安装)。安装前需确保系统已具备:

  • Python 3.8 或更高版本
  • Tesseract OCR 引擎及对应语言包
  • Ghostscript(用于 PDF 处理)
  • 可选:unpaper(图像清理)、JBIG2 编码器(压缩优化)

多数 Linux 发行版可通过包管理器一键安装,macOS 用户可使用 Homebrew,Windows 用户可借助 pip 配合 WSL 环境运行。

使用建议

对于批量处理任务,可结合 shell 脚本或 GNU Parallel 实现流水线操作。处理前建议先对少量样本进行参数调优,确认识别质量后再规模化执行。对于本身已含文本层的 PDF,使用 --skip-text 可显著减少处理时间。

相关导航