
Caffe
Caffe 是一个深度学习框架,专注于速度、模块化和表达性。
OCRmyPDF 是一个为扫描 PDF 文件添加 OCR 文本层的工具,使文档可搜索和复制。
OCRmyPDF 是一款命令行工具,专门用于为扫描版 PDF 添加 OCR 文本层。处理后的文件在视觉上与原扫描件一致,但文字内容变为可搜索、可复制、可索引。
扫描仪或手机拍摄生成的 PDF 本质上是图像集合,不包含任何文字信息。这导致:
OCRmyPDF 通过在图像下方嵌入一层不可见的文字层来解决上述问题,同时保持原始页面渲染不变。
| 特性 | 说明 |
|---|---|
| OCR 引擎 | 默认使用 Tesseract,支持 100 多种语言 |
| 输出优化 | 可选生成 PDF/A 格式,适合长期归档 |
| 图像预处理 | 自动去歪斜、去噪、调整对比度以提升识别准确率 |
| 多页并行 | 利用多核 CPU 加速处理 |
| 元数据处理 | 保留或更新文档元数据、书签和注释 |
基本命令十分简洁:
ocrmypdf input.pdf output.pdf
常用参数包括:
--language eng+chi_sim:指定 OCR 语言组合--deskew:校正页面倾斜--clean:清理扫描噪点--skip-text:跳过已含文本层的页面,避免重复处理--pdfa-image-compression jpeg:控制归档格式的压缩方式以下情况适合使用 OCRmyPDF:
OCRmyPDF 支持 Linux、macOS 和 Windows(通过 WSL 或原生安装)。安装前需确保系统已具备:
多数 Linux 发行版可通过包管理器一键安装,macOS 用户可使用 Homebrew,Windows 用户可借助 pip 配合 WSL 环境运行。
对于批量处理任务,可结合 shell 脚本或 GNU Parallel 实现流水线操作。处理前建议先对少量样本进行参数调优,确认识别质量后再规模化执行。对于本身已含文本层的 PDF,使用 --skip-text 可显著减少处理时间。







