Linux笔记--基于OCRmyPDF将扫描件PDF转换为可搜索的PDF

1--官方仓库

https://github.com/ocrmypdf/OCRmyPDF

2--基本步骤

bash 复制代码
# 安装ocrmypdf库
sudo apt install ocrmypdf

# 安装简体中文库
sudo apt-get install tesseract-ocr-chi-sim

# 转换
# -l 表示使用的语言
# --force-ocr 防止出现以下错误:ERROR - PriorOcrFoundError: page already has text! - aborting (use --force-ocr to force OCR)
# input.pdf 表示待转换的pdf
# output.pdf 表示转换后保存的pdf
ocrmypdf -l chi_sim input.pdf output.pdf --force-ocr

3--常见错误

Error1:

ERROR - PriorOcrFoundError: page already has text! - aborting (use --force-ocr to force OCR)

Solution:

添加--force-ocr

ocrmypdf -l chi_sim input.pdf output3.pdf --force-ocr

相关推荐
硅基手札12 小时前
【Linux 内核专栏 13】快IO层
linux·服务器·嵌入式硬件
嵌入式分享13 小时前
嵌入式分享#63:RK3588 怎么选?全系列选型指南
linux
Pointer Pursuit13 小时前
Linux调试器 ——gdb/cgdb
linux·运维·服务器
chenlance13 小时前
PADS灌铜、覆铜过程和技巧小汇总
linux·服务器·网络
HideF13 小时前
【无标题】
linux
高山有多高13 小时前
【Linux笔记】NAT与内网穿透
linux
迷途之人不知返14 小时前
自主实现一个简单的shell命令行
linux
顺风尿一寸15 小时前
深入 Linux 6.18 挂载机制:从 VFS 到 ext4 的完整调用链
linux
她说彩礼65万15 小时前
C语言 assert
java·linux·c语言
lcj251115 小时前
【Linux】 Makefile 详解
linux·笔记·面试