Python 处理小语种 PDF 的编码坑:重音字符、连字与 (cid:xx) 乱码的解决方案做 PDF 翻译预处理时,英语文档基本不出幺蛾子,但一到西班牙语、法语、德语文档,各种"灵异现象"就来了:é 变 é、office 变 office、整段文字变成 (cid:123) 编号。这些问题的根源都指向同一个环节——PDF 的字符编码与 Unicode 映射。本文用本机实测把三个最常见的坑复现一遍,每个坑给出可直接复制的解决方案。环境:Python 3.13,pymupdf 1.28.2 / pdfplumber 0.11.10 / pypdf 6.18.0,测试用 fpdf2 2.8.8 构造。