python办公自动化---pdf文件的读取、添加水印

需要安装包:pdfminer、pypdf2

一、读取pdf中的内容

python 复制代码
from pdfminer.converter import TextConverter
from pdfminer.layout import LAParams
from pdfminer.pdfdocument import PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.pdfpage import PDFPage
from pdfminer.pdfpage import PDFParser
from io import StringIO

# 缓冲区
output_String = StringIO()

# 按照二进制的模式读取文件
with open('./dataFile/测试文件转换.pdf', 'rb') as f:
    # 创建一个解析器对象
    parser1 = PDFParser(f)
    # 创建一个文档对象
    doc = PDFDocument(parser1)
    # 创建资源管理器对象
    rm = PDFResourceManager()
    # 创建设备对象
    device1 = TextConverter(rm, output_String, laparams=LAParams())
    # 创建解释器对象,用来处理pdf中每一页中的内容
    interpreter = PDFPageInterpreter(rm, device1)

    # 按页循环解析pdf文件
    for page in PDFPage.create_pages(doc):
        interpreter.process_page(page)

print(output_String.getvalue())

运行结果:

二、pdf添加水印

方法一:

python 复制代码
from PyPDF2 import PdfReader, PdfWriter
from reportlab.pdfgen import canvas
from reportlab.lib.pagesizes import letter
import io

"""方法一:从包含水印的文件中读取水印"""
waterMark_pdf = PdfReader('./dataFile/带水印的文件.pdf')
# 读取pdf第一页
waterMark = waterMark_pdf.getPage(0)

input_pdf = PdfReader("./dataFile/测试文件转换.pdf")
writer = PdfWriter

# 将水印加到pdf的每一页
for pageNo in range(input_pdf.getNumPages()):
    page = input_pdf.getPage(pageNo)
    page.mergePage(waterMark)
    # 将添加水印的pdf添加倒写
    writer.addPage(page)

# 将添加完水印的文件写入倒pdf中
with open("./dataFile/生成的水印文件.pdf", "wb") as f:
    writer.write(f)

方法二:

python 复制代码
from PyPDF2 import PdfReader, PdfWriter
from reportlab.pdfgen import canvas
from reportlab.lib.pagesizes import letter
import io


def create_watermark(watermark_text):
    """创建水印PDF"""
    packet = io.BytesIO()
    # 创建一个新的PDF with reportlab
    can = canvas.Canvas(packet, pagesize=letter)

    # 设置透明度
    can.setFillAlpha(0.3)
    # 设置字体和大小
    can.setFont("Helvetica", 60)

    # 获取页面尺寸
    width, height = letter

    # 计算水印位置(居中)
    text_width = can.stringWidth(watermark_text, "Helvetica", 60)
    x = (width - text_width) / 2
    y = height / 2

    # 旋转45度
    can.rotate(45)
    # 绘制水印文本(可能需要调整x,y偏移量)
    can.drawString(300, 100, watermark_text)

    can.save()

    # 移动到开始位置
    packet.seek(0)
    return PdfReader(packet)


def add_watermark(input_pdf, output_pdf, watermark_text="添加水印"):
    """为PDF文件添加水印"""
    # 创建水印
    watermark = create_watermark(watermark_text)

    # 读取原始PDF
    reader = PdfReader(input_pdf)
    writer = PdfWriter()

    # 为每一页添加水印
    for page in reader.pages:
        # 合并水印和原始页面
        page.merge_page(watermark.pages[0])
        writer.add_page(page)

    # 写入输出文件
    with open(output_pdf, "wb") as output_file:
        writer.write(output_file)


add_watermark("./dataFile/测试文件转换.pdf", "./dataFile/已添加水印.pdf", "添加水印")
print(f"水印已添加,输出文件为: {'./dataFile/已添加水印.pdf'}")
相关推荐
墨理学AI24 分钟前
一文学会一点python数据分析-小白原地进阶(mysql 安装 - mysql - python 数据分析 - 学习阶段梳理)
python·mysql·数据分析
数研小生31 分钟前
亚马逊商品列表API详解
前端·数据库·python·pandas
独好紫罗兰31 分钟前
对python的再认识-基于数据结构进行-a005-元组-CRUD
开发语言·数据结构·python
jianghua00143 分钟前
Python中的简单爬虫
爬虫·python·信息可视化
喵手1 小时前
Python爬虫实战:针对Python官网,精准提取出每一个历史版本的版本号、发布日期以及对应的文档/详情页链接等信息,并最终清洗为标准化的CSV文件!
爬虫·python·爬虫实战·零基础python爬虫教学·python官方数据采集·采集历史版本版本号等信息·导出csv文件
databook1 小时前
像搭积木一样思考:数据科学中的“自下而上”之道
python·数据挖掘·数据分析
luoluoal1 小时前
基于python的医疗问句中的实体识别算法的研究(源码+文档)
python·mysql·django·毕业设计·源码
啊阿狸不会拉杆1 小时前
《机器学习导论》第 9 章-决策树
人工智能·python·算法·决策树·机器学习·数据挖掘·剪枝
喵手1 小时前
Python爬虫实战:城市停车收费标准自动化采集系统 - 让停车费透明化的技术实践(附CSV导出 + SQLite持久化存储)!
爬虫·python·爬虫实战·零基础python爬虫教学·城市停车收费标准·采集城市停车收费数据·采集停车数据csv文件导出
无水先生1 小时前
python函数的参数管理(01)*args和**kwargs
开发语言·python