python办公自动化---pdf文件的读取、添加水印

需要安装包:pdfminer、pypdf2

一、读取pdf中的内容

python 复制代码
from pdfminer.converter import TextConverter
from pdfminer.layout import LAParams
from pdfminer.pdfdocument import PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.pdfpage import PDFPage
from pdfminer.pdfpage import PDFParser
from io import StringIO

# 缓冲区
output_String = StringIO()

# 按照二进制的模式读取文件
with open('./dataFile/测试文件转换.pdf', 'rb') as f:
    # 创建一个解析器对象
    parser1 = PDFParser(f)
    # 创建一个文档对象
    doc = PDFDocument(parser1)
    # 创建资源管理器对象
    rm = PDFResourceManager()
    # 创建设备对象
    device1 = TextConverter(rm, output_String, laparams=LAParams())
    # 创建解释器对象,用来处理pdf中每一页中的内容
    interpreter = PDFPageInterpreter(rm, device1)

    # 按页循环解析pdf文件
    for page in PDFPage.create_pages(doc):
        interpreter.process_page(page)

print(output_String.getvalue())

运行结果:

二、pdf添加水印

方法一:

python 复制代码
from PyPDF2 import PdfReader, PdfWriter
from reportlab.pdfgen import canvas
from reportlab.lib.pagesizes import letter
import io

"""方法一:从包含水印的文件中读取水印"""
waterMark_pdf = PdfReader('./dataFile/带水印的文件.pdf')
# 读取pdf第一页
waterMark = waterMark_pdf.getPage(0)

input_pdf = PdfReader("./dataFile/测试文件转换.pdf")
writer = PdfWriter

# 将水印加到pdf的每一页
for pageNo in range(input_pdf.getNumPages()):
    page = input_pdf.getPage(pageNo)
    page.mergePage(waterMark)
    # 将添加水印的pdf添加倒写
    writer.addPage(page)

# 将添加完水印的文件写入倒pdf中
with open("./dataFile/生成的水印文件.pdf", "wb") as f:
    writer.write(f)

方法二:

python 复制代码
from PyPDF2 import PdfReader, PdfWriter
from reportlab.pdfgen import canvas
from reportlab.lib.pagesizes import letter
import io


def create_watermark(watermark_text):
    """创建水印PDF"""
    packet = io.BytesIO()
    # 创建一个新的PDF with reportlab
    can = canvas.Canvas(packet, pagesize=letter)

    # 设置透明度
    can.setFillAlpha(0.3)
    # 设置字体和大小
    can.setFont("Helvetica", 60)

    # 获取页面尺寸
    width, height = letter

    # 计算水印位置(居中)
    text_width = can.stringWidth(watermark_text, "Helvetica", 60)
    x = (width - text_width) / 2
    y = height / 2

    # 旋转45度
    can.rotate(45)
    # 绘制水印文本(可能需要调整x,y偏移量)
    can.drawString(300, 100, watermark_text)

    can.save()

    # 移动到开始位置
    packet.seek(0)
    return PdfReader(packet)


def add_watermark(input_pdf, output_pdf, watermark_text="添加水印"):
    """为PDF文件添加水印"""
    # 创建水印
    watermark = create_watermark(watermark_text)

    # 读取原始PDF
    reader = PdfReader(input_pdf)
    writer = PdfWriter()

    # 为每一页添加水印
    for page in reader.pages:
        # 合并水印和原始页面
        page.merge_page(watermark.pages[0])
        writer.add_page(page)

    # 写入输出文件
    with open(output_pdf, "wb") as output_file:
        writer.write(output_file)


add_watermark("./dataFile/测试文件转换.pdf", "./dataFile/已添加水印.pdf", "添加水印")
print(f"水印已添加,输出文件为: {'./dataFile/已添加水印.pdf'}")
相关推荐
AAI机器之心6 分钟前
这个RAG框架绝了:无论多少跳,LLM只调用两次,成本暴降
人工智能·python·ai·llm·agent·产品经理·rag
Fairy要carry7 分钟前
项目01-手搓Agent之loop
前端·javascript·python
郝学胜-神的一滴22 分钟前
【技术实战】500G单行大文件读取难题破解!生成器+自定义函数最优方案解析
开发语言·python·程序人生·面试
愤豆26 分钟前
02-Java语言核心-语法特性-注解体系详解
java·开发语言·python
AI视觉网奇32 分钟前
vllm 踩坑记录 算力匹配
pytorch·python·深度学习
2301_8227828241 分钟前
自动化与脚本
jvm·数据库·python
qq_1481153743 分钟前
为你的Python脚本添加图形界面(GUI)
jvm·数据库·python
AndrewMe82111 小时前
detailed-docx:一个能保住格式的 Word 文档操作库
开发语言·python·word
智算菩萨1 小时前
【OpenGL】6 真实感光照渲染实战:Phong模型、材质系统与PBR基础
开发语言·python·游戏引擎·游戏程序·pygame·材质·opengl
2401_878530211 小时前
机器学习与人工智能
jvm·数据库·python