phtyon读取pdf的远程地址解析内容

import xlwt,pymysql,requests,json,datetime,PyPDF2,urllib.request,io,ssl

添加context 解决读取pdf时SSL报错问题

context = ssl._create_unverified_context()

读取pdf地址 获取pdf内容

req = urllib.request.urlopen(contract_download_url,context=context)

remote_file=req.read()

memory_file = io.BytesIO(remote_file)

read_pdf = PyPDF2.PdfReader(memory_file)

获取pdf页数

number_of_pages = len(read_pdf.pages)

for i in range(0, number_of_pages):

pageObj = read_pdf.pagesi

获取当前页数的pdf内容

page = pageObj.extract_text()

处理后续业务流程 .......................

相关推荐
C^h5 小时前
python函数学习
人工智能·python·机器学习
Fanta丶5 小时前
4.Python set()集合、dict(字典、映射)、 数据容器的通用功能
python
决战灬5 小时前
langgraph之interrupt(理论篇)
人工智能·python·agent
兜客互动6 小时前
2026年AI关键词拓展挖掘软件,高效助力内容创作精准获流
人工智能·python
weixin_538601976 小时前
智能体测开Day30pytest测试框架
python
MC皮蛋侠客6 小时前
uv 系列(七):CI/CD、Docker 与私有索引——生产级交付
python·ci/cd·docker·uv
邪神与厨二病6 小时前
牛客周赛 Round 153
python·算法
yaoxin5211236 小时前
470. Java 反射 - Member 接口与 AccessFlag
java·开发语言·python
groundhappy6 小时前
idalib安装和codex ida-mcp配置
linux·开发语言·python
培之7 小时前
RTX 5090 安装 pytorch3d
人工智能·pytorch·python