private List<List<String>> getMeetingTableList(MultipartFile file) {
try {
List<List<String>> allList = new LinkedList<>();
PdfDocument pdf = new PdfDocument(file.getBytes());
int num = pdf.getPages().getCount();//获取页数
// 由于spire.office只可以获取前10页的pdf内容,所以拆分pdf
int copies = num / 10;//份数
int remainder = num % 10;//取余
if (remainder > 0) {
copies++;//取余大于0,份数加1
}
for (int j = 0; j < copies; j++) {
PdfDocument doc = new PdfDocument();
int start = j * 10;//拆分读取的起始页
int end = (start + 9) > num - 1 ? num - 1 : start + 9;//结尾页
doc.insertPageRange(pdf, start, end);//将读取到的数据初始话到新的PdfDocument 里面
//创建一个PdfTableExtractor实例
PdfTableExtractor extractor = new PdfTableExtractor(doc);
for (int i = 0; i < 10; i++) {
//将拆分出的新的PdfDocument 循环每一页做业务处理
if (j == (copies - 1) && i == remainder) {
break;
}
//业务代码(可以提取文字、表格、图片等做相应的业务处理)
PdfTable[] tableLists;
for (int page = 0; page < doc.getPages().getCount(); page++) {
tableLists = extractor.extractTable(page);
if (tableLists != null && tableLists.length > 0) {
for (PdfTable table : tableLists) {
int row = table.getRowCount();
int column = table.getColumnCount();
List<List<String>> rowList = new LinkedList<>();
for (int h = 0; h < row; h++) {
List<String> lineList = new LinkedList<>();
for (int l = 0; l < column; l++) {
String text = table.getText(h, l);
if(StrUtil.isNotBlank(text)){
text = text.replace("\n", "");
}
lineList.add(text);
}
rowList.add(lineList);
}
allList.addAll(rowList);
}
}
}
doc.close();
}
}
return allList;
} catch (IOException e) {
log.error("站班会-解析pdf-异常:", e);
throw new RuntimeException("站班会-解析pdf-失败");
}
}
解析pdf表格内容
经典19922026-08-15 11:06
相关推荐
星花月3 小时前
【无标题】Chief_fly4 小时前
【Windows 下载 ARM64 deb 包 麒麟 ARM 离线安装】阿昭L4 小时前
ZwQuerySystemInformation通过PsLoadedModuleList枚举内核模块桑榆4168 小时前
双系统(Windows + Ubuntu)安装流程走,带你去玩17 小时前
windows电脑 trae对接lanhu-mcp戒了,最后一次1 天前
Windows 安装 FFmpeg 完整教程(附环境变量配置 + 常用命令示例)liulilittle1 天前
DeepSeek Harness 自定义模型提供商配置fruge1 天前
Windows部署MiGPT GUI:小爱音箱接入大模型、TTS与自定义人设源码学社1 天前
DeerFlow Windows 本地运行教程(uv)