解析pdf表格内容

复制代码
private List<List<String>> getMeetingTableList(MultipartFile file) {
    try {
        List<List<String>> allList = new LinkedList<>();
        PdfDocument pdf = new PdfDocument(file.getBytes());
        int num = pdf.getPages().getCount();//获取页数
        // 由于spire.office只可以获取前10页的pdf内容,所以拆分pdf
        int copies = num / 10;//份数
        int remainder = num % 10;//取余
        if (remainder > 0) {
            copies++;//取余大于0,份数加1
        }
        for (int j = 0; j < copies; j++) {
            PdfDocument doc = new PdfDocument();
            int start = j * 10;//拆分读取的起始页
            int end = (start + 9) > num - 1 ? num - 1 : start + 9;//结尾页
            doc.insertPageRange(pdf, start, end);//将读取到的数据初始话到新的PdfDocument 里面
            //创建一个PdfTableExtractor实例
            PdfTableExtractor extractor = new PdfTableExtractor(doc);

            for (int i = 0; i < 10; i++) {
                //将拆分出的新的PdfDocument 循环每一页做业务处理
                if (j == (copies - 1) && i == remainder) {
                    break;
                }
                //业务代码(可以提取文字、表格、图片等做相应的业务处理)
                PdfTable[] tableLists;
                for (int page = 0; page < doc.getPages().getCount(); page++) {
                    tableLists = extractor.extractTable(page);
                    if (tableLists != null && tableLists.length > 0) {
                        for (PdfTable table : tableLists) {
                            int row = table.getRowCount();
                            int column = table.getColumnCount();
                            List<List<String>> rowList = new LinkedList<>();
                            for (int h = 0; h < row; h++) {
                                List<String> lineList = new LinkedList<>();
                                for (int l = 0; l < column; l++) {
                                    String text = table.getText(h, l);
                                    if(StrUtil.isNotBlank(text)){
                                        text = text.replace("\n", "");
                                    }
                                    lineList.add(text);
                                }
                                rowList.add(lineList);
                            }
                            allList.addAll(rowList);
                        }
                    }
                }
                doc.close();
            }
        }
        return allList;
    } catch (IOException e) {
        log.error("站班会-解析pdf-异常:", e);
        throw new RuntimeException("站班会-解析pdf-失败");
    }
}
相关推荐
星花月3 小时前
【无标题】
ai·语言模型·pdf·deep learning
Chief_fly4 小时前
【Windows 下载 ARM64 deb 包 麒麟 ARM 离线安装】
arm开发·windows
阿昭L4 小时前
ZwQuerySystemInformation通过PsLoadedModuleList枚举内核模块
windows·逆向工程·windows内核
桑榆4168 小时前
双系统(Windows + Ubuntu)安装流程
linux·windows·ubuntu
走,带你去玩17 小时前
windows电脑 trae对接lanhu-mcp
windows
戒了,最后一次1 天前
Windows 安装 FFmpeg 完整教程(附环境变量配置 + 常用命令示例)
windows·ffmpeg
liulilittle1 天前
DeepSeek Harness 自定义模型提供商配置
前端·javascript·人工智能·windows·llm·deepseek·harness
fruge1 天前
Windows部署MiGPT GUI:小爱音箱接入大模型、TTS与自定义人设
windows
源码学社1 天前
DeerFlow Windows 本地运行教程(uv)
windows·uv·沙箱·deerflow·超级智能体·deerflow安装