C#使用iText7将多个PDF文档合并为单个文档

使用HtmlAgilityPack抓取并分析网页内容,然后再调用PuppeteerSharp将网页生成PDF文件,最终的成果如下图所示,得到将近120个pdf文档。能看,但是不方便,需要逐个打开文档才能看到所需的内容,最好能将这些文档合并成单个文档,便于查看与保存。

  百度"C# 合并pdf文档",最终决定使用IText7,其GitHub主页介绍特点时就提到支持合并PDF文件,如下图所示:

  新建Winform项目,在Nuget包管理器中搜索并安装iText7,如下图所示。注意这里与iText相关的包有很多个,最初测试时错装了iTextSharp,关键类的名字和用法都差不多,直到编译和调试时才发现包装错了。

合并PDF文档最关键的类是PdfDocument和PdfMerger,前者用于打开PDF文档,后者则用于将多个文档合并到指定文档,关键代码如下所示,参照自iText7的GitHub主页示例(参考文献)。

csharp 复制代码
private void button2_Click(object sender, EventArgs e)
{
    PdfDocument pdfDoc = new PdfDocument(new PdfWriter(txtOutputFileName.Text));
    PdfMerger merger = new PdfMerger(pdfDoc);
    merger.SetCloseSourceDocuments(true);

    List<PdfDocument> pdfFiles = GetSourceDocuments();

    foreach (PdfDocument doc in pdfFiles)
    {
        merger.Merge(doc, 1, doc.GetNumberOfPages());
    }

    pdfDoc.Close();

    foreach(PdfDocument doc in pdfFiles)
    {
        doc.Close();
    }
}

private List<PdfDocument> GetSourceDocuments()
{
    List<PdfDocument> list = new List<PdfDocument>();
    foreach(ListViewItem item in listView1.Items)
    {
        list.Add(new PdfDocument(new PdfReader(item.Tag.ToString())));
    }

    return list;
}

实际运行过程中还出现如下错误,百度错误信息找到参考文献5,原因是漏装了itext7.bouncy-castle-adapter包,安装后即可正常运行程序。

bash 复制代码
InnerException	{"Either com.itextpdf:bouncy-castle-adapter or
com.itextpdf:bouncy-castle-fips-adapter 
dependency must be added in order to use BouncyCastleFactoryCreator"}	
System.Exception {System.NotSupportedException}



  最后是程序运行效果及合并后的文档效果,如下图所示:

还存在很多不足之处,比如没有书签,从八百多页中查找内容并跳转到指定内容处不方便,后续还会学习iText7的用法,完善合并PDF文档功能。

参考文献:

1\]https://itextpdf.com/ \[2\]https://github.com/itext/itext-dotnet \[3\]https://blog.csdn.net/qq_38628970/article/details/135478244 \[4\]https://github.com/itext/itext-publications-samples-dotnet/blob/master/itext/itext.samples/itext/samples/sandbox/merge/PdfDenseMergeExample.cs \[5\]https://blog.csdn.net/rebecca_cao/article/details/135185043

相关推荐
雪豹阿伟2 小时前
9.C# —— string拓展方法、StringBuilder高性能处理
c#·上位机
李星星_Alex2 小时前
如何通过 C# 抓取抖音 RTMP 推流码实现自主推流
c#·抖音
NiceCloud喜云2 小时前
Claude API PDF 文档问答实战:从原生解析到分页引用的完整方案
java·服务器·前端·网络·数据库·人工智能·pdf
qq7422349846 小时前
全面深入的C#核心知识体系与编程实践精要——从语法基础到高级特性系统学习指南
java·算法·c#
fai厅的秃头姐!7 小时前
2586. 统计范围内的元音字符串数
开发语言·c#
正运动技术8 小时前
C#运动控制开源(二): CAD导图和小线段速度前瞻优化
c#·正运动技术·运动控制器·运动控制卡·正运动控制器·运动控制开源·ethercat运动控制器
楼田莉子8 小时前
C#学习:分支与循环
服务器·后端·学习·c#
还是叫明9 小时前
C#使用YOLO26进行图像识别(目标检测)
opencv·yolo·目标检测·c#
魔法阵维护师10 小时前
从零开发游戏需要学习的c#模块,第二十三章(粒子效果 —— 让游戏“活”起来本课目标)
学习·游戏·c#
魔法阵维护师10 小时前
从零开发游戏需要学习的c#模块,第二十二章(音效与背景音乐)
学习·游戏·c#