pdf

huaweichenai1 天前
java·spring boot·pdf
spring boot操作PDF在sping boot中常用的操作PDF的的有以下三种
开开心心就好2 天前
前端·javascript·支持向量机·智能手机·pdf·html·启发式算法
批量提取PDF中的图片,直接导出原图软件介绍之前有小伙伴提过,想要一个能把 PDF 里的图片提取出来的工具。这类工具其实选择还不少,比如之前聊过的 PDFImageViewer 就挺好用。今天再补一款 PDF 图片导出工具,名字叫 PDFImageTool,主要干的活就是把 PDF 里的图片批量导出来。
泡海椒3 天前
java·开发语言·pdf
PDF 表格样式优化:jquick-pdf 边框、圆角、背景色报表的可读性往往不取决于数据量,而取决于视觉层次:哪里是表头,哪里是数据,行与行之间靠什么分隔。用 iText 或 PDFBox 实现边框、填充和圆角时,通常需要直接操作绘制对象,样式改动会渗入业务代码。jquick-pdf 允许在元素 style 中声明这些样式,把报表的视觉调整留在模板层。本文围绕表格与单元格的边框、背景色、下边框分隔线以及圆角的实现方式展开。
泡海椒3 天前
java·开发语言·pdf
jquick-pdf 表格实战:动态数据 PDF 报表生成销售日报、库存清单、对账单这类报表结构高度规则,真正的工作量在于行数不固定:有多少条记录,就要输出多少行。用 iText 或 PDFBox 逐行创建 Cell、单独设置字体并处理分页,代码量大,且每次增删字段都要回归。jquick-pdf 使用类 HTML 模板,后端只需要把查询结果变成表格行,布局与分页交给引擎。本文说明“固定骨架 + 后端生成行”这种模板组织方式,以及它带来的边界与注意事项。
泡海椒3 天前
java·开发语言·pdf
jquick-pdf 表格行列尺寸控制实战:单元格合并的可行边界表格是报表 PDF 中最容易失控的部分:数值列太窄会折行,说明列过高会让整页行数不足,汇总信息又常被要求“合并居中”。用底层 iText/PDFBox 手写这类表格时,合并单元格意味着自行维护 rowspan/colspan 占位矩阵,列顺序一变,错位往往要等到输出 PDF 才被发现。
java_logo4 天前
docker·pdf·chromium·libreoffice·文档转换·轩辕镜像·gotenberg
Docker 部署 Gotenberg 完整教程:Compose 搭建文档转 PDF API本文基于 gotenberg/gotenberg:8.37.0,实测引擎 Gotenberg 8.37.0,测试平台 Ubuntu 24.04 Linux。
泡海椒4 天前
java·开发语言·pdf
jquick-pdf 防止 PDF 内容分页断裂:keepTogether 属性妙用业务 PDF 的分页问题通常不是“能不能换页”,而是“应该在哪里换页”。订单摘要的标题落在页尾、金额卡片被拆成两半、审批结论和签名区分开,都会让文件显得不专业。直接用 PdfBox 绘制时,需要自行计算剩余高度并决定是否新建页面;内容一旦动态变化,坐标判断很快变得脆弱。jquick-pdf 提供 keepTogether,让模板可以明确表达“这个块尽量整体开始”。
泡海椒4 天前
java·开发语言·pdf
jquick-pdf 文本元素实战:段落、行内文本、制表符用法详解账单、回执和通知单几乎全是文字,却最容易出现排版返工:客户名称要加粗,金额要变色,说明要换行,账户标签还要整齐对齐。手写底层 PDF 绘制需要自行计算文字宽度,用连续空格对齐又会受字体和渲染器影响。jquick-pdf 用 <p>、<span>、<tab> 和 <br> 把这四类意图表达在模板里。
SamChan905 天前
python·ai·pdf·机器翻译
Python 处理小语种 PDF 的编码坑:重音字符、连字与 (cid:xx) 乱码的解决方案做 PDF 翻译预处理时,英语文档基本不出幺蛾子,但一到西班牙语、法语、德语文档,各种"灵异现象"就来了:é 变 é、office 变 office、整段文字变成 (cid:123) 编号。这些问题的根源都指向同一个环节——PDF 的字符编码与 Unicode 映射。本文用本机实测把三个最常见的坑复现一遍,每个坑给出可直接复制的解决方案。环境:Python 3.13,pymupdf 1.28.2 / pdfplumber 0.11.10 / pypdf 6.18.0,测试用 fpdf2 2.8.8 构造。
微咣科技5 天前
pdf·音视频
平台化工业AI再突破|大捷智能携手岚图汽车,打造车身焊装智能设计行业标杆近日,国家级专精特新“小巨人”企业大捷智能科技(广东)有限公司携手东风岚图汽车,面向车身焊装智能设计场景打造行业标杆示范项目,推动AI智能设计技术在车身焊装工艺领域落地应用,助力高端新能源整车研发提质增效。
我滴老baby5 天前
数据库·人工智能·架构·pdf
工业物联网数据库选型:把计算能力放回第一维度数据库的选型文章很多,但工业物联网场景下的选型翻车,十有八九不是翻在"存不下",而是翻在"算不动"。一个常见的剧本:选型阶段按存储需求评估——写入速率多少、压缩比多少、单机容量多少,各项指标都达标,签约上线。运行半年后,业务提出三个再普通不过的需求:全厂设备状态 5 秒刷新一次、振动数据和温度数据做关联分析、异常工况秒级告警。然后发现:数据都好好地躺在库里,但每一条需求都要把数据搬到库外Spark/Flink/Python 里才能算,链路一搭三个月,实时性还上不去。
SamChan905 天前
python·ai·pdf
多栏PDF阅读顺序重建:用Python按坐标聚类还原双栏论文的翻译顺序做 PDF 翻译预处理时,有个问题比"取不出文字"更隐蔽:文字全都取出来了,但顺序是错的。双栏排版的学术论文、期刊、产品手册是重灾区。直接取文会得到后面这种结果——第 1 段、第 13 段、第 2 段、第 14 段……左右两栏交替出现。丢给翻译引擎之后,译文读起来是断的:一句话说到一半跳到另一栏,读者要来回拼。
浩风祭月5 天前
人工智能·chatgpt·pdf·提示词·办公效率
ChatGPT上传PDF后漏读图表?文字版、扫描件和图片要分开处理把一份技术说明书交给ChatGPT,摘要写得很流畅,偏偏没提最关键的流程图;追问某个数值,回答又和原表对不上。
pengzhang1305 天前
pdf·工具·pdf编辑·在线免费·niubai.vip
在线改 PDF 文字,我把三个网站用同一份文件实测了一遍上周碰到个典型需求:一份 3 页的报价单 PDF,第 2 页表格里「基础套餐 3980 元/月」要改成 2980,改完导一份 Word 给同事。文件里有表格、有盖章扫描页。不想装软件,就想在浏览器里解决。
泡海椒5 天前
java·开发语言·pdf
告别 iText 繁杂配置:jquick-pdf 极简 PDF 生成实战(零基础上手)很多开发者第一次生成 PDF,会被 Document、Page、Font、Paragraph、Table 等对象包围:代码能生成文件,却很难一眼看懂最终版式;改文案要改 Java,改间距要重新定位。iText 与 PdfBox 都是成熟的底层工具,但“强大”不等于适合每一次业务导出。jquick-pdf 把常见文档表达为类 HTML 模板,让零基础开发者也能循序渐进地完成一份可维护的 PDF。本文以一个可直接运行的培训结业证书 Demo 为主线,说明它做了什么、没做什么,以及从零开始的推进顺序。
Saruka的男朋友6 天前
pdf·epub·eink
不上传文件也能转格式?拆解一个纯浏览器端的 EPUB 工具链的设计思路在线文档转换工具几乎都有一个共同前提:你得先把文件传上去。对小说、内部资料、 未公开的稿件来说,这个前提本身就是风险。这篇文章介绍一个反其道而行的方案—— iloveepub,一个所有处理都在浏览器本地完成的 EPUB 工具站,并从技术角度拆解 它为什么可行、边界在哪里。
asdzx676 天前
python·pdf
Python 实战:基于 Spire.PDF 为 PDF 文档添加自定义文本在文档处理场景中,经常需要对已有 PDF 文档追加文本内容,比如补充备注、标注说明、添加水印文字、补充页码注释等。Python 拥有丰富的 PDF 处理库,其中 Free Spire.PDF for Python 凭借简洁的 API、完善的样式支持、无需依赖本地 Adobe 组件的优势,能够高效实现 PDF 文本编辑,支持自定义字体、颜色、透明度、文字旋转等个性化效果。
SamChan906 天前
python·ai·pdf
PyMuPDF vs pdfplumber vs pypdf:PDF 文本提取实测对比(翻译预处理视角)做 PDF 翻译预处理时,第一步永远是"把文本从 PDF 里干净地拿出来"。这一步的选型直接决定后面整条流水线的质量:提取出来的文本顺序乱了,翻译对齐就废;坐标信息丢了,版面重建就没戏。网上三库对比的文章不少,但大多停留在"都能提取文本"的层面。本文以翻译预处理为视角,在真实的 30 页报告 PDF 上跑了一轮量化实测,把文本速度、表格提取、坐标信息三个硬指标摆出来,结论直接可用。
泡海椒6 天前
java·开发语言·pdf
Java 后端最优 PDF 导出方案:jquick-pdf 项目引入与快速测试一个 PDF 导出接口通常从“返回一页摘要”开始,随后不断加入明细表、分页、中文、图片与审批信息。若从第一天就把版式写进控制器,后续每个需求都会扩大代码耦合,测试也只能依赖人工打开文件。更稳妥的做法是先把 jquick-pdf 引入项目,建立可重复的冒烟测试,再逐步替换真实业务数据。本文面向 Java 后端开发者,重点是项目接入、服务边界划分与快速验收。
庖丁AI6 天前
pdf·ocr·文档解析·表格解析
PDF跨页表格提取后错列怎么办?先检查表头、续行和单位从PDF提取一张十几页的明细表,最容易忽略的问题是:第一页看起来完全正常,翻到后面,项目名称却落进了金额列,重复表头混进数据行,某一条长名称还被拆成两条记录。数字可能都识别出来了,但它们之间的关系已经错了。