pdf2htmlex-精准将pdf转换成html

pdf2htmlex概述

主要特性

  • 生成原生的HTML,其中字体和元素位置与pdf一样精准。
  • 灵活输出:支持所有内容生成在单个HTML文件中;也支持分页生成多个html文件,资源如字体、图像、CSS生成单独的文件,实现按需加载(需要JavaScript)。
  • 文件大小适中,有时甚至比 PDF 还小。
  • 支持链接、大纲(书签)、打印、SVG 背景、Type 3字体等

问题

  • 不支持在windows中运行,支持linux,如ubuntu、alpine
  • 环境比较复杂,难以独立安装
  • docker运行必须精确指定标签

docker安装

  • 安装镜像

    docker pull pdf2htmlex/pdf2htmlex:0.18.8.rc2-master-20200820-alpine-3.12.0-x86_64

  • 设置别名

    alias pdf2htmlEX='docker run -ti --rm -v "pwd":/pdf -w /pdf pdf2htmlex/pdf2htmlex:0.18.8.rc2-master-20200820-alpine-3.12.0-x86_64'

  • 测试安装

    pdf2htmlEX --help

常用命令

  • 显示运行参数

    pdf2htmlEX -h

    pdf2htmlEX --help

  • 转化pdf

    pdf2htmlEX --zoom 1 test.pdf

  • 高级用法

    pdf2htmlEX -f 3 -l 5 --fit-width 1024 --bg-format jpg pdf/test.pdf

    仅转换第 3、第 4 和第 5 页,并将页面宽度调整为 1024 像素,背景图像将以 JPEG 格式生成

  • 对于发布者

    pdf2htmlEX --embed cfijo --dest-dir out pdf/test.pdf

    将在 out 目录中生成一个test.html和相关的资源文件,资源如字体、图像、CSS 和 JavaScript等都保存在单独的文件中,以便利用浏览器缓存。

  • 分页生成

    pdf2htmlEX --embed cfijo --split-pages 1 --dest-dir out --page-filename test-%d.page pdf/test.pdf

每个pdf页面都保存在各自单独的文件中,这些文件被命名为 test-0.page、test-1.page 等,在主页面test.html中通过ajax动态加载页面,以实现延迟加载页面。

  • fallback模式
    pdf2htmlEX --fallback 1 pdf/test.pdf
    生成单个test.html,由图像和隐藏文本组成。此模式以更大的文件大小为代价,提供了最大的准确性和兼容性。仅当pdf2htmlEX无法正确处理您的文件时,才使用此模式

原始地址:https://b.i68.ltd/archives/pdf2htmlex-pdfhtml

i68爱六八,链接你我他:https://i68.ltd

相关推荐
ElasticPDF-新国产PDF编辑器4 小时前
Angular 项目 PDF 批注插件库在线版 API 示例教程
前端·pdf·angular.js
夏天想4 小时前
vant4+vue3上传一个pdf文件并实现pdf的预览。使用插件pdf.js
开发语言·javascript·pdf·vant
ElasticPDF-新国产PDF编辑器5 小时前
React 项目 PDF 批注插件库在线版 API 示例教程
react.js·pdf·json
hello_simon8 小时前
在线小白工具,PPT转PDF支持多种热门工具,支持批量转换,操作简单,高效适合各种需求
pdf·html·powerpoint·excel·pdf转html·excel转pdf格式
ZhangChuChu_924815 小时前
Word在生成PDF后,PDF左侧导航书签目录错误显示的解决方法
pdf·word
inxunoffice1 天前
批量将文本文件转换为 Word/PDF/Excel/图片等其它格式
pdf·word·excel
人工智能教学实践1 天前
【爬虫脚本】实现批量pdf文件下载
pdf
海峰教授2 天前
扫描仪+文档pdf编辑器+pdf格式转换器
pdf
Li_na_na012 天前
解决安卓手机WebView无法直接预览PDF的问题(使用PDF.js方案)
android·pdf·uni-app·html5
背太阳的牧羊人2 天前
使用 PyMuPDF(fitz)库打开 PDF 文件,并且是从内存中的字节流(BytesIO)读取 PDF 内容
数据库·pdf·文件处理·pymupdf·fitz