转化为MarkDown

markitdown

markitdown简介
  • 将文件和办公文档,如pdf,doc等转换为Markdown的Python工具
  • 项目仓库:https://github.com/microsoft/markitdown
  • 支持将如下格式文件或文档转为markdown
    • PDF
    • PowerPoint
    • Word
    • Excel
    • Images (EXIF metadata and OCR)
    • Audio (EXIF metadata and speech transcription)
    • HTML
    • Text-based formats (CSV, JSON, XML)
    • ZIP files (iterates over contents)
markitdown相关文章

Docling

Docling简介
  • IBM开源文档解析理解工具
  • 项目仓库:https://github.com/DS4SD/docling
  • Docling是一个用于文档解析和格式转换的工具,支持多种文档格式(如PDF、DOCX、PPTX等),能够快速将文档导出为Markdown和JSON格式
Docling特征
  • 🗂️能读取流行的文档格式(PDF,DOCX,PPTX,XLSX,图像,HTML,AsciiDoc和Markdown)并导出为HTML,Markdown和JSON(嵌入和引用图像)
  • 📑高级PDF文档理解,包括页面布局,阅读顺序和表格结构
  • 🧩统一的、富有表现力的表现格式
  • 🤖轻松集成LlamaIndex和LangChain,实现强大的RAG / QA应用程序
  • 🔍支持扫描PDF的OCR
  • 💻简单方便的命令行
Docling相关文章

marker-api

  • 一个简单易部署的 API,用于将 PDF 文件快速、高准确度地转换成 Markdown 格式
  • 项目仓库:https://github.com/adithya-s-k/marker-api
  • 支持同时转换多个 PDF 文件。
  • 支持多种文档类型,包括书籍和科学论文。
  • 支持所有语言。
  • 移除页眉、页脚和其他非文本元素。
  • 格式化表格和代码块。- 提取并保存Markdown中的图片。
  • 将大多数方程式转换成LaTeX格式
  • 精准!Marker API:PDF 转 Markdown

Marker

  • 基于深度学习模型的将 PDF 转换成 Markdown 格式的工具
  • 项目仓库:https://github.com/VikParuchuri/marker
  • 广泛文档支持(特别适合书籍和科学论文)
  • 全语言支持
  • 移除页眉、页脚及其它冗余元素
  • 格式化表格与代码块
  • 提取并随 Markdown 保存图像
  • 大多数公式转换为 LaTeX
  • 支持 GPU、CPU 或 MPS 运行
  • 高效PDF转markdown,AI实用工具

原文链接:https://i68.ltd/notes/posts/241205-doc2md/

相关推荐
乌恩大侠2 分钟前
【AI-RAN】在空ubuntu服务器安装环境和生成TV,高达430G文件
服务器·人工智能·ubuntu·fpga开发·o-ru
机器觉醒时代7 分钟前
英伟达GR00T N系列四代模型演进解析
人工智能·机器人·具身智能·vla模型
AI技术增长12 分钟前
Pytorch图像去噪实战(八):Noise2Void盲点网络图像去噪实战,只有单张带噪图也能训练
人工智能·pytorch·python
梦想很大很大17 分钟前
让 AI 成为“报表配置员”:BI 低代码平台的 Schema 实践路径
前端·人工智能·低代码
隔壁大炮23 分钟前
Day07-RNN层(循环网络层)
人工智能·pytorch·python·rnn·深度学习·神经网络·计算机视觉
小饕28 分钟前
从 Word2Vec 到多模态:词嵌入技术的演进全景
人工智能·算法·机器学习
上海云盾第一敬业销售29 分钟前
生成式AI催生深度伪造攻击,WAF如何识别“假流量“?
人工智能
ykjhr_3d30 分钟前
数字工具AI智能学伴,助力教育数字化转型
大数据·人工智能·ai·ai人工智能·华锐视点·华锐云空间
LIUAWEIO32 分钟前
鸽鸽工具网:免费在线工具大全,打开网页即用
人工智能·安全·ai·json
动恰客流管家36 分钟前
动恰3DV3丨客流统计系统:旺季人手不够淡季闲人太多?客流统计帮你科学优化人力成本
大数据·运维·人工智能·3d