PDF 中提取数学公式

✅ 方法一:使用 doc2x extract_formula_imgs + Pix2Text 一键运行脚本(自动提取+识别)

👉 适合你如果用 Python 的话,只需要运行一段脚本即可:

✅ 🔁 一步搞定脚本(仅需安装一次)

复制代码
pip install doc2x[pix2text] -i https://pypi.tuna.tsinghua.edu.cn/simple 

🧠 然后运行这段代码即可完成整个流程:

复制代码
from doc2x.extract_formula import extract_formula_imgs
from pix2text import Pix2Text
from PIL import Image
import os

pdf_path = "你的论文.pdf"
output_dir = "formulas"
extract_formula_imgs(pdf_path, output_dir, dpi=300)  # 步骤1:提取公式图像

p2t = Pix2Text()  # 步骤2:初始化模型

for fname in sorted(os.listdir(output_dir)):  # 步骤3:公式识别
    if fname.endswith(".png"):
        img_path = os.path.join(output_dir, fname)
        latex = p2t(Image.open(img_path))
        print(f"{fname} → {latex}")

✅ 方法二:纯命令行简化(适合写在 Shell 脚本里)

如果你不想写 Python 脚本,也可以直接用命令行运行:

doc2x extract-formula-imgs 你的论文.pdf --out-dir formula_imgs pix2text formula_imgs/*.png --out output.txt

这样你能直接把所有 LaTeX 结果写入 output.txt


✅ 方法三:在线平台(无需安装,但受限)

若你不想安装环境,可以试试:


✅ 推荐组合方式(最快速+省心)

方式 特点 推荐人群
方法一(Python) 全自动、最灵活、可批量识别 研究人员,熟悉代码
方法二(命令行) 零代码配置,更直观 教师、工程师、懒得写脚本
方法三(在线) 零配置,适合小量公式 仅偶尔处理,数量少的人
相关推荐
CodeCraft Studio19 分钟前
CAD文件处理控件Aspose.CAD教程:使用 Python 将绘图转换为 Photoshop
python·photoshop·cad·aspose·aspose.cad
Python×CATIA工业智造2 小时前
Frida RPC高级应用:动态模拟执行Android so文件实战指南
开发语言·python·pycharm
onceco3 小时前
领域LLM九讲——第5讲 为什么选择OpenManus而不是QwenAgent(附LLM免费api邀请码)
人工智能·python·深度学习·语言模型·自然语言处理·自动化
狐凄3 小时前
Python实例题:基于 Python 的简单聊天机器人
开发语言·python
悦悦子a啊4 小时前
Python之--基本知识
开发语言·前端·python
笑稀了的野生俊6 小时前
在服务器中下载 HuggingFace 模型:终极指南
linux·服务器·python·bash·gpu算力
Naiva6 小时前
【小技巧】Python+PyCharm IDE 配置解释器出错,环境配置不完整或不兼容。(小智AI、MCP、聚合数据、实时新闻查询、NBA赛事查询)
ide·python·pycharm
路来了7 小时前
Python小工具之PDF合并
开发语言·windows·python
蓝婷儿7 小时前
Python 机器学习核心入门与实战进阶 Day 3 - 决策树 & 随机森林模型实战
人工智能·python·机器学习
AntBlack7 小时前
拖了五个月 ,不当韭菜体验版算是正式发布了
前端·后端·python