Deepseek-OCR部署与调用

DeepSeek-OCR 是 DeepSeek-AI 推出的多模态端到端 OCR 模型 ,核心创新在于提出 "上下文光学压缩" 范式。将文字Token 转化为视觉Token,几千字的文档可从数千文本 token 压缩至 256 个视觉 token,为大型语言模型处理长上下文问题提供全新解决方案。

在开源的github仓库中我们可以看到Deepseek-OCR有两种使用方式,即可以通过 Transformers 进行推理,又可以通过vLLM 进行推理。接下来我们按照步骤进行部署与调用。

下载Deepseek-OCR模型

首先我们登录modelscope.cn/models/deep... 魔塔社区的官网进行OCR模型的下载

js 复制代码
#首先我们通过命令安装ModelScope
pip install modelscope 
#使用modelscope下载模型,我使用的是SDK进行下载,并指定下载到vllm目录中。
model_dir = snapshot_download('deepseek-ai/DeepSeek-OCR',cache_dir='/vllm')

下载后如图所示

对仓库实例代码进行克隆

git clone https://github.com/deepseek-ai/DeepSeek-OCR.git

Deepseek-OCR-hf 是直接使用Hugging Face的transformer直接进行调用,仅支持单张图片的OCR解析,但可以通过降精度的方式,让显存小于8G的电脑也能调用。我们重点关注vllm调用。

虚拟环境的构建

本项目我是使用uv进行虚拟环境的管理,我指定创建了python3.12.9的虚拟环境。 并使用source进行环境的激活。

bash 复制代码
uv venv ds-ocr -- python3.12.9 
source ds-ocr/bin/activate

依赖包的安装

CUDA我使用的是11.8版本,经测试在4090和3080ti都可以正常运行,若是50系显卡要将CUDA版本改为对应的12.8版本

js 复制代码
pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url 
https://download.pytorch.org/whl/cu118 
pip install vllm-0.8.5+cu118-cp38-abi3-manylinux1_x86_64.whl 
pip install -r requirements.txt 
pip install flash-attn==2.7.3 --no-build-isolation

注意:若需在相同环境中运行 vLLM 和 transformers 代码,无需担心此类安装报错:vllm 0.8.5+cu118 要求 transformers>=4.51.1 其中requirements.txt需要cd到对应DeepSeek-OCR-master的路径下。

代码config模型路径的修改

我们点开DeepSeek-OCR-vllm 目录,其中config.py是Tiny、Small、Base、Large、Gundam五种尺寸配置、模型路径、输入输出、默认提示词等的设置文件

其中我们要将MODEL_PATH 改为模型下载的路径。 接下来我们就可以通过

python run_dpsk_ocr_image.py 进行图片的解析和markdown的输出。

相关推荐
kyriewen8 小时前
奥特曼借GPT-5.5干杯,而你的Copilot正按Token收钱
前端·github·openai
jinanwuhuaguo11 小时前
(第三十三篇)五月的文明奠基:OpenClaw 2026.5.2版本的文明级解读
android·java·开发语言·人工智能·github·拓扑学·openclaw
DogDaoDao11 小时前
【GitHub】andrej-karpathy-skills:让 AI 编程助手告别三大通病
人工智能·深度学习·程序员·大模型·github·ai编程·andrej-karpathy
Shin_chan14 小时前
Linux 内核史诗级提权漏洞:CVE-2026-31431 复现与分析
github
CoderJia程序员甲16 小时前
GitHub 热榜项目 - 日榜(2026-05-03)
ai·大模型·llm·github·ai教程
yyuuuzz17 小时前
aws 基础认知与实践注意点
运维·服务器·网络·云计算·github·aws
weixin_5142531818 小时前
430-github-aguvis tmux
github
阿里嘎多学长19 小时前
2026-05-03 GitHub 热点项目精选
开发语言·程序员·github·代码托管
努力努力再努力wz19 小时前
【MySQL进阶系列】一文打通事务机制:从锁、Undo Log 到 MVCC 与隔离级别
c语言·数据结构·数据库·c++·mysql·算法·github
钱塘江渔夫20 小时前
一键式解决Windows访问github.com不了问题
windows·github