DeepSeek刚刚开源了一个3B的 OCR模型:什么是DeepSeek-OCR?单张A100-40G每天可以处理20万+页文档

DeepSeek刚刚开源了一个3B的 OCR模型:什么是DeepSeek-OCR?单张A100-40G每天可以处理20万+页文档

有这么小的开源模型,却没有一个可以用来评测体验的算力显卡怎么办?

------本文教你白嫖云GPU,不用买卡也能跑。

📌 优质平台:https://gpu.spacehpc.com/user/register?inviteCode=52872508


DeepSeek 再开源:发布 3B MoE OCR 模型,视觉压缩高达20倍

强!DeepSeek刚刚放出了一个3B OCR模型:DeepSeek-OCR,单张A100-40G每天可以处理20万+页文档。

这不是传统OCR,而是把整页图像压缩进LLM上下文 ,让大模型像"看懂"文档一样处理PDF、PPT、书籍结构化信息、图表等等------等于是把整幅图=几千字的视觉token塞入Transformer上下文。


为什么这个模型重要?

传统OCR只能做"识别",而DeepSeek-OCR做的是视觉压缩 + 上下文语义理解,可以被看作视觉版RAG的上游处理器:

能力 优势
压缩 一张图压缩成64--128个视觉token
速度 单A100 40G → 20万页/天
精度 10倍压缩仍可达97%
弹性 20倍压缩仍保持60% 可读性
输入 支持 512~1280 可变扫描分辨率
功能 通用OCR / 图表解析 / 文档结构化 / Markdown生成 / REC定位

对于版式简单的书籍、PPT,64或100个视觉Token就能达到非常高精度


支持能力

  • ✅ 文档结构转换(PDF → Markdown/HTML)
  • ✅ 图表理解(OneChart类似能力)
  • ✅ 文本定位(REC)
  • ✅ 表格抽取
  • ✅ 多语言OCR
  • ✅ 动态分辨率(Gundam模式)
  • ✅ GPU记忆友好:小显存也能跑

开源地址(仓库/模型)

资源 链接
GitHub https://github.com/deepseek-ai/DeepSeek-OCR
HuggingFace https://huggingface.co/deepseek-ai/DeepSeek-OCR

模型安装 & 推理(Huggingface Transformers)

Requirements(python 3.12.9 + CUDA 11.8):

复制代码
torch==2.6.0
transformers==4.46.3
tokenizers==0.20.3
einops
addict 
easydict
pip install flash-attn==2.7.3 --no-build-isolation

推理Demo

python 复制代码
from transformers import AutoModel, AutoTokenizer
import torch
import os
os.environ["CUDA_VISIBLE_DEVICES"] = '0'
model_name = 'deepseek-ai/DeepSeek-OCR'

tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModel.from_pretrained(model_name, _attn_implementation='flash_attention_2', trust_remote_code=True, use_safetensors=True)
model = model.eval().cuda().to(torch.bfloat16)

prompt = "<image>\n<|grounding|>Convert the document to markdown. "
image_file = 'your_image.jpg'
output_path = 'your/output/dir'

res = model.infer(tokenizer, prompt=prompt, image_file=image_file,
                  output_path = output_path,
                  base_size = 1024, image_size = 640,
                  crop_mode=True, save_results = True, test_compress = True)

模式说明:

模式 base_size image_size crop_mode
Tiny 512 512
Small 640 640
Base 1024 1024
Large 1280 1280
Gundam 1024 640

Visualizations(效果展示)





没显卡怎么白嫖体验?(重点)

可以直接上云平台:

📌 推荐平台:
https://gpu.spacehpc.com/user/register?inviteCode=52872508

支持免费A100/4090等卡,足够测试DeepSeek-OCR。

修改输出路径即可:


结语:这是视觉RAG的新基座模型

DeepSeek-OCR的出现不是"又一个OCR",而是朝着Vision-to-Context迈出的关键一步。

不输出文本流,而是输出可以直接输入LLM的"上下文视觉Token",这意味着:

未来的大模型将具备真正的视觉理解与文档逻辑阅读能力

下一步我们只需要把DeepSeek-OCR前置,再接上LLM(DeepSeek-V3 / Qwen2.5 / GLM等),就能做PDF端到端问答 / 复杂表格抽取 / 具备文档连续语义的RAG系统


相关推荐
55873 生态系统3 分钟前
技术第4篇,【架构实战】55873 双层安全风控架构:Rust 底层硬拦截 + AI 语义研判双保险设计全解
人工智能·55873全域文明生态体系·55873操作系统·全域文明生态系统·55873技术底座
天远Date Lab3 分钟前
零信任架构实战:基于天远手机在网状态V即时版构建自动化通信网关
人工智能·ai·工具分享
元岳数字人小元6 分钟前
无惧网络受限:数字人私有化部署打造离线全域服务能力
运维·人工智能·开源·人机交互·交互
kaixin_啊啊9 分钟前
Micam 多容器太吃资源?用 Go2RTC + EasyNVR 给小米摄像头换一套轻量本地录像方案
图像处理·人工智能·摄像头
具身AGI12 分钟前
具身ICL走热,物理AI 自主学习能力 多一条轴
人工智能
雾屿_Mistisle13 分钟前
本地 AI 工作台的 Agent 化改造:从聊天转发到 22 个工具
人工智能
水如烟15 分钟前
孤能子视角:蓝星文明篇·异——正当性叙事的裂缝:负续指的聚合与相变
人工智能
倔强的石头_21 分钟前
我给 WorkBuddy 设了个闹钟:每天上午十点半,一份 AI 日报自动送进微信
aigc
美狐美颜SDK开放平台22 分钟前
直播APP源码与视频美颜sdk如何配合?一套完整开发思路
android·人工智能·计算机视觉·音视频·直播美颜sdk
李白客22 分钟前
向量数据库怎么选:RAG 项目最该比较的 8 个维度(深度拆解)
数据库·aigc