云平台一键部署【rednote-hilab/dots.ocr】多语言文档布局解析模型

dots.ocr 是一个强大的多语言文档解析器,它在一个单一的视觉-语言模型中统一了布局检测和内容识别,同时保持良好的阅读顺序。尽管其基础是紧凑的1.7B参数的大规模语言模型,但它达到了最先进的(SOTA)性能。

dots.ocr的主要功能

强大的性能: dots.ocr 在 OmniDocBench 上实现了文本、表格和阅读顺序的SOTA性能,同时在公式识别方面与更大的模型如Doubao-1.5和gemini2.5-pro相比也具有可比性。

多语言支持: dots.ocr 对低资源语言表现出强大的解析能力,在我们的内部多语言文档基准测试中,在布局检测和内容识别方面都取得了决定性的优势。

高效且快速的性能: 基于紧凑的1.7B大规模语言模型构建,dots.ocr 比许多基于更大基础的高性能模型提供了更快的推理速度。

dots.ocr的技术原理

统一且简单的架构: 通过利用单一的视觉-语言模型,dots.ocr 提供了一个比依赖复杂多模型流水线的传统方法更简洁的架构。任务之间的切换只需简单地改变输入提示即可实现,证明了一个VLM可以与传统的检测模型如DocLayout-YOLO相比达到竞争性的检测结果。

dots.ocr的应用场景

跨境多语言合同智能审阅

dots.ocr 可快速解析中、英、阿、法、西等多语种PDF合同扫描件,精准识别条款文本、表格条款及法律条文阅读顺序,为律所或企业法务系统提供结构化输入,显著提升合规审查效率。

低资源语言政务文档数字化

面向东南亚、非洲等地的本土语言(如斯瓦希里语、宿务语)手写/印刷公文,dots.ocr 能稳定完成版面分析与内容识别,助力政府机构低成本构建本地化OCR基础设施,推动数字政务普惠落地。

Github: https://github.com/rednote-hilab/dots.ocr/tree/master?tab=readme-ov-file

模型: https://huggingface.co/rednote-hilab/dots.ocr

【rednote-hilab/dots.ocr】模型已经在趋动云『社区项目』上线,无需自己创建环境、下载模型,一键即可快速部署,快来体验【rednote-hilab/dots.ocr】带来的精彩体验吧!

项目入口

https://open.virtaicloud.com/web/project/detail/667277356582531072

视频教程

http://bilibili.com/video/BV1UCzYBzE3x/?spm_id_from=333.1387.homepage.video_card.click

启动开发环境

进入【rednote-hilab/dots.ocr】项目主页中,点击运行一下,将项目一键克隆至工作空间,『社区项目』推荐适用的算力规格,可以直接立即运行,省去个人下载数据、模型和计算算力的大量准备时间。

配置完成,点击进入开发环境,根据主页项目介绍进行部署。

使用方法

在gemini/code中找到使用说明,选中使用方法单元格,点击运行。

等待生成local URL,右侧添加端口7860。

项目使用方法

示例展示

➫温馨提示: 完成项目后,记得及时关闭开发环境,以免继续产生费用!

相关推荐
SENKS_DIGITAL9 小时前
深圳智慧展馆:以科技之名,绘未来出行之诗-森克思科技
科技·设计·艺术·展厅设计·展馆设计·科技展厅设计·展览设计
lijianhua_971215 小时前
国内某顶级大学内部用的ai自动生成论文的提示词
人工智能
蔡俊锋15 小时前
用AI实现乐高式大型可插拔系统的技术方案
人工智能·ai工程·ai原子能力·ai乐高工程
自然语15 小时前
人工智能之数字生命 认知架构白皮书 第7章
人工智能·架构
大熊背15 小时前
利用ISP离线模式进行分块LSC校正的方法
人工智能·算法·机器学习
eastyuxiao16 小时前
如何在不同的机器上运行多个OpenClaw实例?
人工智能·git·架构·github·php
诸葛务农16 小时前
AGI 主要技术路径及核心技术:归一融合及未来之路5
大数据·人工智能
光影少年16 小时前
AI Agent智能体开发
人工智能·aigc·ai编程
Database_Cool_16 小时前
OpenClaw-Observability:基于 DuckDB 构建 OpenClaw 的全链路可观测体系
数据库·阿里云·ai
ai生成式引擎优化技术16 小时前
TSPR-WEB-LLM-HIC (TWLH四元结构)AI生成式引擎(GEO)技术白皮书
人工智能