ocr

zyplayer-doc8 小时前
javascript·人工智能·智能手机·开源·ocr
同一份制度别复制到多个知识库:用zyplayer-doc引用文档解决重复维护企业知识库按部门、项目或产品拆分空间后,常会遇到一个看似简单的问题:同一份制度、产品说明或标准流程,应该放在哪个空间?
一个王同学1 天前
人工智能·深度学习·计算机视觉·ocr·vllm
从零到一 | CV转多模态大模型 | week21 | 实战项目-DocuMind-VL:基于 OCR 与 Qwen-VL 的文档多模态问答系统(一)最后四周,我们一起实战一个基于 OCR 与 Qwen-VL 的文档多模态问答系统。给这个系统起个名字叫 DocuMind-VL。
zyplayer-doc13 小时前
大数据·数据库·人工智能·笔记·pdf·ocr
核心制度不该被随手修改:用zyplayer-doc锁定文档和全部子文档企业制度、操作规程和标准方案在编写阶段需要多人协作,但正式发布后,管理目标就变了。这时更重要的不是让更多人继续编辑,而是保证员工看到的内容稳定、目录完整,避免已经生效的文件被随手修改。
Sinosecu-OCR1 天前
算法·ocr·ocr识别系统
文通OCR技术深度解析:自研算法如何搞定复杂场景识别?导读:模糊、歪斜、反光、阴影、复杂背景——这些是OCR技术落地中最大的"拦路虎"。文通OCR识别系统凭借自研深度学习算法,在这些极端条件下依然保持高精度识别。本文从技术视角深入剖析其核心算法原理、国产化适配方案和多语言识别机制。
AI人工智能+2 天前
深度学习·计算机视觉·自然语言处理·ocr·不动产权证书识别
一种高效、精准的不动产权证书智能识别技术,打通了物理世界与数字世界的信息壁垒在房地产交易、金融信贷、司法诉讼及政府政务等场景中,不动产权证书(俗称“房产证”或“不动产登记证”)作为核心法律凭证,其信息的数字化提取一直是行业痛点。传统的人工录入方式效率低、易出错且成本高昂。一种高效、精准的不动产权证书智能识别技术应运而生。该技术不仅实现了从图像到结构化数据的自动化转换,更通过精细化的算法优化,解决了复杂场景下的识别难题。
oradh2 天前
数据库·oracle·ocr·rac ocr维护·ocr维护·vote disk
Oracle RAC OCR维护操作总结本文包含OCR磁盘组替换;OCR文件的备份、损坏、恢复;Votding Disk文件的损坏、恢复。替换计划:将CRS磁盘组(本案例中OCR文件存放在CRS磁盘组中)替换为 CRSDG磁盘组
诸葛大钢铁2 天前
pdf·ocr·pdf教程·pdf解除限制·pdf无法复制·pdf文字识别
PDF无法复制文字怎么办?3种方法解除PDF复制限制并提取文字如果你经常收到PDF,却无法复制文字内容,一张张截图文字识别慢又繁琐。本篇文章介绍PDF无法复制的类型以及如何移除提取文字。
AI人工智能+3 天前
深度学习·计算机视觉·自然语言处理·ocr·学位证书识别
学位证书识别技术通过计算机视觉、自然语言处理和大模型推理相结合,实现了高精度、高效率的证书数字化处理在高等教育普及化与数字化转型的浪潮中,学历学位认证的效率、准确性与安全性成为了教育机构、用人单位及政府监管部门共同关注的焦点。一种高效、精准的智能学位证书识别技术应运而生,该技术不仅大幅提升了纸质证书数字化的处理速度,更通过深度的语义理解与防伪特征分析,为教育数据治理提供了坚实的技术底座。
AI人工智能+3 天前
深度学习·ocr·医疗机构执业许可证识别
一种基于深度学习技术的高精度医疗机构执业许可证识别系统,构建了一套基于深度神经网络的端到端智能识别系统,为医疗行业提医疗机构执业许可证是医疗机构合法执业的法定凭证,承载着机构名称、法定代表人、地址、诊疗科目、登记号、有效期等数十项关键信息。在医疗信息化建设和“健康中国”战略深入推进的背景下,海量证照信息的快速录入、核验与存档,直接关系到行政审批效率、卫生监督执法以及医疗大数据平台的数据质量。一种基于深度学习技术的高精度医疗机构执业许可证识别系统,构建了一套基于深度神经网络的端到端智能识别系统,为医疗行业提供了一种全新的智能化解决方案。
翔云 OCR API4 天前
ocr
文档 OCR 识别API,智能提取图文信息赋能企业数字化转型文档识别接口依托先进深度学习算法打造专业文档 OCR 识别能力,支持中文简体、繁体、英文等多语种印刷体与手写体识别,可快速提取图片、PDF 等文件内的文字信息,识别结果支持导出 txt、excel、pdf、word 等多种格式。基于成熟的文档 OCR 识别技术,接口广泛适配企业电子化存档、内容审核、扫描文档再编辑等文字提取、数字化场景,助力各行各业实现办公自动化,全面提升信息处理效率。
'pi%'3 天前
人工智能·爬虫·microsoft·langchain·ocr·能源
多 Agent 协同方案实践:基于 LangGraph 搭建能源领域智能调度工作流版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
求真学习4 天前
ocr·pdf解析·腾讯·文档解析·youtu-parsing
腾讯优图Youtu-Parsing开源,无损并行解码让表格解析提速26倍,OmniDocBench 93.22分一个2.5B参数的文档解析模型,推理速度竟然比3B的dots.ocr快了一倍多。这不是「模型更小所以更快」那么简单,秘密藏在一种叫「无损并行解码」的方法里。
'pi%'5 天前
爬虫·pdf·ocr
LangGraph 多智能体实战:搭建电力政策跟踪 Agent,实现网页爬虫、OCR 与 PDF 文档自动化解析随着国内电力市场化改革持续推进,各省电力交易中心持续发布交易规则、政策文件、市场通知。电力从业者需要持续跟踪海量PDF公告、网页政策文本,人工整理、对比政策差异、提取核心条款成本极高。传统单一大模型应用无法完成网页采集→文档解析→文本抽取→知识入库→智能分析完整流水线。
小保CPP5 天前
c++·人工智能·opencv·计算机视觉·cnn·ocr·光学字符识别
OpenCV C++基于CNN模型的场景文本检测(OCR)这个程序使用OpenCV text模块检测场景中的文本。输入图片:程序运行后会显示用红色矩形框标注文本的图片:
开开心心就好6 天前
java·开发语言·随机森林·ocr·excel·音视频·最小二乘法
文件查重软件批量删除重复文件释放空间软件介绍全盘查重工具,专门用来查找电脑里的重复文件。这类工具之前推荐过不少,但像这款解压后只有136KB的确实少见。体积虽小,功能却很实用。
donoot6 天前
人工智能·aigc·ocr·pymupdf·paddleocr·文渊慧典·大话系列
《大话文渊慧典》:五——大胖老师:“今天这堂课,咱们不讲虚的,直接上硬菜。我要把文渊慧典的技术架构从头到尾扒一遍,扒到毛细血管级别。”
开开心心就好6 天前
java·开发语言·b树·ocr·excel·音视频·kmeans
文件批量重命名工具简单好用支持规则改名软件介绍文件批量重命名工具,操作非常简单,功能也很聚焦。如果你不需要拖把更名器那么复杂的功能,这款工具可能更适合你。
疯狂敲代码的老刘6 天前
开源·ocr
百度开源 Unlimited-OCR:一次识别整篇文档,告别逐行扫描时代已打包好,国内可直接网盘下载源码: 夸克网盘(提取码:dcWH)拿到一份 50 页的 PDF 合同,需要把关键条款摘出来,结果 OCR 工具只能一行一行识别,识别完还要手动拼回段落结构,格式全乱了。
love530love7 天前
人工智能·ocr
Unlimited-OCR 部署运行(10/13):推理输出乱码根因——wheel RECORD sha256 审计服务能启动、/health 返回 200,但端到端推理输出是乱码——重复 token、无意义的中日韩字符混杂。这不是启动参数问题(第 09 篇 已排除),而是更隐蔽的模型装配层被破坏。本篇记录一次完整的根因定位:用"内核单测 + wheel RECORD sha256 审计"两板斧,锁定 3 个被手工改坏的 sglang 源码文件,并从官方 wheel 还原。这套审计法,建议你也存一份——它能在任何"输出又变乱码"的时刻立刻复现。
余俊晖6 天前
人工智能·ocr·多模态
再看多模态OCR视觉token裁剪思路-LayoutLite基于token的隐式布局分析前面介绍了一篇关于《多模态文档理解视觉token剪枝思路》的方案,今天又看到一篇类似的方案-LayoutLite,其核心背景也是OCR场景中图片上有很多冗余背景token【大量token对应空白边距、纯色背景等无文本信息的冗余区域;这些冗余token会全程参与后续解码器计算,直接推高预填充(prefill)阶段延迟、整体计算量(FLOPs)以及KV缓存的内存占用,成为端到端OCR落地的核心性能短板。】,需要剔除以提升VLM-OCR的效率。LayoutLite 的应用场景是在 token 层面做隐式布局分析