ocr

成旭先生8 小时前
人工智能·算法·ocr·api接口·金融科技·银行卡识别·支付风控
银行卡识别 API:一张照片读出卡号、BIN 与发卡行支付绑卡、钱包开户、商户进件、报销打款账户采集、代发工资卡号录入,第一件事都是让用户把 16 ~ 19 位卡号敲进输入框。手输一串长数字,错一位就打款失败,很多人要念两遍、核两遍;用传统 OCR 方案,又常被凸字反光、卡面花纹、斜拍、手指遮挡卡住。bankcard.ocr 把这件事做成一个 POST 接口:一张照片进去,卡号、卡号前 6 位 BIN、发卡行、卡类型、卡组织、卡等级、卡名称、持卡人姓名与有效期一起结构化出来,附带整体置信度和图片质量提示。
开开心心就好9 小时前
智能手机·ffmpeg·ocr·word·音视频·网络攻击模型·安全架构
本地文件搜索工具推荐,占用小速度还快软件介绍文件搜索精灵是一款用来搜索文件和文件夹的工具。软件有好几个版本,我用的是最新的 v5.2,64 位版本只有 1.61 MB,小得离谱。搜索类型上,它既能搜所有文件,也能按文档、图片、压缩包、应用程序、视频、音频这些分类来搜。
winfredzhang14 小时前
人工智能·chrome·ocr·api·plugin
用 Chrome 插件 + 局域网 Qwen2.5-VL 打造视频截屏 OCR 工具在看网课、技术视频、会议录像的时候,经常想把画面里的代码、公式、PPT 文字直接抠出来。截图再丢给在线 OCR 既麻烦,又有隐私顾虑。本文用 Manifest V3 写一个 Chrome 插件:框选屏幕区域 → 保存截图 → 发给局域网里的 Qwen2.5-VL 7B → 识别结果自动进剪贴板,全程数据不出局域网。 启动qwen 2.5vl 7b大语言模型:
开开心心就好14 小时前
智能手机·ffmpeg·ocr·word·排序算法·音视频·散列表
视频压缩工具推荐,画质效果很能打软件介绍说到视频压缩工具,估计不少朋友第一个想到的就是小丸工具箱。它同样是一款由韩国开发者做出来的工具,最后一次更新停留在 2016 年,算下来已经十年没动静了。
万物皆智能1 天前
ocr
12个图片转文字软件,包括OCR识别等功能平时经常将网页截图或者手写笔记,快速转换为TXT或者Word文档的需要,但是目前市面上的OCR识别工具实在是太多啦,到底哪些才是真正免费好用滴,确实困扰了不少同学!
跨境数据猎手2 天前
ocr
ddddocr 与多模态大模型 OCR 对比和选择建议在 OCR 领域,多模态大模型的入局让很多人开始重新思考传统专用 OCR 的价值。GPT-4V、Gemini、Qwen-VL 这类模型把"看图识字"的能力拉到了新的高度,但与此同时,像 ddddocr 这样的轻量级开源工具依然在开发者社群中保持着很高的使用率。
AI人工智能+3 天前
深度学习·自然语言处理·ocr·医疗机构执业许可证识别
医疗机构执业许可证识别技术融合计算机视觉、OCR与大模型,实现手机拍照或上传文件后自动提取证书关键字段信息一张纸质的医疗机构执业许可证,里面藏着机构名称、登记号、诊疗科目、有效期、地址、负责人等大量关键信息。过去,工作人员只能手动逐字抄录、录入系统,遇到副本多页、证件褶皱、红章遮挡文字,更是费时费力,还容易出现人工错漏。
开开心心就好4 天前
javascript·智能手机·ffmpeg·c#·ocr·word·音视频
以图搜图找重复图片,本地工具离线就能用软件介绍图片查重的工具我前前后后介绍过好多款,去文档里搜一下就能翻到不少好用的。后来有朋友问:查重的工具是有了,可有没有那种能拿我手上现有的一张图,去把跟它重复的图片找出来的?答案当然是有的。今天这款就叫以图搜图,干的就是这件事。
格数致用4 天前
ocr·水印识别
1.5 扫描件浅色斜铺文字水印:像素级 OCR 验证与掩膜修复清印 ClearMark 系列第 5 篇 · 共 12 篇前两篇我们讲了矢量 PDF 的内容流解析与多策略检测。矢量 PDF 的水印是"可分离"的——文字有 BT…ET 容器,图片有 XObject 引用,擦除干净就行。
楚识科技5 天前
ocr
移动端OCR SDK实战接入:实现身份证/银行卡离线识别全流程最近参与了一款金融App证件录入模块的重构——需求很明确:用户拍摄身份证或银行卡,App在本地完成结构化字段识别并自动填充表单。网上资料大多是厂商文档的搬运,真正把初始化、回调机制、异常处理、字段映射讲透的极少。
海宇数据5 天前
人工智能·架构·自动化·ocr
零信任架构实战:基于海宇身份证OCR构建自动化证照采集网关在共享经济与数字灵活用工产业高速发展的背景下,构建一套“灵活用工财税结算平台个体工商户批量注册证照自动化采集管道”,是保障海量自由职业者合规创收与税务园区高效办照的核心技术底座。在园区个体工商户集中设立、税务实名办税备案以及委托代征协议签署等环节,财税结算平台每日需集中处理数以千计的经营者身份证正反面影像。传统的作业流程依赖运营人员逐张打开图片核对并手工录入姓名、公民身份号码、户籍地址及证件有效期限,不仅录单效率低下、容易发生地址生僻字或数字抄录偏差,且面对自由职业者正反面照片混传、非证件图片误传或临期证
开开心心就好6 天前
java·服务器·开发语言·pdf·ocr·散列表·启发式算法
图片白底怎么去掉?抠图工具抠完背景透明软件介绍我平时推荐的抠图工具,绝大部分是冲着人物抠图去的,当然其中不少也能抠物体,但能抠签名这类内容的,真的极少。今天这款 SmartBGRemover 就是一款智能抠图工具,而且它正好能搞定签名图片的抠取。
AI人工智能+6 天前
人工智能·深度学习·自然语言处理·ocr·行驶证识别
行驶证识别技术融合计算机视觉与自然语言处理,实现对模糊、倾斜、反光等复杂场景下行驶证的高精度结构化数据提取一张小小的行驶证,相当于汽车的“身份证”,车牌、车主信息、VIN 车辆码、发动机号、年检有效期、使用性质等几十项关键信息全部记录其上。过去办理车险、二手车交易、车辆抵押、车队登记,都要人工对着证件一字一字录入,不仅慢,手敲错数字、看错字母的情况时常发生。
开开心心就好6 天前
智能手机·ffmpeg·ocr·word·vim·音视频·visual studio
超市定时播音软件,免费版支持循环播放软件介绍今天介绍的这款软件叫"超市播音系统",顾名思义,它就是一款给超市做定时语音播放的工具。这类软件目前市面上基本都要收费,找了一圈下来,只有这款是完全免费的。
AI视觉网奇8 天前
ocr
手写ocr 算法合集
楚识科技9 天前
运维·自动化·ocr
合同比对全流程自动化:OCR识别+差异比对+法律风险字段抽取实战指南做企业法务系统的开发同学,几乎大概率被业务方提过这类需求:上传两版不同版本的合同,系统自动把所有差异点完整列出来,最好还能自动标注出高风险的变更项。 不少人乍看之下会觉得这不就是个文本diff工具?真上手落地才会发现全是隐藏深坑:扫描件要先过智能版面分析、红章遮挡的文字要做专门恢复、条款对齐要处理两版合同里序号错位的特殊情况,风险分级还要对接企业法务自己的专属规则库。 这件事拆解成清晰的技术链路其实分为三段:先靠合同OCR把扫描件/电子版PDF转成结构化文本,再通过合同比对引擎完成条款智能对齐与差异识别,
楚识科技9 天前
ocr
手写表格OCR接口接入全指南:实战调用与结构化字段解析普通印刷体OCR接口返回的是按坐标排序的零散文字块,开发者拿到结果后还需要自行完成表格切分、列名对齐的额外工作。但这套逻辑完全不适用于手写表格场景:单元格内混杂手写汉字与数字,再加上拍照透视变形、表格线长期磨损等问题,行列错位几乎是常态。 业务侧真正需要的识别返回结果,绝非一堆无序的文字碎片,而是一张已经完成行列对齐的标准二维表格——每个单元格都附带行号、列名、识别值和置信度,低置信度的单元格直接标记出来,交由人工复核即可。 本文以手写表格OCR的私有化/云API接入全流程为主线,完整拆解接口调用过程中的
VidDown9 天前
python·网络协议·ocr·音视频·视频编解码·视频
从视频画面里提取文字:OCR、文字检测与结构化输出客户有一批讲座录像(每节 45 分钟,画面是 PPT),想要"能搜索视频里出现过的内容"——也就是说,要把画面里的文字提取出来。
一马平川的大草原9 天前
pdf·ocr·md
pdf转md的三种方式最近工作中需要将扫描的pdf文件转换为Markdown格式,方便后续项目复用相同的合同文本信息,而且Markdown格式更方便大家及大模型解读,因此就做了这个转换工具,主要支持三种:直接提取文本、通过OCR提取文本、提取pdf中的文本和图像、去除页眉页脚后的文本提取等。其他类型的转换工具详见之前文章。主要内容如下,供参考。
zhoupenghui16810 天前
pdf·ocr·复杂pdf解析
复杂PDF与扫描件解析存储实战:文本、图片OCR、表格识别及RAG向量入库全流程面对复杂 PDF 的解析,不是简单地把文件读成文本,而是把版面、图片、表格和扫描件重新还原成可检索、可溯源、可问答的知识, 特别是一个pdf中存在段落、图片(图片中有文字,有公司logo等标识)、表格、PPT 页面甚至整页扫描件的混合情况,相对可靠的步骤是:逐页判别文本型、扫描型与混合型页面,原生文本优先,大图与扫描区域走 RapidOCR,表格用 pdfplumber 或 PP-Structure 保留结构,最后按内容类型切分并写入 Milvus,构建面向 RAG 的复杂文档知识库;