ocr

楚识科技8 小时前
ocr
卡证OCR识别实战:证件识别SDK、端侧设备与私有化部署清单最近接手一个政企实名录入项目,核心需求就一句话:窗口和外勤要把证件信息快速录进业务系统。调研一圈下来发现,证件OCR识别这个赛道水比想象中深——demo都能跑通,真上生产,字段对不齐、隐私过不了审、离线场景掉链子,哪一个都够项目组喝一壶。这篇把选型、对接、踩坑整条链路记下来,给要做身份证识别SDK集成的同学做个参照。
晴空蓝天8 小时前
阿里云·ocr
零工系统企业认证:营业执照 OCR 识别,阿里云这个接口我调了一下午导读:零工/招聘系统里,企业发岗位前得先过认证——营业执照得验真吧。人工审核慢,用户吐槽;全自动又怕假执照。后来接了个折中方案:先用阿里云 OCR 把执照信息抽出来自动填表,再人工看一眼关键字段。这篇记录接口接入的坑,尤其是 Advance 接口那个大坑。
苏苏susuus1 天前
人工智能·python·ocr
核密度估计(KDE)与高斯核(概念分享)假设调查了 100 个人的身高,得到了 100 个离散的数字:165cm、172cm、168cm…… 如果直接画直方图,会得到一堆高低不平的矩形条。直方图虽然直观,但有两个问题:
庖丁AI1 天前
pdf·ocr·文档解析·表格解析
PDF跨页表格提取后错列怎么办?先检查表头、续行和单位从PDF提取一张十几页的明细表,最容易忽略的问题是:第一页看起来完全正常,翻到后面,项目名称却落进了金额列,重复表头混进数据行,某一条长名称还被拆成两条记录。数字可能都识别出来了,但它们之间的关系已经错了。
AI人工智能+2 天前
深度学习·计算机视觉·语言模型·自然语言处理·ocr·文档抽取
了一种融合OCR与大模型的文档抽取系统,解决传统OCR“识字不识意”的痛点你有没有过这样的经历:周一早晨刚坐下,面对桌上堆成山的采购合同、海外发票和法律文书,还没开始喝口水,心里就一阵发慌。眼睛盯着密密麻麻的文字,手指在键盘上机械地敲击,不仅腰酸背痛,还生怕看错一个数字导致后续麻烦不断。
楚识科技3 天前
ocr
合同智能比对引擎实战:OCR、版面还原与私有化部署全流程合同比对类产品这两年层出不穷,标题一个比一个响亮,真拿合同一测就原形毕露。做技术选型的人,最怕的不是产品多,而是厂商把"文本 diff"包装成"合同智能比对"——这两者的工程量差了不止一个数量级。
楚识科技4 天前
ocr
OCR 选型实战:字段级准确率怎么算、验收怎么做做 OCR 选型的人,应该都被一句"识别准确率 99%"打动过。入行久了才明白,这个数字几乎不能作为采购依据——它默认了自选样本、字级口径、无手写无表格无模糊的测试环境。本文给出一套字段级验收方案,代码可直接复用,全程约一小时跑完。
张彦峰ZYF5 天前
人工智能·pdf·ocr·ai agent·pdf-inspector
从“全量 OCR”到按页智能路由:pdf-inspector 与企业 PDF 解析架构的工程化重构目录一、PDF 解析真正的瓶颈,不是 OCR 本身,而是“错误路由”(一)把所有 PDF 都送 OCR,工程上很稳,经济上却很粗放
楚识科技6 天前
人工智能·计算机视觉·ocr
手写OCR工程接入实录:图像预处理、后处理校验与置信度分层的完整链路某医院信息科完成手写处方识别模块上线后,首月人工校对率直接突破40%。这意味着系统识别输出的100张处方里,有40张会被药师判定为“必须人工重审”——其中一半错误来自剂量字段识别偏差,另一半则是药品名字段手写、印刷表格混排后引发的字段错位。信息科最初默认是模型能力不足,把市面上主流的识别引擎全部替换了一轮,问题依然没有得到根本解决。最终经过全链路排查,核心问题定位在三个被完全忽略的工程环节:图像预处理缺失、后处理校验规则空白、混排区域未做分割。
2601_967760787 天前
ocr·word
扫描件 OCR 转 Word 总乱码?2026 国内免费实测上周三下午,做行政的老陈在群里发了一张截图,配文只有四个字:“又白干了。”他要把一批 2019 年的纸质会议纪要扫描成电子档,用某海外工具转完 Word,打开一看,三页纸的正文全部挤成了一列竖排文字,表格线全丢,页眉的“内部资料”四个字跑到了正文中间。他手动调了两个小时,最后发现还不如自己照着敲。
楚识科技7 天前
ocr
增值税发票识别 API 落地指南:并发限流、字段校验与数电 PDF 解析报销系统上线第三个月,月末批次跑到一半,OCR 识别接口开始密集返回 429。本地队列里积压了上千张待识别发票,RPA 报销机器人拿不到结构化字段,整批报销单卡在半途。事后排查发现,问题不在 OCR 识别准不准,而在工程链路 —— 并发没控住、字段没做交叉校验、验真同步调用把主链路堵死了。
HAHAXX88 天前
自然语言处理·ocr·rpa
RPA 架构设计详解:大模型集成下,如何融合 NLP、OCR 处理非结构化数据本文详解 RPA 架构设计中集成大模型的三种范式,以及 NLP、OCR 融合处理非结构化数据的完整管线,并给出 AI 自动化搭建能力的评估清单与分阶段落地路线。全文围绕架构分层、大模型编排、非结构化数据抽取、执行层稳定性与交付运维五个维度展开,附实际项目经验。 写这篇文章的起因很现实:上个月有个做财务共享的朋友找我吐槽,他们上一套自动化系统,光是处理供应商发来的五花八门的 PDF 发票、截图报销单、Excel 附件邮件,就搭进去两个人月。结构化数据好办,难的是这堆"长得都不一样"的非结构化数据。这其实是当
聚美智数9 天前
ocr
二维码识别-条形码识别-智能识别二维码条形码-二维码OCR-二维码解析-二维码图片识别二维码条形码OCR识别,即通过图像识别技术自动识别条形码中的数字编码信息及检测和解析二维码里面存储的文本、网址、编号等数据信息。
楚识科技9 天前
ocr
CPU 环境 OCR 选型与加速实践:Tesseract / RapidOCR / PaddleOCR 轻量版 + ONNX Runtime 量化没有 GPU 的团队能不能做 OCR?能,而且很多场景 CPU 方案才是性价比之王。本文从工程角度盘点 CPU 可跑的 OCR 方案,给出量化、多线程、图像尺寸控制的完整实践路径。
聚美智数9 天前
ocr
VIN图片识别-车辆VIN识别-车辆VIN图片识别-车架号OCR-车架号OCR识别车架号OCR识别,即通过图像识别技术自动从图片中检测、定位并识别出车辆上那串由17位字母和数字组成的唯一编码(VIN码,即车辆识别代号)。
聚美智数9 天前
经验分享·ocr
图片去摩尔纹 - 屏幕翻拍波纹消除 - 图像摩尔纹消解 - 屏幕干涉纹修复 API 接口介绍日常翻拍电脑显示器、手机屏幕画面时,照片极易出现彩色波纹状摩尔纹干扰,画面观感模糊,还会干扰后续文字识别、素材归档等工作。通过图片去摩尔纹接口,可智能消解翻拍屏幕产生的摩尔纹干扰,保留原图文字与画面细节,还原干净通透的图像效果,解决屏幕翻拍素材画质受损难题。
楚识科技9 天前
ocr·rpa
RPA+OCR 落地实战:从截屏识别到自动入账的完整链路与选型清单去年为一家制造业客户的财务共享中心搭建报销自动化时,初期仅部署了 RPA,单据识别仍停留在"截图另存、人工录入"阶段。运行两周后才意识到:‌流程自动化项目的真正瓶颈,往往从"识别"这一环开始。‌ RPA 负责编排操作,OCR 负责将图像信息转化为结构化数据,二者协同,链路才能闭合。
楚识科技10 天前
ocr
OCR 推理选 CPU 还是 GPU?一份可落地的算力评估与实测方案"这个 OCR 服务要不要上 GPU?" 几乎是每个接手识别系统的工程师都会被问一遍的问题。本文不站队,给一套可落地的评估流程:先把需求量化成 SLA,再跑基准测试拿数据,最后把算力成本算明白。结论大概率是:很多项目根本不需要 GPU,但你需要一套能证明这件事的方法。
2601_9639067810 天前
pdf·ocr·软件需求
离线截图 OCR 识别:支持表格与 PDF 解析更新日志分享了「截图文字识别工具v6.66.7z」 链接:https://pan.quark.cn/s/5074483b2850