图像识别

星野云联AIoT技术洞察1 天前
计算机视觉·边缘计算·rk3588·语音识别·图像识别·边缘网关·边缘计算盒子
RK3588 边缘 AI 盒子适合什么工业视觉场景采购一台标称 6 TOPS 的 RK3588 盒子并不等于获得了一套可上线的工业视觉系统。真正值得使用 RK3588 的场景,是任务边界能够被明确描述:相机数量有限,模型已经能转换到 RKNN,端到端节拍有余量,错误结果可以复核,设备断流后有恢复路径,而且团队愿意为模型、runtime、驱动和业务规则维护一份兼容性合同。只要其中一项说不清,芯片参数越漂亮,项目后期越容易把问题误归因给“算力不够”。
猿人谷2 天前
神经网络·机器学习·图像识别
BRP,如何用“反向构造”让黑盒对抗 Patch 更省查询?在深度学习安全领域,对抗攻击一直是一个非常重要的研究方向。一个训练良好的图像分类模型,看起来已经能够非常准确地识别猫、狗、汽车、交通标志,但只要人为设计一些特殊扰动,就有可能让模型产生完全错误的判断。
梦想的颜色13 天前
python·计算机视觉·ocr·图像识别·python 识图
OCR 识别原理与 Python 识图全实战:从文字提取到图像内容理解在 AI Agent、自动化办公、文档解析、截图分析场景,OCR 识图是高频底层能力。很多人混淆两个概念:OCR 光学字符识别(提取图片里面的文字) 和通用图像识图(理解图片里面画面内容、物体、场景)。 OCR 只负责把图像中的文字转成文本;而识图是更大的范畴,既包含 OCR 文字抽取,也包含图像分类、目标检测、图像问答。 本文讲清楚底层原理、Python 实现方案、各库对比、代码示例、性能边界,同时结合 Agent/MCP 场景讲实际落地坑点。
码农刚子15 天前
python·图像识别
告别影楼和付费 App,5 分钟本地搭一个证件照自由平台|HivisionIDPhotos 开箱实测大家好,我是码农刚子。如果你也有过上述任意一种经历,那么这篇开箱的主角——HivisionIDPhotos,可能就是你电脑里值得常备的一款小工具。它是一个开源证件照智能生成项目,纯本地离线推理、CPU 就能跑、不向任何云端上传你的照片,从抠图、换底色、排版到美颜,一条龙搞定。
vivo互联网技术22 天前
计算机视觉·图像识别
VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026作者: vivo BlueImage Lab **摘要:**4K+图像编辑新突破!针对数据匮乏与细节建模难题,我们发布首个指令式超高分辨率编辑数据集 VINS-120K(含12万精筛4K三元组)。同时提出高频感知适配策略,将预训练低分辨率模型轻松扩展至UHR领域,并配套评测基准 VINS-4KEval。显著提升编辑细节与纹理真实感!
谙忆10241 个月前
javascript·css·图像识别
图片裁剪总是跑偏?用 object-fit、object-position 和真实像素把坐标对齐图片裁剪在页面上看起来只是一个矩形框,但真正实现时至少有三套坐标:原图像素坐标、容器显示坐标、用户拖拽产生的视口坐标。只在 CSS 层调整 object-position,再把同一组数直接提交给后端,最容易出现“预览正常、导出偏移”。
GoCoding1 个月前
图像识别
PaddleOCR 开始PaddleOCR-VL-1.6 (0.9B) 是 SOTA 级文档视觉语言模型 (VLM)。该模型以 96.3% 精度刷新 OmniDocBench v1.6,文本、公式、表格识别全面领先,并在古籍、生僻字、印章、图表等多场景能力显著增强,支持以 Markdown 和 JSON 格式输出结构化结果。
命运之光1 个月前
图像识别
InsightFace 本地人脸替换实践:贴回遮罩、身份增强与姿态保护技术笔记 · Windows / Python / InsightFace / ONNX Runtime 本文只讨论本地图像处理实现细节,不涉及任何违规用途。请合法合规使用相关技术。
vivo互联网技术1 个月前
图像识别·计算机图形学
扩散模型自引导新范式 SSG:直接交换Token就能变强! | CVPR 2026 Oral作者: vivo BlueImage Lab本文入选 CVPR 2026 OralCVPR(IEEE Conference on Computer Vision and Pattern Recognition)IEEE国际计算机视觉与模式识别会议,主要内容是计算机视觉与模式识别技术。CVPR 2026约160920篇投稿,接收率约25.42%。
weixin_408099672 个月前
python·ocr·图像识别·api接口·接口开发·扑克牌识别·石榴智能
2026 扑克牌识别 API 实战:识别牌值、花色、大小王(附 Python/Java/PHP 接入示例)随着 AI 视觉技术的发展,扑克牌识别已经广泛应用于:相比传统模板匹配算法,如今基于深度学习的扑克牌识别 API 不仅识别速度更快,而且能够适应不同角度、光照和复杂背景。
海途信息2 个月前
图像识别·机器视觉·智慧水利·光流算法
非接触河道测流新技术:AI视频流速监测原理、算法体系与工程应用传统河道流量监测多依靠接触式测流设备,仪器入水后易受洪水冲击、泥沙淤积、漂浮物撞击损坏;汛期涉水测验还存在较大人员安全隐患,难以实现全天候、长时序无人值守水文观测。
谙忆10242 个月前
图像识别
图片放大为什么会糊?从插值到 AI 超分,超分辨率技术是怎么演进的写业务大概率遇到过:产品甩来一张 200×150 的缩略图,要放大到 banner 尺寸,你一拖就糊成一团。然后有人问:"为什么放大就糊,不能像电视剧里那样 enhance 一下看清车牌吗?"
vivo互联网技术2 个月前
图像识别·计算机图形学
SIGGRAPH 2026 | VeraRetouch:多任务推理式照片修图框架作者:vivo BlueImage Lab **摘要:**我们团队提出了 VeraRetouch,一个轻量、全可微分、可移动端部署的多任务推理式照片修图框架。VeraRetouch 不仅能自动修图,还能听懂用户想要的风格描述,甚至能执行精确的参数式调整。通过将 0.6B 视觉语言模型作为“修图大脑”,并设计全可微分的 Retouch Renderer 作为“修图执行器”,VeraRetouch 能够把高层语言意图转化为低层像素级调整,在保持图像结构和细节的同时完成专业化色调与色彩优化。 对应的论文已被 S
hhzz2 个月前
python·opencv·yolo·图像识别·cv
基于监控视频的水位尺自动识别技术方案与实现该场景本质是一个图像/视频类计算机视觉水位监测问题:通过固定监控摄像头拍摄水尺(图中为红白搪瓷"E字水尺"),自动识别水面与水尺的交界线,结合水尺刻度标定信息换算出实时水位高程。整体技术路线为:
Bigger3 个月前
人工智能·图像识别·音视频开发
我写了一个AI图像视频生成工具,免费API+本地部署,分享给大家上个月刷到一条新闻,说有个叫Agnes AI的团队,把旗下文本、图片、视频三个模型的API全部免费开放了,无限期。
ZJPRENO3 个月前
人工智能·ai编程·图像识别
创作者狂喜!Seedance 2.5 支持 50 份素材同时导入,做短剧广告爽翻看完火山FORCE大会豆包2.1 Pro,千万别漏掉另一张王牌——Seedance 2.5 AI视频生成模型! 官方已经确认:目前内测收尾,7月初正式全量上线,和豆包2.1 Pro、Seedream图像、Seed-Audio音频组成字节完整全栈多模态AI矩阵,文本、代码、图片、视频、音频一条龙全部打通。
Dxy12393102163 个月前
网络爬虫·图像识别·验证码·抖音·验证码识别·豆包·九宫格验证码
豆包九宫格验证码识别上图是抖音九宫格验证码图片的样例图片。这款验证码确实有很大的难度,有一下几个特点:1、首先是图片种类非常多。
叫我:松哥3 个月前
人工智能·深度学习·神经网络·算法·cnn·迁移学习·图像识别
基于卷积神经网络的人脸情绪识别算法,引入残差连接与SE注意力模块1前言1.1.1 研究背景随着人工智能技术的飞速发展,人机交互日益成为日常生活的重要组成部分。人类情感的表达主要通过面部表情、语音语调、肢体动作等方式传递,其中面部表情是最直观、最丰富的载体。人脸情绪识别旨在使计算机能够自动识别人类的情绪状态,如高兴、悲伤、愤怒、惊讶等,从而实现更自然、更智能的交互。该技术在智能教育、心理健康监测、安全驾驶、娱乐互动等领域具有广阔的应用前景。
哈伦20193 个月前
人工智能·深度学习·图像识别
第十二章 深度学习基础 案例:MLP实现银行单据手写数字识别在本案例中,我们将使用PyTorch和Torchvision构建机器学习模型(特别是神经网络)来执行图像分类任务。我们使用MLP模型来构建手写数字识别模型。本案例中使用的数据集是著名的MNIST数据集,这是一个由手写数字0到9组成的28x28黑白图像数据集。
人月神话Lee3 个月前
ios·ai编程·图像识别
【图像处理】颜色空间——RGB之外的世界RGB 是相机记录颜色的方式,不是人类感知颜色的方式。 当你说"把这张图调得更鲜艳一点",你的意思是什么? RGB 不知道;HSV 知道;Lab 更知道。