图像识别

vivo互联网技术2 天前
计算机视觉·图像识别
VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026作者: vivo BlueImage Lab **摘要:**4K+图像编辑新突破!针对数据匮乏与细节建模难题,我们发布首个指令式超高分辨率编辑数据集 VINS-120K(含12万精筛4K三元组)。同时提出高频感知适配策略,将预训练低分辨率模型轻松扩展至UHR领域,并配套评测基准 VINS-4KEval。显著提升编辑细节与纹理真实感!
谙忆10246 天前
javascript·css·图像识别
图片裁剪总是跑偏?用 object-fit、object-position 和真实像素把坐标对齐图片裁剪在页面上看起来只是一个矩形框,但真正实现时至少有三套坐标:原图像素坐标、容器显示坐标、用户拖拽产生的视口坐标。只在 CSS 层调整 object-position,再把同一组数直接提交给后端,最容易出现“预览正常、导出偏移”。
GoCoding15 天前
图像识别
PaddleOCR 开始PaddleOCR-VL-1.6 (0.9B) 是 SOTA 级文档视觉语言模型 (VLM)。该模型以 96.3% 精度刷新 OmniDocBench v1.6,文本、公式、表格识别全面领先,并在古籍、生僻字、印章、图表等多场景能力显著增强,支持以 Markdown 和 JSON 格式输出结构化结果。
命运之光18 天前
图像识别
InsightFace 本地人脸替换实践:贴回遮罩、身份增强与姿态保护技术笔记 · Windows / Python / InsightFace / ONNX Runtime 本文只讨论本地图像处理实现细节,不涉及任何违规用途。请合法合规使用相关技术。
vivo互联网技术23 天前
图像识别·计算机图形学
扩散模型自引导新范式 SSG:直接交换Token就能变强! | CVPR 2026 Oral作者: vivo BlueImage Lab本文入选 CVPR 2026 OralCVPR(IEEE Conference on Computer Vision and Pattern Recognition)IEEE国际计算机视觉与模式识别会议,主要内容是计算机视觉与模式识别技术。CVPR 2026约160920篇投稿,接收率约25.42%。
weixin_408099671 个月前
python·ocr·图像识别·api接口·接口开发·扑克牌识别·石榴智能
2026 扑克牌识别 API 实战:识别牌值、花色、大小王(附 Python/Java/PHP 接入示例)随着 AI 视觉技术的发展,扑克牌识别已经广泛应用于:相比传统模板匹配算法,如今基于深度学习的扑克牌识别 API 不仅识别速度更快,而且能够适应不同角度、光照和复杂背景。
海途信息1 个月前
图像识别·机器视觉·智慧水利·光流算法
非接触河道测流新技术:AI视频流速监测原理、算法体系与工程应用传统河道流量监测多依靠接触式测流设备,仪器入水后易受洪水冲击、泥沙淤积、漂浮物撞击损坏;汛期涉水测验还存在较大人员安全隐患,难以实现全天候、长时序无人值守水文观测。
谙忆10242 个月前
图像识别
图片放大为什么会糊?从插值到 AI 超分,超分辨率技术是怎么演进的写业务大概率遇到过:产品甩来一张 200×150 的缩略图,要放大到 banner 尺寸,你一拖就糊成一团。然后有人问:"为什么放大就糊,不能像电视剧里那样 enhance 一下看清车牌吗?"
vivo互联网技术2 个月前
图像识别·计算机图形学
SIGGRAPH 2026 | VeraRetouch:多任务推理式照片修图框架作者:vivo BlueImage Lab **摘要:**我们团队提出了 VeraRetouch,一个轻量、全可微分、可移动端部署的多任务推理式照片修图框架。VeraRetouch 不仅能自动修图,还能听懂用户想要的风格描述,甚至能执行精确的参数式调整。通过将 0.6B 视觉语言模型作为“修图大脑”,并设计全可微分的 Retouch Renderer 作为“修图执行器”,VeraRetouch 能够把高层语言意图转化为低层像素级调整,在保持图像结构和细节的同时完成专业化色调与色彩优化。 对应的论文已被 S
hhzz2 个月前
python·opencv·yolo·图像识别·cv
基于监控视频的水位尺自动识别技术方案与实现该场景本质是一个图像/视频类计算机视觉水位监测问题:通过固定监控摄像头拍摄水尺(图中为红白搪瓷"E字水尺"),自动识别水面与水尺的交界线,结合水尺刻度标定信息换算出实时水位高程。整体技术路线为:
Bigger2 个月前
人工智能·图像识别·音视频开发
我写了一个AI图像视频生成工具,免费API+本地部署,分享给大家上个月刷到一条新闻,说有个叫Agnes AI的团队,把旗下文本、图片、视频三个模型的API全部免费开放了,无限期。
ZJPRENO2 个月前
人工智能·ai编程·图像识别
创作者狂喜!Seedance 2.5 支持 50 份素材同时导入,做短剧广告爽翻看完火山FORCE大会豆包2.1 Pro,千万别漏掉另一张王牌——Seedance 2.5 AI视频生成模型! 官方已经确认:目前内测收尾,7月初正式全量上线,和豆包2.1 Pro、Seedream图像、Seed-Audio音频组成字节完整全栈多模态AI矩阵,文本、代码、图片、视频、音频一条龙全部打通。
Dxy12393102162 个月前
网络爬虫·图像识别·验证码·抖音·验证码识别·豆包·九宫格验证码
豆包九宫格验证码识别上图是抖音九宫格验证码图片的样例图片。这款验证码确实有很大的难度,有一下几个特点:1、首先是图片种类非常多。
叫我:松哥3 个月前
人工智能·深度学习·神经网络·算法·cnn·迁移学习·图像识别
基于卷积神经网络的人脸情绪识别算法,引入残差连接与SE注意力模块1前言1.1.1 研究背景随着人工智能技术的飞速发展,人机交互日益成为日常生活的重要组成部分。人类情感的表达主要通过面部表情、语音语调、肢体动作等方式传递,其中面部表情是最直观、最丰富的载体。人脸情绪识别旨在使计算机能够自动识别人类的情绪状态,如高兴、悲伤、愤怒、惊讶等,从而实现更自然、更智能的交互。该技术在智能教育、心理健康监测、安全驾驶、娱乐互动等领域具有广阔的应用前景。
哈伦20193 个月前
人工智能·深度学习·图像识别
第十二章 深度学习基础 案例:MLP实现银行单据手写数字识别在本案例中,我们将使用PyTorch和Torchvision构建机器学习模型(特别是神经网络)来执行图像分类任务。我们使用MLP模型来构建手写数字识别模型。本案例中使用的数据集是著名的MNIST数据集,这是一个由手写数字0到9组成的28x28黑白图像数据集。
人月神话Lee3 个月前
ios·ai编程·图像识别
【图像处理】颜色空间——RGB之外的世界RGB 是相机记录颜色的方式,不是人类感知颜色的方式。 当你说"把这张图调得更鲜艳一点",你的意思是什么? RGB 不知道;HSV 知道;Lab 更知道。
人月神话Lee3 个月前
ios·ai编程·图像识别
【图像处理】一文带你窥探近期火热图像App的主要实现原理:主色提取——从图像到调色板给一张图,告诉我它的"灵魂颜色"是什么。 音乐 App 动态配色、电商颜色标注、UI 自动主题——背后都是同一个问题: 从百万个像素中,找出最能代表这张图的 6 种颜色。
人月神话Lee3 个月前
ios·ai编程·图像识别
【图像处理】图像直方图——从"频率分布"到"智能决策"直方图是图像的"体检报告"。 一眼看出:这张图曝光不足、对比度太低、色调偏暖——不用打开图像本身。 掌握直方图,就掌握了对图像质量"量化评估"的能力。
人月神话Lee3 个月前
ios·swift·图像识别
【图像处理】vImage/Accelerate——SIMD 让 CPU 也能飞GPU 是并行之王,但它不是唯一的选择。 CPU 的 SIMD 单元在正确的场景下,可以让代码快 8–16 倍——而且不需要离开 Swift。
人月神话Lee3 个月前
ios·ai编程·图像识别
【图像处理】Core Image 与 GPU 渲染管线——让滤镜飞起来CPU 是一位精英工程师,一次专心做一件事; GPU 是一支万人工厂,每条流水线同时处理一块像素。 选对工具,差距可以是 10 倍。