Tiger AI 平台「手势识别」功能全解析:从数字手势 0–9,到中国手语字母,再到本地视频批量识别——一条链路,三种输入,双模型可同开;双手比划,机器秒懂

双手比划,机器秒懂:Tiger AI 平台「手势识别」功能全解析

从数字手势 0--9,到中国手语字母,再到本地视频批量识别------一条链路,三种输入,双模型可同开。

文章目录


大家好,我是 Tiger。

最近我们在 Tiger AI 计算机视觉平台 里,把「手势识别」这块能力做了一轮完整升级。不只是数手指那么简单:既能认 中式数字手势 0--9 ,也能认 中国手语字母/声母 ,还支持 摄像头实时、图片、本地视频 三种用法。

下面按「能做什么 → 怎么用 → 怎么拍更准」来讲,文中需要配操作截图的地方,都留了图片位置,方便你后续粘贴。


一、先看一眼:功能入口长什么样

登录平台后,进入菜单:AI智能识别→ 视觉识别 → 手势识别 (路由 /ai/handpose)。

页面上方是配置区(选模型、选来源、调参数),下方是预览画布 + 识别结果 + 识别序列。

完整浏览器窗口,「识别模型」「来源」「开始识别」按钮。


二、两大识别引擎,可多选同开

系统内置两套识别能力,支持多选

模型 技术路径 能认什么
数字手势(MediaPipe 0--9) 手掌检测 + 21 关键点 + 角度分类 单手 0--9(含中式 6--9);双手按「右空格左」组合显示
中国手语(YOLO11s) 先定位手部再 YOLO 检测 30 类:A--Z,以及 CH、NG、SH、ZH

同时勾选时,主结果会拼成:

text 复制代码
数字结果 | 手语结果

例如左手比 1、右手比 4,同时做出手语「A」,可能显示为:4 1 | A`。


三、数字手势:0--9 与双手组合

1. 单手 0--9(含中式)

在 MediaPipe 关键点基础上,参考 OpenCV Zoo 的 GestureClassification 思路:

  • 0--5:握拳、伸指等常规指法
  • 6--9:中式单手数字(如拇指小指张开的「6」、拇指食指中指并拢的「9」等)

2. 双手:「右 左」组合

检测到手部左右后,展示格式为:

text 复制代码
右手数字 + 空格 + 左手数字

例如:左手 1、右手 2 → 显示 2 1

一侧未认出时,只显示有结果的一侧。


四、中国手语:30 类字母 / 声母

中国手语模式基于 YOLO11s(ONNX),类别包括:

  • 英文字母:A--Z
  • 声母类:CH、NG、SH、ZH

为减少「背景乱框」,推理前会先做手部定位,再在手部区域识别,默认置信度阈值也调得更严一些。

拍摄建议:

  • 手尽量靠近镜头、占画面足够大
  • 背景尽量简洁、光线均匀
  • 单手手势更稳;复杂背景易误检

检测框 + 标签 + 右侧结果区中文读法


五、三种输入来源:摄像头 / 图片 / 本地视频

「来源」下拉里有三项:

模式 1:本地摄像头(实时)

  1. 选择摄像头设备(可点「刷新」)
  2. 勾选识别模型
  3. 点击 开始识别
  4. 对镜头比划,看实时结果与骨架/检测框

稳定约 1 秒 会自动记入下方「识别序列」;可勾选 语音播报


模式 2:图片(单张)

适合演示、截图对比、离线样例:

  1. 来源选 图片
  2. 选择本地图片
  3. 自动/立即触发识别
  4. 看标注图与结果区

模式 3:本地视频(异步批量)

适合回看录制内容、课堂演示、批量抽帧:

  1. 来源选 本地视频
  2. 选择视频文件
  3. 点击 开始识别视频
  4. 等待进度条完成(后端异步任务)
  5. 播放 标注后的结果视频,并在序列表里点击跳转时间点

六、结果区与识别序列怎么读

右侧 / 下方通常会看到:

  • 主结果 :大号文字(数字、手语,或 数字 | 手语
  • 分项:数字结果、手语结果(多模型时)
  • 识别序列:随时间累计的稳定结果;视频模式下可点击定位

可选能力:

  • 语音播报:稳定结果变化时朗读
  • 帮助图标(问号):页面内有简短说明气泡

七、操作参数(可选调优)

配置区还提供部分高级项(具体以页面为准),常见包括:

  • 检测 / 关键点相关阈值(数字手势链路)
  • 手语检测置信度(默认偏保守,减少误检)

调参时建议:先默认跑通,再小幅调整,避免一边拍一边猛调导致体验抖动。


八、五分钟上手清单(可转发收藏)

  1. 打开 人工智能 → 手势识别
  2. 勾选模型:先单独试「数字」或「手语」,再试多选
  3. 来源选 本地摄像头 → 选设备 → 开始识别
  4. 数字:练一手 0--9,再练双手「右 左」组合
  5. 手语:手靠近镜头,背景干净,比 A / B / SH 等
  6. 有录好的素材:切 本地视频,跑完看标注回放与序列

九、技术要点(给想深挖的同学)

不必全懂也能用;若你关心实现,可记住这几条:

  1. 数字手势 :OpenCV Zoo MediaPipe 手掌检测 + 手部关键点,CPU 上 cv2.dnn 推理;分类侧对齐 Zoo 的 0--9(含中式 6--9)。
  2. 左右手展示:按「右手在前、左手在后」拼字符串,避免镜面/标签歧义导致双手都标成 Right。
  3. 中国手语:YOLO11s ONNX,30 类;先 MediaPipe 裁手再检测,压低背景误检。
  4. 多模型 :一次请求可合并两路结果,前端用 | 拼接主展示。
  5. 视频:上传后异步任务 + 进度查询 + 输出标注视频与时间戳序列。

模型文件由平台 模型管理 登记绑定(如 MediaPipe 手势目录、中国手语 YOLO 权重目录),页面启动时会检查是否可用。


十、写在最后

手势是人机交互里最自然的「无接触接口」之一。

Tiger AI 这次把手势识别做成 可演示、可切换、可录像回看 的完整页面:课堂、展厅、无障碍相关 demo,都能直接用。

如果你也在做 CV 落地,欢迎试用平台、提需求、提 issue。

下一篇我们可以继续聊:姿态估计、人员跌倒检测和告警的业务场景设计。

关注我们,一起把 AI 用到看得见的地方。


文末信息

  • 产品:Tiger AI 计算机视觉平台
  • 功能页:人工智能 → 手势识别
  • 能力摘要 :数字 0--9(含中式)|中国手语 30 类|摄像头 / 图片 / 视频|双模型多选|序列与语音
    提需求、提 issue。
    下一篇我们可以继续聊:姿态估计、人员跌倒检测和告警的业务场景设计。

关注我们,一起把 AI 用到看得见的地方。


相关推荐
ai小陈7 小时前
PyTorch实验可复现实战:随机种子、依赖锁定与配置归档
人工智能·pytorch·python·深度学习·ai·gpu算力
喜欢睡觉7 小时前
从"堵车"到"水管":一文搞懂 SSE 流式输出与大模型结构化解析
人工智能
郝学胜-神的一滴7 小时前
C++11 工程级应用 08:Lambda表达式与Tuple元组
开发语言·jvm·c++·python·程序人生·开源
聚铭网络7 小时前
【一周安全资讯】两项数据资产分类与登记国家标准9月1日实施;索尼、华纳联合起诉Anthropic,指控盗用版权音乐训练Claude模型
人工智能·安全·分类
自信人间三百年7 小时前
STEPONMOON的人工智能之旅(五)
人工智能
阿尔法工场研究院7 小时前
deepseek时刻到来前,洋河先重置了自己
人工智能
岁月宁静7 小时前
三、《从零手撸 Agent》 · system prompt 与核心参数:调好你的旋钮
后端·python·agent
财复视界7 小时前
光智科技15.6亿存货背后的业务逻辑与风险管控
大数据·人工智能·科技
卷无止境7 小时前
除了写代码,AI智能体还能帮开发者做什么
人工智能·python