双手比划,机器秒懂:Tiger AI 平台「手势识别」功能全解析
从数字手势 0--9,到中国手语字母,再到本地视频批量识别------一条链路,三种输入,双模型可同开。
文章目录
- [双手比划,机器秒懂:Tiger AI 平台「手势识别」功能全解析](#双手比划,机器秒懂:Tiger AI 平台「手势识别」功能全解析)
-
- 一、先看一眼:功能入口长什么样
- 二、两大识别引擎,可多选同开
- [三、数字手势:0--9 与双手组合](#三、数字手势:0–9 与双手组合)
-
- [1. 单手 0--9(含中式)](#1. 单手 0–9(含中式))
- [2. 双手:「右 左」组合](#2. 双手:「右 左」组合)
- [四、中国手语:30 类字母 / 声母](#四、中国手语:30 类字母 / 声母)
- [五、三种输入来源:摄像头 / 图片 / 本地视频](#五、三种输入来源:摄像头 / 图片 / 本地视频)
-
- [模式 1:本地摄像头(实时)](#模式 1:本地摄像头(实时))
- [模式 2:图片(单张)](#模式 2:图片(单张))
- [模式 3:本地视频(异步批量)](#模式 3:本地视频(异步批量))
- 六、结果区与识别序列怎么读
- 七、操作参数(可选调优)
- 八、五分钟上手清单(可转发收藏)
- 九、技术要点(给想深挖的同学)
- 十、写在最后
大家好,我是 Tiger。
最近我们在 Tiger AI 计算机视觉平台 里,把「手势识别」这块能力做了一轮完整升级。不只是数手指那么简单:既能认 中式数字手势 0--9 ,也能认 中国手语字母/声母 ,还支持 摄像头实时、图片、本地视频 三种用法。
下面按「能做什么 → 怎么用 → 怎么拍更准」来讲,文中需要配操作截图的地方,都留了图片位置,方便你后续粘贴。
一、先看一眼:功能入口长什么样
登录平台后,进入菜单:AI智能识别→ 视觉识别 → 手势识别 (路由 /ai/handpose)。
页面上方是配置区(选模型、选来源、调参数),下方是预览画布 + 识别结果 + 识别序列。

完整浏览器窗口,「识别模型」「来源」「开始识别」按钮。
二、两大识别引擎,可多选同开
系统内置两套识别能力,支持多选:
| 模型 | 技术路径 | 能认什么 |
|---|---|---|
| 数字手势(MediaPipe 0--9) | 手掌检测 + 21 关键点 + 角度分类 | 单手 0--9(含中式 6--9);双手按「右空格左」组合显示 |
| 中国手语(YOLO11s) | 先定位手部再 YOLO 检测 | 30 类:A--Z,以及 CH、NG、SH、ZH |
同时勾选时,主结果会拼成:
text
数字结果 | 手语结果
例如左手比 1、右手比 4,同时做出手语「A」,可能显示为:4 1 | A`。

三、数字手势:0--9 与双手组合
1. 单手 0--9(含中式)
在 MediaPipe 关键点基础上,参考 OpenCV Zoo 的 GestureClassification 思路:
- 0--5:握拳、伸指等常规指法
- 6--9:中式单手数字(如拇指小指张开的「6」、拇指食指中指并拢的「9」等)


2. 双手:「右 左」组合
检测到手部左右后,展示格式为:
text
右手数字 + 空格 + 左手数字
例如:左手 1、右手 2 → 显示 2 1 。
一侧未认出时,只显示有结果的一侧。

四、中国手语:30 类字母 / 声母
中国手语模式基于 YOLO11s(ONNX),类别包括:
- 英文字母:A--Z
- 声母类:CH、NG、SH、ZH
为减少「背景乱框」,推理前会先做手部定位,再在手部区域识别,默认置信度阈值也调得更严一些。
拍摄建议:
- 手尽量靠近镜头、占画面足够大
- 背景尽量简洁、光线均匀
- 单手手势更稳;复杂背景易误检

检测框 + 标签 + 右侧结果区中文读法
五、三种输入来源:摄像头 / 图片 / 本地视频
「来源」下拉里有三项:

模式 1:本地摄像头(实时)
- 选择摄像头设备(可点「刷新」)
- 勾选识别模型
- 点击 开始识别
- 对镜头比划,看实时结果与骨架/检测框
稳定约 1 秒 会自动记入下方「识别序列」;可勾选 语音播报。

模式 2:图片(单张)
适合演示、截图对比、离线样例:
- 来源选 图片
- 选择本地图片
- 自动/立即触发识别
- 看标注图与结果区

模式 3:本地视频(异步批量)
适合回看录制内容、课堂演示、批量抽帧:
- 来源选 本地视频
- 选择视频文件
- 点击 开始识别视频
- 等待进度条完成(后端异步任务)
- 播放 标注后的结果视频,并在序列表里点击跳转时间点


六、结果区与识别序列怎么读
右侧 / 下方通常会看到:
- 主结果 :大号文字(数字、手语,或
数字 | 手语) - 分项:数字结果、手语结果(多模型时)
- 识别序列:随时间累计的稳定结果;视频模式下可点击定位

可选能力:
- 语音播报:稳定结果变化时朗读
- 帮助图标(问号):页面内有简短说明气泡

七、操作参数(可选调优)
配置区还提供部分高级项(具体以页面为准),常见包括:
- 检测 / 关键点相关阈值(数字手势链路)
- 手语检测置信度(默认偏保守,减少误检)
调参时建议:先默认跑通,再小幅调整,避免一边拍一边猛调导致体验抖动。

八、五分钟上手清单(可转发收藏)
- 打开 人工智能 → 手势识别
- 勾选模型:先单独试「数字」或「手语」,再试多选
- 来源选 本地摄像头 → 选设备 → 开始识别
- 数字:练一手 0--9,再练双手「右 左」组合
- 手语:手靠近镜头,背景干净,比 A / B / SH 等
- 有录好的素材:切 本地视频,跑完看标注回放与序列
九、技术要点(给想深挖的同学)
不必全懂也能用;若你关心实现,可记住这几条:
- 数字手势 :OpenCV Zoo MediaPipe 手掌检测 + 手部关键点,CPU 上
cv2.dnn推理;分类侧对齐 Zoo 的 0--9(含中式 6--9)。 - 左右手展示:按「右手在前、左手在后」拼字符串,避免镜面/标签歧义导致双手都标成 Right。
- 中国手语:YOLO11s ONNX,30 类;先 MediaPipe 裁手再检测,压低背景误检。
- 多模型 :一次请求可合并两路结果,前端用
|拼接主展示。 - 视频:上传后异步任务 + 进度查询 + 输出标注视频与时间戳序列。
模型文件由平台 模型管理 登记绑定(如 MediaPipe 手势目录、中国手语 YOLO 权重目录),页面启动时会检查是否可用。

十、写在最后
手势是人机交互里最自然的「无接触接口」之一。
Tiger AI 这次把手势识别做成 可演示、可切换、可录像回看 的完整页面:课堂、展厅、无障碍相关 demo,都能直接用。
如果你也在做 CV 落地,欢迎试用平台、提需求、提 issue。
下一篇我们可以继续聊:姿态估计、人员跌倒检测和告警的业务场景设计。
关注我们,一起把 AI 用到看得见的地方。
文末信息
- 产品:Tiger AI 计算机视觉平台
- 功能页:人工智能 → 手势识别
- 能力摘要 :数字 0--9(含中式)|中国手语 30 类|摄像头 / 图片 / 视频|双模型多选|序列与语音
提需求、提 issue。
下一篇我们可以继续聊:姿态估计、人员跌倒检测和告警的业务场景设计。
关注我们,一起把 AI 用到看得见的地方。