Tiger AI 手势识别大升级:从数字到无声世界,双手同时比划也能秒识别
参考 https://mp.weixin.qq.com/s/Vd0nMOSkUBXaM17TXED2EQ
帮助聋哑人沟通
最近,我们在 Tiger AI Platform 上对手势识别模块做了一次全面重构。这次升级不只是"能数手指"这么简单------从 0 到 9 的数字手势(包括中式比法)、到 30 类中国手语字母与声母,三套输入源、两套识别引擎同时运行,双手一起比划,系统照样分得清。
本文按「有什么新能力 → 怎么上手 → 怎么拍得更准」的顺序展开,文末附一份 5 分钟快速上手清单和 4 个真实踩坑记录,建议先收藏。
一、功能入口与页面布局
登录平台后,进入菜单 AI 应用 → 手势识别 (路径 /ai/handpose)。
整个页面分为三大区域:
- 顶部控制栏:模型选择、输入源切换、参数调节
- 中间预览区:实时画面 + 骨架/检测框叠加渲染
- 右侧结果区:当前识别结果、分项置信度、动态识别序列
⚠️ 第一次打开页面,先确认模型和输入源是否选对------这是 80% 用户反馈"识别不了"的头号原因。
二、双引擎并行:数字手势 + 中国手语
系统内置两条完全独立的识别链路,支持同时勾选、同时输出:
| 引擎 | 技术方案 | 识别范围 |
|---|---|---|
| 数字手势 | MediaPipe 21 关键点 + 角度分类 | 单手 0--9(含中式 6--9);双手按「右前左后」组合 |
| 中国手语 | YOLO11s(ONNX)先定位再分类 | 30 类:A--Z 字母 + CH、NG、SH、ZH 四个声母 |
当两个模型同时开启时,主结果区会拼接显示:
格式:数字结果 | 手语结果
示例:左手比 1、右手比 2,同时打出「A」
主结果:2 1 | A
两路结果互不影响------数字链路没识别出来,手语链路照样输出,反之亦然。
三、数字手势:0--9 与双手组合
1. 单手数字(含中式比法)
基于 MediaPipe 的 21 个手部关键点,参考 OpenCV Zoo 的 GestureClassification 思路:
- 常规握拳、伸指等基础指法
- 中式单手数字:拇指小指张开的「6」、拇指食指中指并拢的「9」等
很多国外开源方案只认 0--5,遇到中式「6」「7」「8」「9」直接翻车------这次升级专门补上了这个缺口。
2. 双手组合:固定「右 左」顺序
检测到左右手后,展示格式统一为:
右手数字 + 空格 + 左手数字
例如:左手比 1、右手比 2 → 显示 2 1;若只有一只手被识别,就只显示单侧结果。
口诀:右手在前,左手在后。 这是为了消除镜像歧义特意设计的规则,具体原因见文末踩坑案例。
四、中国手语:30 类无声字母
手语识别基于 YOLO11s ONNX 模型,覆盖 30 个类别:
- 26 个英文字母:A--Z
- 4 个汉语声母:CH、NG、SH、ZH
为抑制复杂背景下的误检,推理前增加了一步手部 ROI 裁剪,配合偏保守的默认置信度阈值,误报率显著下降。
拍摄建议(直接影响识别率):
- 手尽量靠近镜头,在画面中占比要大
- 背景尽量简洁、光线均匀
- 单手手势稳定性优于双手;复杂背景容易误检
五、三种输入源:实时 / 单图 / 视频批量
「来源」下拉框提供三种模式,共用同一套识别后端:
├─ 本地摄像头(实时识别)
├─ 图片(单张离线样例)
└─ 本地视频(异步批量处理)
1. 本地摄像头 · 实时模式
适合现场演示、互动体验:
- 选择摄像头设备(可点击「刷新」)
- 勾选识别模型(可单选可多选)
- 点击「开始识别」
- 对镜头比划,实时查看骨架叠加与识别结果
稳定保持约 1 秒 自动记入下方「识别序列」;开启「语音播报」后,稳定结果会直接朗读,演示效果拉满。
2. 图片 · 单张模式
适合离线对比、截图验证:
- 来源切换为「图片」
- 选择本地图片,自动触发识别
- 查看标注图与结果区
3. 本地视频 · 异步批量
适合回看录像、课堂素材、批量抽帧分析:
- 来源切换为「本地视频」
- 选择视频文件,设置抽帧间隔
- 点击「开始识别视频」
- 等待进度条完成(后端异步任务,可切去做别的事)
- 播放标注结果,点击序列中的任意一行即可跳转到对应时间点
六、结果区怎么看
结果区分三层信息:
- 大号主结果 :数字、手语,或
数字 | 手语拼接 - 分项结果:数字手势、中国手语分别展示置信度
- 识别序列:随时间累积的稳定结果,支持点击跳转(视频模式下)
识别序列是最容易被低估的功能------摄像头模式下记录你的演示轨迹;视频模式下,点击序列即可精准定位到对应画面,回看课堂录像、分析演示素材非常方便。
七、参数调优:先跑通,再微调
配置区提供部分高级选项:
- 检测 / 关键点置信度阈值(数字手势链路)
- 手语检测置信度(默认偏保守,减少误检)
调参原则:先默认参数跑通,确认拍摄条件没问题后,再逐步微调。
反面教材:一边拍一边猛调参数,变量太多,根本分不清是拍摄问题还是参数问题。
八、5 分钟快速上手清单
- 打开 AI 应用 → 手势识别
- 勾选模型:先单独试「数字手势」或「中国手语」,再试双开
- 来源选「本地摄像头」→ 选设备 → 点击「开始识别」
- 数字:先练单手 0--9,再练双手「右 左」组合
- 手语:手靠近镜头、背景干净,先试 A / B / SH
- 有录好的素材:切「本地视频」,跑完看标注回放与识别序列
九、4 个真实踩坑案例
| 现象 | 原因 | 解法 |
|---|---|---|
| 画面里明明没手,却出现检测框 | 背景杂乱,模型把相似纹理误判为手 | 换纯色/简洁背景,或调高检测置信度 |
| 双手都举起来了,结果只显示单侧 | 两只手被标成了同一侧(左右判定错误) | 确保双手在画面中不重叠,保持一定间距 |
| 结果一直在跳,数字忽大忽小 | 手晃动或背景干扰,置信度波动 | 手保持稳定 1 秒以上;调低关键点置信度 |
| 视频识别像卡住,进度条不动 | 抽帧间隔设得太小,后端处理不过来 | 适当增大抽帧间隔,或等异步任务完成 |
以上就是 Tiger AI 平台手势识别功能的完整解析。如果你在实际使用中遇到其他问题,欢迎在评论区留言,我们会持续迭代优化。
觉得有用?转发给需要的朋友,或者直接上手试试 👉 /ai/handpose