Tiger AI 平台「手势识别」功能全解析:从数字手势 0–9,到中国手语字母,再到本地视频批量识别——一条链路,三种输入,双模型可同开;双手比划,机器秒懂

双手比划,机器秒懂:Tiger AI 平台「手势识别」功能全解析

从数字手势 0--9,到中国手语字母,再到本地视频批量识别------一条链路,三种输入,双模型可同开。

文章目录


大家好,我是 Tiger。

最近我们在 Tiger AI 计算机视觉平台 里,把「手势识别」这块能力做了一轮完整升级。不只是数手指那么简单:既能认 中式数字手势 0--9 ,也能认 中国手语字母/声母 ,还支持 摄像头实时、图片、本地视频 三种用法。

下面按「能做什么 → 怎么用 → 怎么拍更准」来讲,文中需要配操作截图的地方,都留了图片位置,方便你后续粘贴。


一、先看一眼:功能入口长什么样

登录平台后,进入菜单:AI智能识别→ 视觉识别 → 手势识别 (路由 /ai/handpose)。

页面上方是配置区(选模型、选来源、调参数),下方是预览画布 + 识别结果 + 识别序列。

完整浏览器窗口,「识别模型」「来源」「开始识别」按钮。


二、两大识别引擎,可多选同开

系统内置两套识别能力,支持多选

模型 技术路径 能认什么
数字手势(MediaPipe 0--9) 手掌检测 + 21 关键点 + 角度分类 单手 0--9(含中式 6--9);双手按「右空格左」组合显示
中国手语(YOLO11s) 先定位手部再 YOLO 检测 30 类:A--Z,以及 CH、NG、SH、ZH

同时勾选时,主结果会拼成:

text 复制代码
数字结果 | 手语结果

例如左手比 1、右手比 4,同时做出手语「A」,可能显示为:4 1 | A`。


三、数字手势:0--9 与双手组合

1. 单手 0--9(含中式)

在 MediaPipe 关键点基础上,参考 OpenCV Zoo 的 GestureClassification 思路:

  • 0--5:握拳、伸指等常规指法
  • 6--9:中式单手数字(如拇指小指张开的「6」、拇指食指中指并拢的「9」等)

2. 双手:「右 左」组合

检测到手部左右后,展示格式为:

text 复制代码
右手数字 + 空格 + 左手数字

例如:左手 1、右手 2 → 显示 2 1

一侧未认出时,只显示有结果的一侧。


四、中国手语:30 类字母 / 声母

中国手语模式基于 YOLO11s(ONNX),类别包括:

  • 英文字母:A--Z
  • 声母类:CH、NG、SH、ZH

为减少「背景乱框」,推理前会先做手部定位,再在手部区域识别,默认置信度阈值也调得更严一些。

拍摄建议:

  • 手尽量靠近镜头、占画面足够大
  • 背景尽量简洁、光线均匀
  • 单手手势更稳;复杂背景易误检

检测框 + 标签 + 右侧结果区中文读法


五、三种输入来源:摄像头 / 图片 / 本地视频

「来源」下拉里有三项:

模式 1:本地摄像头(实时)

  1. 选择摄像头设备(可点「刷新」)
  2. 勾选识别模型
  3. 点击 开始识别
  4. 对镜头比划,看实时结果与骨架/检测框

稳定约 1 秒 会自动记入下方「识别序列」;可勾选 语音播报


模式 2:图片(单张)

适合演示、截图对比、离线样例:

  1. 来源选 图片
  2. 选择本地图片
  3. 自动/立即触发识别
  4. 看标注图与结果区

模式 3:本地视频(异步批量)

适合回看录制内容、课堂演示、批量抽帧:

  1. 来源选 本地视频
  2. 选择视频文件
  3. 点击 开始识别视频
  4. 等待进度条完成(后端异步任务)
  5. 播放 标注后的结果视频,并在序列表里点击跳转时间点

六、结果区与识别序列怎么读

右侧 / 下方通常会看到:

  • 主结果 :大号文字(数字、手语,或 数字 | 手语
  • 分项:数字结果、手语结果(多模型时)
  • 识别序列:随时间累计的稳定结果;视频模式下可点击定位

可选能力:

  • 语音播报:稳定结果变化时朗读
  • 帮助图标(问号):页面内有简短说明气泡

七、操作参数(可选调优)

配置区还提供部分高级项(具体以页面为准),常见包括:

  • 检测 / 关键点相关阈值(数字手势链路)
  • 手语检测置信度(默认偏保守,减少误检)

调参时建议:先默认跑通,再小幅调整,避免一边拍一边猛调导致体验抖动。


八、五分钟上手清单(可转发收藏)

  1. 打开 人工智能 → 手势识别
  2. 勾选模型:先单独试「数字」或「手语」,再试多选
  3. 来源选 本地摄像头 → 选设备 → 开始识别
  4. 数字:练一手 0--9,再练双手「右 左」组合
  5. 手语:手靠近镜头,背景干净,比 A / B / SH 等
  6. 有录好的素材:切 本地视频,跑完看标注回放与序列

九、技术要点(给想深挖的同学)

不必全懂也能用;若你关心实现,可记住这几条:

  1. 数字手势 :OpenCV Zoo MediaPipe 手掌检测 + 手部关键点,CPU 上 cv2.dnn 推理;分类侧对齐 Zoo 的 0--9(含中式 6--9)。
  2. 左右手展示:按「右手在前、左手在后」拼字符串,避免镜面/标签歧义导致双手都标成 Right。
  3. 中国手语:YOLO11s ONNX,30 类;先 MediaPipe 裁手再检测,压低背景误检。
  4. 多模型 :一次请求可合并两路结果,前端用 | 拼接主展示。
  5. 视频:上传后异步任务 + 进度查询 + 输出标注视频与时间戳序列。

模型文件由平台 模型管理 登记绑定(如 MediaPipe 手势目录、中国手语 YOLO 权重目录),页面启动时会检查是否可用。


十、写在最后

手势是人机交互里最自然的「无接触接口」之一。

Tiger AI 这次把手势识别做成 可演示、可切换、可录像回看 的完整页面:课堂、展厅、无障碍相关 demo,都能直接用。

如果你也在做 CV 落地,欢迎试用平台、提需求、提 issue。

下一篇我们可以继续聊:姿态估计、人员跌倒检测和告警的业务场景设计。

关注我们,一起把 AI 用到看得见的地方。


文末信息

  • 产品:Tiger AI 计算机视觉平台
  • 功能页:人工智能 → 手势识别
  • 能力摘要 :数字 0--9(含中式)|中国手语 30 类|摄像头 / 图片 / 视频|双模型多选|序列与语音
    提需求、提 issue。
    下一篇我们可以继续聊:姿态估计、人员跌倒检测和告警的业务场景设计。

关注我们,一起把 AI 用到看得见的地方。


相关推荐
chen_zn9544 分钟前
《VLA 系列》RLT | RL Token | 轻量 Actor-Critic | 在线强化学习与源码解析
人工智能·强化学习·具身智能·vla
fthux1 小时前
装闭 RenoPit 源码解析(10):AI如何审查装修合同与报价单
人工智能·ai·开源·github·open source·renopit
AI_AGENT_DEV_AI1 小时前
AI 智能体的开发费用
人工智能
zhenaibo5211 小时前
摘要、研究背景、文献综述AI风险高,怎么优化?
人工智能·深度学习·自然语言处理
Eloudy1 小时前
预词力:LLM 的唯一形式化能力
人工智能·算法·agent
XDevelop AI智能应用软件开发1 小时前
AI演进下的“第五次软件危机”与软件工程重塑
人工智能·软件工程·ai编程·软件危机
DogDaoDao1 小时前
【H266/VVC提案解读】ITU-T H.274 (V4) 规范深度解读 — 视频编码 SEI 消息的全面演进
音视频·实时音视频·视频编解码·流媒体·h266·vvc·视频编解码标准
企鹅的企1 小时前
2027北京AI健康科技与智慧医疗展官方从速锁定
人工智能·科技·机器人
中科高级技工学校2 小时前
乌鲁木齐美术艺考技校实践分享
人工智能·python
小相会自律2 小时前
DeepSeek V4 Pro 正式版深度解析:Agent能力跃升、双生态API与峰谷定价全解读
人工智能