传统客流统计系统的核心任务是检测"有人经过",然后按照进出方向累加计数。
这种方案在单一通道、人员稀疏的环境中实现比较简单,但进入商场、连锁门店、展馆等复杂场景后,单纯依靠二维图像检测容易受到遮挡、光照、目标尺度变化和人员交叉的影响。
因此,新一代智能客流系统的技术重点已经从"计数"转向"感知---识别---跟踪---统计---分析"的完整数据链路。
从系统架构来看,3D视觉负责建立空间信息,AI模型负责目标检测与属性提取,Tracking负责目标连续关联,数据分析模块负责将事件转换为客流指标。
一、从二维检测转向三维空间感知
普通RGB摄像头获取的是二维图像:
Image = RGB(x, y)
而3D视觉系统需要进一步获得深度信息:
Depth = Z(x, y)
结合相机内参和外参,可以将像素坐标映射到三维空间:
P = K^-1 × [u,v,1] × Z
其中:
-
u、v:图像像素坐标 -
Z:目标深度 -
K:相机内参 -
P:三维空间坐标
目前常见的3D客流感知技术包括双目立体视觉和ToF。
双目视觉通过左右相机之间的视差计算深度:
Z = f × B / d
其中:
-
f:焦距 -
B:双目基线 -
d:视差
ToF则通过测量红外光传播时间获得深度。
不同传感器在安装高度、光照、遮挡、成本和空间覆盖范围方面存在差异,因此实际系统通常需要根据部署环境选择传感器方案。
二、AI检测不应该直接等于"人数"
客流系统真正需要处理的是目标生命周期。
一个典型处理链路可以表示为:
Sensor
↓
Image / Depth Acquisition
↓
Calibration
↓
3D Reconstruction
↓
Person Detection
↓
Object Tracking
↓
Trajectory
↓
Line / Zone Event
↓
People Counting
↓
Data Aggregation
目标检测模块输出:
Person {
bbox
confidence
depth
center
}
随后Tracking模块根据位置、速度、外观或深度特征建立目标ID。
例如某个人从:
Frame 100 → ID 08
Frame 101 → ID 08
Frame 102 → ID 08
...
Frame 150 → ID 08
即使这个人连续出现在50个视频帧中,统计模块也不能将其计算为50个客流事件。
这也是"检测"和"计数"的区别。
检测回答:
当前画面里有几个人?
Tracking回答:
这些人是不是上一帧已经存在的目标?
Counting回答:
哪些目标完成了指定方向的空间事件?
三、遮挡场景是算法设计的重点
二维检测最大的工程难点之一是遮挡。
例如两个人并排进入门店:
Person A
Person B
在RGB画面中,两个人可能出现:
┌──────────┐
│ ██ │
│ ████ │
│ ██ │
└──────────┘
如果直接进行二维目标检测,可能产生:
-
一个目标;
-
两个目标;
-
一个目标被重复分割;
-
Tracking ID发生切换。
3D信息可以增加高度、空间位置和深度维度,使系统不再完全依赖二维轮廓。
已有3D客流研究采用立体视觉获取深度图,再结合目标检测和Kalman Filter进行跟踪与计数,这说明"深度+Tracking"本身就是客流系统的重要技术路线。
四、AI识别从检测扩展到多任务模型
未来客流系统不会只运行一个People Detection模型。
更合理的模型结构是多任务AI:
┌─ Person Detection
│
Input → Backbone ├─ Attribute Recognition
│
├─ Re-ID Feature
│
└─ Pose / Spatial Feature
例如同一个目标可以同时产生:
Detection Score
Tracking ID
Depth Position
Gender
Age Group
Employee Tag
Re-ID Feature
这样数据层就可以进一步计算:
有效客流
停留时间
区域人数
重复进入
员工流量
进出方向
热区分布
需要注意的是,Re-ID并不等同于人脸识别。
Re-ID的工程目标通常是让系统判断两个不同时间出现的目标是否可能属于同一轨迹,从而降低重复统计。
五、边缘AI将成为主要计算节点
如果所有原始视频都上传云端,再完成检测、Tracking和统计,会产生较高的数据传输压力。
因此比较典型的架构正在转向:
Local Edge Device
│
┌───────┴────────┐
│ │
AI Inference Tracking
│ │
└───────┬────────┘
↓
Structured Data
↓
Cloud
↓
Data Analytics
边缘设备负责:
-
视频采集
-
深度计算
-
AI推理
-
Tracking
-
事件判断
-
本地缓存
云平台负责:
-
多设备数据汇总
-
历史数据查询
-
报表
-
API
-
跨门店数据分析
这种架构的一个直接结果是:云端不再必须处理完整视频流,而可以接收结构化事件数据。
例如:
{
"device_id": "CCD21",
"timestamp": "2026-09-04T10:32:18",
"direction": "IN",
"count": 1,
"zone": "entrance"
}
数据量相比连续视频流会显著降低。
边缘AI的优势还包括低延迟、网络异常情况下继续工作以及减少原始数据上传需求。当前产业方案已经大量采用"AI on Edge + 非身份化数据上传"的模式。
六、数据分析层决定系统最终输出什么
如果系统只输出:
今日客流:1256
实际上只完成了最基础的数据采集。
更完整的数据模型应该至少包含:
Footfall
Occupancy
Dwell Time
Flow
Entry / Exit
Zone Traffic
Unique Traffic
Staff Traffic
然后形成时间维度:
1分钟
5分钟
15分钟
小时
日
周
月
例如:
Hour | Entry | Exit | Occupancy | Dwell
10:00 | 42 | 18 | 24 | 126s
11:00 | 56 | 37 | 43 | 148s
12:00 | 73 | 61 | 55 | 173s
这种数据结构比单纯的"每日人数"更适合后续算法处理。
七、未来系统的核心不是更大的模型,而是更完整的数据链
智能客流系统最终会形成:
3D Sensor
↓
Spatial Perception
↓
AI Detection
↓
Tracking / Re-ID
↓
Event Engine
↓
Data Model
↓
Analytics
↓
API / Dashboard
其中任何一层出现问题,最终客流数据都会受到影响。
因此未来客流系统的技术竞争点不会只集中在AI模型准确率,而会逐渐转向:
-
3D空间感知精度
-
遮挡条件下的Tracking稳定性
-
边缘推理延迟
-
多目标跟踪连续性
-
重复目标过滤
-
数据断点续传
-
多设备时间同步
-
数据接口标准化
-
隐私保护
从"摄像头+计数器"发展到"3D感知节点+Edge AI+数据平台",是智能客流系统架构变化的核心。
最终输出的不应该只是一个人数,而是一组经过空间感知、目标关联和事件计算之后形成的结构化客流数据。
