AiBrainBox-UGV 的目标跟踪从"传统视觉跟踪"升级为"语义目标跟踪"

关键边界:
不要让 CLIP 直接承担实时跟踪,而应该让 CLIP 成为 Tracking Engine 的"语义认知层",与检测、Re-ID、运动模型、LiDAR/UWB共同参与目标关联。
通用 Human Target Tracking Engine 的方向
CLIP最擅长的是:
图像 ↔ 文本语义空间对齐
而不是:
每帧进行复杂的空间推理、轨迹预测。

CLIP是"认知辅助",不是"运动跟踪核心"。

这个架构比单纯的:
YOLO + DeepSORT + EKF
明显更有AiBrainBox的特色。
Referring Target Tracking
也就是:
基于自然语言/属性描述的目标跟踪。



CLIP对"遮挡恢复"尤其有价值-多模态目标重识别

CLIP还有一个更大的价值:从"人"扩展到"物"


因为:
跟踪需要高频,语义不需要高频。
CLIP的输出可以缓存成:
Semantic Memory
而不是每帧重新推理。


AiBrainBox的NPU扩展卡
从:
AI Compute
升级成:
Target Intelligence Compute
"视觉语义层"-Semantic Vision Engine

AiBrainBox-UGV的视觉跟踪变成"五层"

Semantic + Appearance + Geometry + Motion + Identity
五维目标模型。
Semantic Multi-Modal Target Tracking Engine
即:
语义 + 视觉 + LiDAR + UWB + IMU +(未来Radar)
共同构建一个"目标数字身份"。
