什么是 轨迹平均精确率(Track mAP)?
轨迹平均精确率(Track mAP)是一种置信度排序的 Tracking Metric:它按声明的 Track Similarity Threshold 匹配预测与 Ground Truth Trajectory,再计算 Average Precision。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
在完整轨迹上定义相似度
Track mAP 需要 Trajectory Similarity,而不只是 Frame-level Similarity。Box 或 Mask 的常见定义是 Spatiotemporal IoU:逐帧累加 Intersection Area,再除以逐帧 Union Area 总和;对象缺席时将对应区域视为空。另一种历史变体先阈值化逐帧 Match,再用 TP、FN 与 FP 计算 Jaccard Score。
YouTube-VIS 原始论文使用 Mask-track IoU,并平均 0.50 至 0.95 的 IoU Threshold AP。TAO使用 Box-track 3D IoU 与 Federated Annotation Protocol,说明 Representation 与 Label Policy 都属于指标契约。
排序轨迹、贪心匹配并积分精确率召回率
每个类别内先按 Confidence 从高到低排序预测 Track。如果预测超过 Trajectory Similarity Threshold,且能占用一个仍未匹配的合格 Ground Truth,它就是 True-positive Track;否则为 False Positive。累计 Precision 与 Recall 形成曲线,插值曲线下面积就是 AP。
最终 mAP 可能跨类别、Trajectory IoU Threshold、数据集或同时跨多个维度平均。TrackEval 默认使用 0.50:0.05:0.95 阈值与 101 个 Recall Sample;只标注 Track mAP 而不声明这些维度,结果并不完整。
用 Track mAP 评测排序发现,而非单独诊断故障
TrackEval 的 TrackMAP 实现支持 Box 与 Mask Track、Confidence Ranking、Area Range、Duration Range、Crowd Ignore,以及未穷尽标注类别;这些选择对 TAO 一类 Open-world Dataset 至关重要。
硬 Trajectory Threshold 不会给阈值以下结果部分信用,而整条长轨迹如何聚合一个 Confidence 本身也是建模选择。应尽可能报告分阈值、类别、尺寸与时长的 AP,再用 HOTA、IDF1、MOTA 或 Track-set Distance 揭示定位与关联故障。
主要特点
- 按 Confidence 排序完整预测 Trajectory
- 使用声明的 Trajectory Similarity 匹配 Track
- 逐类别构建插值 Precision-Recall Curve
- 可以跨类别与多个 IoU Threshold 平均
- 支持 Bounding-box 与 Segmentation-mask Trajectory
- 采用硬匹配阈值且依赖校准后的 Track Score
常见用途
- 评测 Video Instance Segmentation 系统
- 在 TAO 风格 Benchmark 上排序大词表 Tracker
- 比较具有 Confidence Score 的 Track Detection 系统
- 按类别、尺寸或持续时间拆解表现
- 审计完整 Trajectory 的时空覆盖
示例
Loading code...常见问题
Track mAP 如何计算?
每个类别内按 Confidence 排序预测 Track,依次与超过相似度阈值且尚未占用的 Ground Truth Trajectory 匹配,构建累计 Precision 与 Recall 并积分插值曲线;最终 Mean 还可能跨类别与阈值平均。
Trajectory IoU 是什么?
Trajectory IoU 将所有帧的空间 Intersection 求和,再除以所有帧的 Union 总和,并把缺席区域视为空。它共同反映定位、时间覆盖、漏失与额外预测。
Track mAP 与 Detection mAP 有什么区别?
Detection mAP 排序并匹配单帧 Detection;Track mAP 排序并匹配完整 Trajectory。因此即使许多单帧检测准确,身份碎片或错误时间范围仍会降低 Trajectory Similarity。
Track mAP 为什么需要 Track Confidence?
Average Precision 由预测排序定义。如果系统只输出 Per-detection Confidence,Benchmark 必须规定如何聚合成一个 Track Score;取平均很常见,但不是通用规则。
Track mAP 能替代 HOTA 或 IDF1 吗?
不能。Track mAP 适合 Confidence-ranked Track Discovery 与多类别 Benchmark,但硬阈值和全局匹配不利于诊断故障;HOTA 与 IDF1 回答不同的检测和身份问题。