什么是 平均多对象跟踪准确率(AMOTA)?

平均多对象跟踪准确率(AMOTA)是一种 Confidence-swept 多对象跟踪得分:它在预定义 Recall Operating Point 上平均准确率,而不是只选择一个 Detection Threshold。

快速了解

规范文档官方规范

工作原理

把 Track Confidence 转换为 Recall Operating Point

Evaluator 为每条预测 Trajectory 聚合 Confidence,排序或阈值化 Track,并找到对应配置 Recall Grid 的 Confidence Cutoff。每个 Cutoff 都重新执行逐帧 Matching,计算 TP、FN、FP、Identity Switch 与定位统计。

3D MOT 指标原始论文提出 Integral Score,目的是覆盖完整 Confidence-threshold Spectrum。

当前 nuScenes Devkit使用 Track-level Confidence、配置化的最小 Recall 与阈值数量,并为 Tracker 无法达到的 Recall Target 明确设置最差值。

按当前 nuScenes 契约平均 MOTAR

对 Evaluator 实测 Recall r,nuScenes 计算 MOTAR_r = max(0, 1 - ((FN + FP + IDS) - (1-r)*GT) / (r*GT))。减去 (1-r)*GT 是为了移除仅由当前 Recall 必然造成的 Miss,再用 r*GT 归一化可用 Match 上的剩余误差。

当前实现再计算 AMOTA = mean_r(MOTAR_r)。公开配置使用从 0.1 到 1.0 的 40 个 Hypothetical Recall Target;未达到的点对 AMOTA 贡献零。发布代码用 MATCH Event Count 除以 GT 得到 r,并单独传入 SWITCH Event,因此它可能同时不同于请求网格点和常规 Recall 实现。

比较分数前先比较命名与协议

早期论文把普通 MOTA 的跨 Recall 平均称为 AMOTA,把 Recall-normalized 版本称为 sAMOTA;nuScenes 后来把公开字段 AMOTA 映射为 MOTAR 的平均值。因此,不同 Toolkit 即使使用相同缩写,也可能采用不同逐点公式、Clipping Rule、Recall Grid 与 Unreachable-recall Policy。

Matching Geometry 同样属于契约。nuScenes 当前按类别用地平面 Center Distance 匹配 3D Track,Cutoff 为 2 m,最后再跨类别平均。AMOTA 仍混合 Detection 与 Identity Error,也不衡量已接受 Match 的定位质量;应同时报告 AMOTP、HOTA、IDF1、原始计数与业务安全指标。

主要特点

  • 跨预定义 Recall Target 扫描 Confidence Threshold
  • 在当前 nuScenes Evaluator 中平均 Recall-normalized MOTAR
  • 惩罚 Tracker 无法达到的 Recall Target
  • 组合 False Positive、Identity Switch 与额外漏失
  • 依赖 Track Confidence、Matching、Recall Grid 与 Clipping Rule
  • 不衡量已接受 Match 内部的定位质量

常见用途

  1. 在 nuScenes Benchmark 上排序三维多对象 Tracker
  2. 比较不同 Confidence Operating Point 下的跟踪行为
  3. 审计单一最优阈值是否掩盖低召回表现
  4. 用固定协议评测自动驾驶感知系统
  5. 带 Evaluator 版本复现 AMOTA 结果表

示例

loading...
Loading code...

常见问题

nuScenes 中的 AMOTA 如何计算?

nuScenes 在 Recall Grid 对应的多个 Track-confidence Cutoff 上评测,逐点计算 Recall-normalized MOTAR;无法达到的 Recall Target 记为零,再平均所有点。最终 Benchmark 结果还会按声明的 Tracking Class 聚合。

AMOTA 与 MOTAR 有什么区别?

MOTAR 是单个 Operating Point 上的 Recall-normalized Accuracy;AMOTA 聚合配置中全部 Recall Point 的 MOTAR。只报告 AMOTA 会隐藏 MOTAR-versus-recall Curve 的形状。

AMOTA 就是普通 MOTA 的平均值吗?

取决于 Evaluator。早期 3D MOT 论文用 AMOTA 表示普通 MOTA 的平均,用 sAMOTA 表示缩放版本;当前 nuScenes Devkit 把 AMOTA 映射为 MOTAR 的平均,因此实现版本是结果的一部分。

AMOTA 为什么惩罚无法达到的 Recall?

如果不惩罚,Tracker 可以忽略困难对象,只在容易的 Operating Range 上求平均。nuScenes 对超过最大实测 Recall 的网格点记零,让覆盖能力进入最终结果。

不同数据集的 AMOTA 可以直接比较吗?

只有 Class Set、Confidence Aggregation、Recall Grid、Matching Representation 与 Cutoff、Ignore Rule、MOTAR 公式、Clipping、Unreachable-recall Policy、类别聚合和 Evaluator Version 兼容时才可比较。

相关术语

相关文章