什么是 分割与跟踪质量(STQ)?

分割与跟踪质量(STQ)是一种视频全景分割指标,它通过几何平均组合语义 Mean Intersection over Union 与全序列、类别无关的 Pixel Association。

快速了解

全称Segmentation and Tracking Quality
规范文档官方规范

工作原理

在完整序列上计算 Class-agnostic Association

对 Ground Truth Thing Track g 与预测身份 p,TPA = |g 与 p 的交集|、FNA = |g| - TPA、FPA = |p| - TPA,所有量都按全序列 Pixel 计数。Association IoU 为 TPA / (TPA + FNA + FPA);g 的得分是 sum_p TPA * AssociationIoU(p,g) / |g|,AQ 再对 Ground Truth Track 平均。

STEP 原始论文让 AQ 与类别无关:把 Van 错分成 Car 只在 Semantic SQ 中受罚,不会在 Association 再扣一次。Prediction 暂时出错后恢复旧 Identity 可以重新获得 AQ Credit,而 Fragmentation 与 Merge 会在没有硬阈值的情况下降低重叠。

把 Semantic mIoU 作为 SQ 并平衡两个分量

SQ = mIoU 从所有有效 Pixel 与 Class 的 Semantic Confusion Matrix 计算,忽略 Instance ID。它与 PQ 中同名的 SQ 不同:后者只对已经通过 Matching Threshold 的 Segment Pair 平均 IoU。报告时必须写清 Component Full Name,避免混用。

STQ = sqrt(AQ * SQ)让两个分量拥有对称乘法影响,任一为零时总分为零。它不编码 Confidence Ranking、Boundary Quality、Latency、Calibration、物理风险或业务成本,因此应同时报告 AQ、SQ、逐类别 IoU 与 Track Slice。

复现 Dataset-level Aggregation 与 Ignore Rule

KITTI-STEP Benchmark为每个像素提供稠密语义 Label,并为 Car 与 Pedestrian 提供 Track ID。

固定版本的 DeepLab2 实现从 AQ 中排除 Ground Truth Crowd Pixel,全局汇总 Semantic Confusion Matrix,对 Ground Truth Tube 平均 AQ,并额外输出逐 Sequence 得分。

STQ 不同于 VPQ 的窗口化 Thresholded Tube Matching。它与 LSTQ 的代数结构接近,但 STQ 面向 Video Panoptic Segmentation 的图像 Pixel,LSTQ 则采用 4D LiDAR 的 Point-centric Contract;Domain 与协议不一致时不能直接比较。

主要特点

  • 用几何平均组合 Semantic mIoU 与 Association
  • 从全序列 Pixel Intersection 计算关联
  • AQ 不依赖 Threshold-based Segment Matching
  • 不在 Association Component 重复计算语义错误
  • 允许 Identity Recovery 重新获得 Association Credit
  • 对 Ground Truth Thing Track 平均关联质量

常见用途

  1. 排序 KITTI-STEP 视频全景分割 Submission
  2. 无需 Tube Threshold 地评测长序列 Pixel Association
  3. 分离语义错误与身份关联错误
  4. 诊断 Fragmentation、Merge 与 Class Recovery
  5. 比较稠密视频场景理解系统

示例

loading...
Loading code...

常见问题

STQ 如何计算?

STQ 等于 `sqrt(AQ * SQ)`。AQ 对每条 Ground Truth Thing Track 的 Pixel-weighted Association IoU 贡献取平均,SQ 则是全部有效语义类别的 Mean IoU。

STQ 会用 IoU Threshold 匹配 Segment 吗?

Association Component 不会。每个有重叠的 Ground Truth 与预测 Thing Identity 都按 Pixel Intersection 和 Union 贡献,因此低于固定 Segment Threshold 的 Association Evidence 不会被直接丢弃。

为什么 STQ 的 Association 与类别无关?

语义错误已经降低 SQ;AQ 忽略类别可避免双重惩罚,并允许稳定 Identity 在后续纠正 Semantic Label 时保留 Association Credit。

STQ 与 VPQ 有什么区别?

STQ 把全序列、无需阈值的 Pixel Association 与 Semantic mIoU 组合;VPQ 在配置窗口内构造 Tube,只匹配 IoU 大于 0.5 的 Pair,并使用 PQ Recognition Denominator。

STQ 与 LSTQ 有什么区别?

两者采用相近的 Semantic-and-association Decomposition,但 STQ 面向 Video Pixel 与 STEP-style Protocol;LSTQ 面向 4D LiDAR Point,并继承不同 Taxonomy、ID Namespace、Sampling 与 Ignore Rule。

相关术语

相关文章