什么是 视频全景质量(VPQ)?

视频全景质量(VPQ)是一种窗口化视频全景分割指标,它把具有一致 Semantic Class 与 Instance ID 的 Segment 组成时空 Tube,再对 Tube 应用 Panoptic Quality。

快速了解

全称Video Panoptic Quality
规范文档官方规范

工作原理

在声明的时间窗口内构造 Tube

VPS 原始论文把具有相同 (class, ID) Pair 的 Frame Segment 聚合成 Tube,并在一个 Sliding Window 的有效标注帧上累加 Tube Intersection 与 Union。同类 Pair 满足 Tube IoU > 0.5 时记为 TP,未匹配 Prediction 与 Ground Truth Tube 分别成为 FP 与 FN。

Identity Fragmentation 会把一条 Ground Truth Object 拆成多个 Predicted Tube,降低重叠并增加 Unmatched-tube Penalty;ID Merge 则可能把其他对象像素加入同一预测 Tube。空间 Mask、语义、检测与身份错误会在阈值之前耦合,而不是作为完全独立的 Component。

按类别与配置的 Span 聚合

对 Span k 与类别 c,VPQ_c^k = sum TubeIoU / (TP + 0.5*FP + 0.5*FN)。Evaluator 先跨 Window 与 Video 累加统计,再对 Class Score 做 Macro Average。原始 Cityscapes-VPS 协议每 lambda = 5 帧标注一次,Window 按该步长滑动,k 取 {0, 5, 10, 15},最终 VPQ 是四个 VPQ^k 的平均。

这里 k 是 Frame-index Span,不是标注 Mask 数量:k = 0 只有一个有效帧,等价于 Image PQ;k = 10 使用 t、t+5 与 t+10 三帧。其他 Dataset 可以使用不同 Span 或只报告单个窗口,因此不带协议的 VPQ 标签信息不足。

结合实现细节与 Companion Metric 解读

固定版本的 VPSNet 参考 Evaluator会堆叠有效标注 Mask、按 ID 累加 Segment Area、应用严格 Tube-IoU Threshold,按 PanopticAPI 风格处理 Void/Crowd,并为每个配置 Span 报告 All、Thing 与 Stuff Score。

VPQ 强调身份在窗口内保持一致,但短窗口得分不能证明任意长度跟踪。应报告每个 VPQ^k、Thing/Stuff 分项和完整 Window Setting;需要全序列 Threshold-free Pixel Association 与独立 Semantic mIoU 时,应使用 STQ。

主要特点

  • 把 Panoptic Quality 从 Frame Segment 扩展到 Temporal Tube
  • 以严格大于 0.5 的 IoU 匹配同类 Tube
  • 沿用 PQ 分母惩罚未匹配 Tube
  • 累加 Window Statistics 后按类别 Macro Average
  • 可以把多个 Temporal Span 平均成最终得分
  • 依赖 Annotation Stride、Window、Sequence、Void 与 Crowd Rule

常见用途

  1. 按原始窗口协议评测 Cityscapes-VPS
  2. 联合衡量短程 Mask 与 Identity Consistency
  3. 比较 Thing 与 Stuff Video-panoptic 表现
  4. 诊断 Temporal Window 增长时的性能衰减
  5. 验证 Segment ID 稳定的视频全景输出

示例

loading...
Loading code...

常见问题

视频全景质量 VPQ 如何计算?

在每个时间窗口内,把相同 ID 的 Segment 聚合为 Tube,以严格大于 0.5 的 IoU 匹配同类 Tube,逐类别计算 PQ 公式并做 Macro Average;协议还可能再平均多个 Window Span。

VPQ 中 k 等于零是否就是 Image PQ?

按原始定义是。`k = 0` 只包含一个有效标注帧,因此 Tube Matching 退化为 Frame-segment Matching;但 Class、Void、Crowd 与 Encoding Rule 仍必须一致。

为什么报告 VPQ 时必须写明 Window Setting?

较长 Window 会暴露更多 Identity Fragmentation 与 Merge,Annotation Stride 也会改变进入 Tube 的 Frame。不同 Span Set 与 Averaging Policy 即使都叫 VPQ,实际测量也不同。

VPQ 与 STQ 有什么区别?

VPQ 在配置窗口内对时空 Tube 做 Threshold Matching,并耦合 Mask、Recognition 与 Identity Error;STQ 使用全序列、无需阈值的 Pixel Association,再与独立 Semantic mIoU 组合。

较高 VPQ 能证明长期跟踪质量吗?

只能证明模型在被评测的 Window Span 与 Sequence 上表现较好。短窗口平均可能漏掉长遮挡或重现后的故障,也不反映 Runtime Latency、Online/Offline Access、Calibration 或运行安全。

相关术语

相关文章