什么是 深度感知视频全景质量(DVPQ)?

深度感知视频全景质量(DVPQ)是一种联合指标,它先屏蔽 Relative Depth Error 超过阈值的 Panoptic Prediction Pixel,再在声明的时间窗口上应用 Video Panoptic Quality。

快速了解

全称Depth-Aware Video Panoptic Quality
规范文档官方规范

工作原理

用相对深度误差门控 Panoptic Prediction

DVPS 原始论文使用 Relative Error abs(d_hat - d) / d 比较 Predicted Depth d_hat 与有效 Ground Truth Depth d。当 Error 超过 lambda 时,该 Pixel 的 Predicted Semantic Label 会在 Panoptic Evaluation 前改为 Void;阈值内 Pixel 保留原 Class 与 Instance ID。

Depth Gating 对 Ground Truth 并不对称:拒绝 Prediction 不会移除 Ground Truth Pixel,因此可能降低 Tube Overlap 或产生 Unmatched Evidence。无效 Ground Truth Depth 必须服从 Dataset Mask,不能悄悄当作准确的零值。

门控后在每个时间窗口执行 VPQ

完成 Depth Masking 后,DVPQ 在每个 k-frame Window 中连接 Gated Prediction 与 Ground Truth Label,按相同 ID 形成 Tube,以严格大于 0.5 的 IoU 匹配同类 Tube,再使用 PQ 分母 TP + 0.5*FP + 0.5*FN。统计先聚合,再对 Class 做 Macro Average,并分别报告 Thing 与 Stuff。

因此,即使原 Panoptic Label 正确,Depth Error 也会降低得分;反过来,准确 Depth 不能挽救 Wrong Class、Fragmented Identity、Missed Tube 或 Poor Mask。DVPQ 有意耦合这些错误,故障归因必须使用 Companion Metric。

保留 Threshold-window Grid 与 Evaluator 行为

原始协议使用 lambda 集合 {0.1, 0.25, 0.5};六帧 Cityscapes-DVPS Clip 使用 k 集合 {1, 2, 3, 4},更长的 SemKITTI-DVPS Sequence 使用 {1, 5, 10, 20},最后对配置的组合求平均。不同 Dataset 的 Window Set 不能混用。

固定版本的参考 Evaluator只在有效 Depth Pixel 上屏蔽 Relative Error 严格大于阈值的 Prediction,使用严格 Tube IoU > 0.5,并执行数据集专属 Void Handling。

应报告 Code Version、Depth Encoding/Scale、Valid Mask、Class Map、Sequence Grouping、Grid 每个 Cell、不做 Depth Gating 的 VPQ 与独立 Depth Metric。

主要特点

  • 使用 Relative Depth-error Threshold 屏蔽 Prediction
  • 完成 Depth Gating 后应用窗口化 Video Panoptic Quality
  • 耦合 Depth、Mask、Class、Recognition 与 Identity Error
  • 以严格大于 0.5 的 IoU 匹配同类 Tube
  • 支持 Thing、Stuff、逐阈值与逐窗口报告
  • 依赖 Depth Scale、Valid Mask、Window Grid 与 Evaluator Version

常见用途

  1. 评测 Cityscapes-DVPS 模型
  2. 评测 SemKITTI-DVPS 时序感知
  3. 检查 Panoptic Label 是否位于准确 Depth 上
  4. 衡量更严格 Depth Threshold 下的性能衰减
  5. 诊断联合 Depth、Segmentation 与 Tracking System

示例

loading...
Loading code...

常见问题

DVPQ 如何计算?

先屏蔽 Relative Depth Error 超过 `lambda` 的 Predicted Panoptic Pixel,再把剩余 Label 聚合为 `k` 帧 Tube,以严格同类 VPQ Match 与 PQ 分母计算并对 Class 做 Macro Average;协议还可能平均多个 lambda 与 k 组合。

DVPQ 中 lambda 与 k 分别表示什么?

`lambda` 是允许的最大 Relative Depth Error,`k` 是评测 Clip 的 Frame 数。更小 lambda 对 Depth 更严格,更大 k 检查更长时间范围内的 Identity 与 Mask Consistency。

DVPQ 与 VPQ 有什么区别?

VPQ 不使用 Depth,直接评测 Panoptic Tube;DVPQ 先把 Relative Depth Error 过大的 Pixel 改为 Ignored Prediction Category,因此即使原 Panoptic Label 正确,不准确 Depth 也会降低 Tube Overlap 与 Recognition。

较高 DVPQ 能说明哪个子任务更强吗?

不能。Depth、Mask、Class、Detection 与 Identity Error 在聚合前就会相互作用。应同时报告完整 DVPQ Grid、不做 Depth Gating 的 VPQ 或 STQ、独立 Depth Metric、逐类结果与 Thing/Stuff 分项。

Cityscapes-DVPS 与 SemKITTI-DVPS 的 DVPQ 可以直接比较吗?

不可以。两者的 Source Annotation、Depth Density、Sequence Length、Window Set、Taxonomy 与 Visibility 不同;即使同一数据集,也必须统一 Depth Scale、Valid Mask、Preprocessing、Sequence Grouping 与 Evaluator Commit。

相关术语

相关文章