什么是 深度感知视频全景质量(DVPQ)?
深度感知视频全景质量(DVPQ)是一种联合指标,它先屏蔽 Relative Depth Error 超过阈值的 Panoptic Prediction Pixel,再在声明的时间窗口上应用 Video Panoptic Quality。
快速了解
| 全称 | Depth-Aware Video Panoptic Quality |
|---|---|
| 规范文档 | 官方规范 |
工作原理
用相对深度误差门控 Panoptic Prediction
DVPS 原始论文使用 Relative Error abs(d_hat - d) / d 比较 Predicted Depth d_hat 与有效 Ground Truth Depth d。当 Error 超过 lambda 时,该 Pixel 的 Predicted Semantic Label 会在 Panoptic Evaluation 前改为 Void;阈值内 Pixel 保留原 Class 与 Instance ID。
Depth Gating 对 Ground Truth 并不对称:拒绝 Prediction 不会移除 Ground Truth Pixel,因此可能降低 Tube Overlap 或产生 Unmatched Evidence。无效 Ground Truth Depth 必须服从 Dataset Mask,不能悄悄当作准确的零值。
门控后在每个时间窗口执行 VPQ
完成 Depth Masking 后,DVPQ 在每个 k-frame Window 中连接 Gated Prediction 与 Ground Truth Label,按相同 ID 形成 Tube,以严格大于 0.5 的 IoU 匹配同类 Tube,再使用 PQ 分母 TP + 0.5*FP + 0.5*FN。统计先聚合,再对 Class 做 Macro Average,并分别报告 Thing 与 Stuff。
因此,即使原 Panoptic Label 正确,Depth Error 也会降低得分;反过来,准确 Depth 不能挽救 Wrong Class、Fragmented Identity、Missed Tube 或 Poor Mask。DVPQ 有意耦合这些错误,故障归因必须使用 Companion Metric。
保留 Threshold-window Grid 与 Evaluator 行为
原始协议使用 lambda 集合 {0.1, 0.25, 0.5};六帧 Cityscapes-DVPS Clip 使用 k 集合 {1, 2, 3, 4},更长的 SemKITTI-DVPS Sequence 使用 {1, 5, 10, 20},最后对配置的组合求平均。不同 Dataset 的 Window Set 不能混用。
固定版本的参考 Evaluator只在有效 Depth Pixel 上屏蔽 Relative Error 严格大于阈值的 Prediction,使用严格 Tube IoU > 0.5,并执行数据集专属 Void Handling。
应报告 Code Version、Depth Encoding/Scale、Valid Mask、Class Map、Sequence Grouping、Grid 每个 Cell、不做 Depth Gating 的 VPQ 与独立 Depth Metric。
主要特点
- 使用 Relative Depth-error Threshold 屏蔽 Prediction
- 完成 Depth Gating 后应用窗口化 Video Panoptic Quality
- 耦合 Depth、Mask、Class、Recognition 与 Identity Error
- 以严格大于 0.5 的 IoU 匹配同类 Tube
- 支持 Thing、Stuff、逐阈值与逐窗口报告
- 依赖 Depth Scale、Valid Mask、Window Grid 与 Evaluator Version
常见用途
- 评测 Cityscapes-DVPS 模型
- 评测 SemKITTI-DVPS 时序感知
- 检查 Panoptic Label 是否位于准确 Depth 上
- 衡量更严格 Depth Threshold 下的性能衰减
- 诊断联合 Depth、Segmentation 与 Tracking System
示例
Loading code...常见问题
DVPQ 如何计算?
先屏蔽 Relative Depth Error 超过 `lambda` 的 Predicted Panoptic Pixel,再把剩余 Label 聚合为 `k` 帧 Tube,以严格同类 VPQ Match 与 PQ 分母计算并对 Class 做 Macro Average;协议还可能平均多个 lambda 与 k 组合。
DVPQ 中 lambda 与 k 分别表示什么?
`lambda` 是允许的最大 Relative Depth Error,`k` 是评测 Clip 的 Frame 数。更小 lambda 对 Depth 更严格,更大 k 检查更长时间范围内的 Identity 与 Mask Consistency。
DVPQ 与 VPQ 有什么区别?
VPQ 不使用 Depth,直接评测 Panoptic Tube;DVPQ 先把 Relative Depth Error 过大的 Pixel 改为 Ignored Prediction Category,因此即使原 Panoptic Label 正确,不准确 Depth 也会降低 Tube Overlap 与 Recognition。
较高 DVPQ 能说明哪个子任务更强吗?
不能。Depth、Mask、Class、Detection 与 Identity Error 在聚合前就会相互作用。应同时报告完整 DVPQ Grid、不做 Depth Gating 的 VPQ 或 STQ、独立 Depth Metric、逐类结果与 Thing/Stuff 分项。
Cityscapes-DVPS 与 SemKITTI-DVPS 的 DVPQ 可以直接比较吗?
不可以。两者的 Source Annotation、Depth Density、Sequence Length、Window Set、Taxonomy 与 Visibility 不同;即使同一数据集,也必须统一 Depth Scale、Valid Mask、Preprocessing、Sequence Grouping 与 Evaluator Commit。