什么是 视频全景分割?

视频全景分割是一项稠密视频理解任务,它为每个有效像素分配语义类别与非重叠 Segment Identity,并让 Thing Instance 的身份跨帧保持一致。

快速了解

全称Video Panoptic Segmentation
规范文档官方规范

工作原理

把 Panoptic Label 扩展为互斥时空 Tube

VPS 原始论文用 Semantic Class 与 Instance ID 表示每个像素。共享 (class, ID) Pair 的 Frame Segment 组成 Spatiotemporal Tube;Thing ID 区分对象,原始协议则给 Stuff 使用零 ID。每个像素只有一个答案,因此 Tube 彼此互斥。

有效 Export 必须在 Sequence 内保持 ID 稳定,在声明的 Boundary 重置或建立 Namespace,覆盖规定 Frame,并保证 Metadata 与 Mask 一致。模型可以逐帧、按 Clip 或离线处理完整视频;这种访问方式独立于输出契约。

区分 VPS 与相邻视频分割任务

Video Semantic Segmentation 标注每个像素但不区分对象身份;Video Instance Segmentation 跟踪前景 Instance,却不要求完整 Stuff Coverage,也可能输出重叠且带 Confidence 的 Mask;Multi-Object Tracking and Segmentation 同样聚焦选定 Thing Class。VPS 要求完整一致的 Thing/Stuff Partition 和时间身份。

Video K-Net等后续研究在 Cityscapes-VPS、KITTI-STEP 与 VIPSeg 上持续评测该任务,说明 VPS 不依赖某一个原始架构。但这些数据集的 Annotation Density、Taxonomy、Sequence Length、Tracked Class 与主指标并不相同。

联合评测空间质量与时间身份

VPQ 在声明窗口内用 Spatiotemporal Tube Match 扩展 PQ;STQ 则把 Semantic mIoU 与无需阈值的全序列 Pixel Association 组合。其他协议还可能报告 PAT、sPTQ 或任务专属指标。这些分数的 Matching Unit、Temporal Horizon、Class Weighting 与 Recovery Behavior 不同,不能互换。

工程报告应同时给出指标分量、Annotation Stride、Window Length、Sequence Reset Policy、Ignored Pixel、Online/Offline Setting、Latency 与 Memory,并检查 Occlusion、Re-entry、Camera Cut、小目标、Class Correction、ID Fragmentation 与 Merge,不能把一个 Aggregate 当作完整时间理解能力。

主要特点

  • 为每个有效视频像素分配语义与 Segment Label
  • 在 Frame 之间保持 Thing-instance Identity
  • 以完整场景 Partition 覆盖 Stuff Region
  • 要求每帧内部 Mask 互斥
  • 支持 Online、Clip-based 与 Offline Inference Protocol
  • 依赖 Annotation Density、Sequence Boundary 与 ID Namespace

常见用途

  1. 跟踪全部可见道路参与者并分割可行驶区域
  2. 为视频编辑和增强现实保持对象 Mask
  3. 为机器人构建时间一致的场景表示
  4. 评测统一视频分割架构
  5. 联合诊断 Mask、Class 与 Identity 故障

示例

loading...
Loading code...

常见问题

视频全景分割需要预测什么?

它为每个有效像素预测一个语义类别和一个一致 Segment Assignment。Thing Object 的身份必须跨帧保持,Stuff Region 则继续构成完整且非重叠的场景划分。

VPS 与 Video Instance Segmentation 有什么区别?

Video Instance Segmentation 聚焦被跟踪的 Thing Mask,也可能允许重叠的 Confidence-ranked Prediction;VPS 还要标注 Stuff,并要求每个有效像素恰好有一个 Panoptic Assignment。

VPS 模型必须在线运行吗?

不一定。任务输出本身不规定 Online Inference。Benchmark 或部署需要另外说明是否禁止未来帧、是否允许 Clip Context,或是否允许 Whole-video Offline Refinement。

视频全景分割应该使用哪个指标?

必须使用 Benchmark 声明的指标。VPQ 在指定窗口内评测 Thresholded Tube Quality;STQ 分离 Semantic mIoU 与全序列 Pixel Association;PAT 和 sPTQ 则有其他权重与 Switch Convention。

比较 VPS 系统前必须固定哪些条件?

必须固定 Taxonomy、Tracked Class、Annotation Frequency、Sequence Boundary、ID Namespace、Ignored Pixel、Temporal Window、Evaluator Version、Online/Offline Access、输入分辨率与 Latency 条件。

相关术语

相关文章