什么是 4D 全景分割?
4D 全景分割是一项时序 LiDAR 场景理解任务,它为每个有效 3D Point 分配语义类别,并让每个 Thing Instance 的身份在完整序列中保持一致。
快速了解
| 全称 | 4D Panoptic LiDAR Segmentation |
|---|---|
| 规范文档 | 官方规范 |
工作原理
同时分配语义标签与序列级身份
4D Panoptic LiDAR Segmentation 原始论文把输出定义为每个 Point 的一个 Semantic Class,以及每个 Thing Object 在序列中的 Identity-preserving Instance ID。Stuff Point 有语义标签,但没有被跟踪的对象身份。Prediction 必须与原始扫描 Point 一一对应;额外补全未观测的稠密场景属于另一项任务。
官方 SemanticKITTI 任务要求 Instance ID 跨类别唯一,因为 Association Calculation 不依赖语义类别。即使每帧看似有效,同时给 Car 与 Person 使用 ID 7 也可能错误合并两条 Track。
把时间上下文与输出契约分开
Tracking-by-segmentation System 先生成逐扫描 Semantic Instance,再用 Geometry、Appearance、Motion 或 Learned Embedding 完成关联。Joint Spatiotemporal System 则聚合已配准扫描,或保留 Persistent Query,让分割与 Association 共享特征。两类架构都能满足任务,但 Memory、Latency 与 Future-frame Access 不同。
Ego-pose Alignment 只能消除传感器自身运动,不能消除独立对象运动。长窗口增加上下文,也增加 Point Count 与过期证据。Online、Causal Streaming、Fixed-window 和 Whole-sequence Offline System 必须分别报告,因为相同 LSTQ 可能隐藏不同响应延迟和信息访问范围。
在固定协议下比较数据集与指标
SemanticKITTI 使用 LSTQ 与特定 Class/Ignore Policy 评测长 LiDAR Sequence。Panoptic nuScenes 的 Taxonomy、Sampling Rate 与 Scene Boundary 不同,还可能同时报告 PQ、PAT、LSTQ 与 sPTQ。4D-Former等后续研究比较 LiDAR-only 与 Multimodal Pipeline,但模型分数仍只适用于对应数据集。
应报告 Sensor Input、Scan Rate、Pose Source、Temporal Horizon、Thing/Stuff Set、ID Reset Rule、Ignored Point、Minimum Instance Size、Evaluator Commit、Latency 与 Memory。LSTQ 用于分离 Point-level Semantic 与 Association Quality;只有 Benchmark 采用对应 Matching 与 Aggregation Contract 时,才使用 PAT 或 sPTQ。
主要特点
- 为每个有效 LiDAR Point 分配语义类别
- 让 Thing-instance Identity 跨点云序列保持一致
- 把时间作为 3D 场景感知的第四个维度
- 必须处理 Ego-motion、对象运动、稀疏采样与遮挡
- 兼容 Association-based、Spatiotemporal、Query-based 与 Multimodal Model
- 依赖 Point Order、ID Namespace、Sequence 与 Access Protocol
常见用途
- 跟踪道路参与者并完整分割 LiDAR 场景
- 为自主导航构建时间一致的场景表示
- 比较 LiDAR-only 与 Camera-LiDAR 感知系统
- 审计长序列 Identity Fragmentation 与 Merge
- 评测 Causal 与 Offline 点云感知 Pipeline
示例
Loading code...常见问题
4D 全景分割中的 4D 是什么?
它表示三维点云感知再加上序列时间。任务为被观测的 3D Point 标注语义,并让 Thing Identity 跨扫描保持一致;它本身不要求预测所有未观测 Voxel。
4D 全景分割与 3D 全景分割有什么区别?
3D Panoptic Result 可以在每次扫描或场景中独立分配语义与 Instance Label;4D 任务还要求同一物理 Thing Instance 的身份随时间保持一致。
4D 全景分割等同于视频全景分割吗?
不等同。两者都联合稠密语义与时序身份,但标准 VPS 标注 Image Pixel,4D Panoptic Segmentation 标注 Metric 3D Space 中的 LiDAR Point;Sensor、Sampling、Visibility、Format 与 Metric 均不同。
SemanticKITTI 为什么要求 Instance ID 跨类别唯一?
其 LSTQ Association Component 独立于语义正确性评测身份。如果两个类别复用同一 Numeric ID,它们的 Point 可能被解释为一条 Prediction Track,从而污染 Association Statistics。
报告 4D 全景分割结果时需要注明什么?
应注明 Dataset 与 Split、Sensor Modality、Scan 与 Annotation Rate、Pose Source、Temporal Context、Causal 或 Offline Access、Class/Ignore Policy、ID Reset Rule、Minimum Instance Size、Evaluator Version、Metric Component、Latency 与 Memory。