什么是 全景质量(PQ)?
全景质量(PQ)是一种面向全景分割的类别平均指标,它把已匹配 Segment 的重叠质量与未匹配预测、未匹配 Ground Truth 的惩罚组合起来。
快速了解
| 全称 | Panoptic Quality |
|---|---|
| 规范文档 | 官方规范 |
工作原理
在严格阈值之上匹配同类 Segment
对一个类别,当 Prediction 与 Ground Truth Segment 满足 IoU > 0.5 时,它们构成 True Positive Pair。由于两个 Panoptic Map 内部都不允许 Segment 重叠,原始论文的证明表明该严格阈值可保证唯一匹配,无需依赖 Greedy Order 或 Hungarian Assignment;恰好等于 0.5 不算匹配。
未匹配预测计为 FP,未匹配 Ground Truth 计为 FN。Category Equality、Void Pixel、Crowd Region 与异常 Segment Metadata 必须先按 Evaluator 约定处理,之后的计数才有意义。
把 PQ 分解为 Matched-mask SQ 与 Recognition RQ
对类别 c,PQ_c = sum IoU / (TP + 0.5*FP + 0.5*FN)。它等价于 SQ_c * RQ_c,其中 SQ_c = sum IoU / TP,RQ_c = TP / (TP + 0.5*FP + 0.5*FN)。RQ 类似 F1;SQ 只在已接受 Match 上计算,因此模型漏掉大量对象后仍可能有较高 SQ,RQ 才会揭示这些错误。
Dataset Score 是有效类别得分的算术平均。Segment Area 不直接决定类内权重,Class Frequency 也不直接决定 Macro Average。应报告 PQ_th、PQ_st、逐类 PQ、SQ 与 RQ,定位分数变化来自哪类对象。
保留 Evaluator 细节并明确指标边界
固定版本的 COCO PanopticAPI Evaluator会从 Prediction Union 中移除 Ground Truth Void Overlap,不把 Crowd Region 当作 Match;若未匹配 Prediction 超过一半落在 Void 与同类 Crowd 上,则不计 FP。
它还校验 PNG Segment ID 与 JSON Metadata 是否一致。PQ 没有 Confidence Sweep,也不包含 Temporal Identity。不能把它与 AP、Semantic mIoU、VPQ、STQ、sPTQ 或 PAT 当作同一错误模型直接比较。比较系统前要锁定 Taxonomy、Split、Encoding、Ignored-region Rule 与 Evaluator Commit。
主要特点
- 以严格大于 0.5 的 IoU 匹配同类非重叠 Segment
- 组合 Matched-mask Overlap 与 FP、FN 惩罚
- 可分解为 Segmentation Quality 与 Recognition Quality
- 对有效类别做 Macro Average 而非按频率加权
- 常用 Evaluator 分别报告 Thing 与 Stuff
- 依赖 Void、Crowd、Category 与 Segment Metadata 处理
常见用途
- 排序图像全景分割系统
- 分离 Mask Quality 与漏检、虚假 Segment
- 在同一协议下比较 Thing 与 Stuff 表现
- 审计逐类别场景解析故障
- 验证 COCO 风格 Panoptic Prediction Export
示例
Loading code...常见问题
全景质量 PQ 如何计算?
对每个类别,累加 IoU 严格大于 0.5 的同类 Segment Pair,再除以 `TP + 0.5 FP + 0.5 FN`;最终 PQ 是所有参与评测类别得分的算术平均。
PQ 为什么使用严格大于 0.5 的 IoU 阈值?
对非重叠 Panoptic Segment,严格大于 0.5 可以保证一对一唯一匹配。恰好 0.5 不通过;若降低阈值,则必须显式规定 Assignment Strategy。
PQ 的 SQ 与 Semantic mIoU 有什么区别?
PQ 的 SQ 只平均已匹配 Segment Pair 的 IoU;Semantic mIoU 按类别合并全部像素并忽略 Instance Identity。因此漏掉很多 Segment 的模型仍可能获得较高 SQ,但 RQ 会暴露漏检。
PQ 会让大对象比小对象权重更高吗?
不会直接按面积加权。类内每个成功 Match 贡献一个 IoU,未匹配 Segment 贡献 Count;最终再按类别平均。不过像素面积仍会影响每个 Segment 的 IoU 与 Benchmark Ignore Rule。
不同数据集或 Evaluator 的 PQ 可以直接比较吗?
只有 Class Taxonomy、Thing/Stuff Mapping、Split、Void/Crowd Handling、Segment Encoding、Minimum-area Policy 与 Evaluator Implementation 兼容时才有可比性,报告分数时应同时注明这些条件。