什么是 遗憾(Regret)?
遗憾(Regret)是一种序贯决策性能指标,它把学习器在同一时间跨度内积累的奖励或损失,与指定 Comparator 能取得的结果进行比较。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
没有 Comparator,Regret 数字就没有含义
对于均值为 mu_i 的随机 K 臂 Bandit,相对最佳固定臂的 Pseudo-regret 是所选动作期望奖励 Gap 的累计值。Contextual Bandit 可以改为与声明 Policy Class 中的最佳策略比较;Dynamic Regret 使用随时间变化的 Comparator,因此还需要 Variation Budget 等限制。Lai 与 Robbins为特定随机分配模型建立了基础渐近下界。
不能混用 Cumulative、Simple、Realized 与 Pseudo-regret
Cumulative Regret 奖励边服务边学习的策略;Simple Regret 只评价探索结束后的推荐动作。Realized Regret 使用随机采样结果,因此会波动;Pseudo-regret 则比较模型下的期望奖励。实例相关界会暴露臂 Gap 或散度,Minimax 界面向环境类中的最坏情况。若设置不同,这些速率不能直接排序。
模拟中使用 Regret,生产中使用可观测门禁
真实 Regret 通常需要反事实奖励或已知环境均值,因此可在模拟器中直接得到,但普通生产日志中不可直接观测。在线系统应报告已观测奖励、随机 Holdout、带不确定性的离策略估计、曝光与安全指标,只在 Oracle 有依据时报告 Regret。Bubeck 与 Cesa-Bianchi系统讨论随机和非随机分析,并明确列出各自所需的收益假设。
主要特点
- 相对声明过的 Comparator 测量学习器表现
- 跨序贯时间跨度累计机会成本
- 含义随随机、对抗或上下文假设变化
- 包含 Cumulative、Simple、Realized、Pseudo、External 与 Dynamic 等形式
- 支持渐近、有限时间、实例相关和 Minimax 分析
- 通常无法从非随机生产反馈中直接观测
常见用途
- 在受控 Bandit 模拟器中比较探索策略
- 证明在线学习算法的有限时间行为
- 区分服务阶段表现与最终最佳臂识别
- 为上下文决策定义 Policy-class 基准
- 使用 Dynamic Comparator 压测漂移适应能力
示例
Loading code...常见问题
Regret 与 Loss 有什么区别?
Loss 是分配给一次预测或动作的成本;Regret 是相对量,即学习器累计 Loss 减去 Comparator 累计 Loss,或 Comparator Reward 减去学习器 Reward。同一组观测 Loss 在不同 Comparator 下会产生不同 Regret。
Cumulative Regret 与 Simple Regret 有什么区别?
Cumulative Regret 评价学习期间的每次决策,因此探索错误会立即产生成本;Simple Regret 只评价探索结束后的最终推荐动作。Pure Exploration 方法可能累计奖励较差,却能识别出优秀的最终臂。
Pseudo-regret 是什么?
Pseudo-regret 比较假设环境下的期望奖励,通常累加所选动作的均值 Gap;Realized Regret 则比较采样结果或奖励序列。在有效随机模型中二者期望可能相关,但单次运行可以有很大差异。
次线性 Regret 能证明算法最优吗?
它只说明相对既定 Comparator 的平均 Regret 随 Horizon 增长趋近于零,不能证明 Comparator 符合真实价值、约束得到满足、常数在有限流量下可用,或生产环境符合定理假设。
能从普通生产日志计算 Regret 吗?
通常不能精确计算,因为未选动作的奖励缺失,最佳反事实动作也未知。随机实验、模拟器或有依据的离策略估计可以估计 Policy Value,但它们都引入额外假设与不确定性,必须随结果一起报告。