什么是 汤普森采样(Thompson Sampling)?

汤普森采样(Thompson Sampling)是一种随机化序贯决策策略,它从当前后验抽取一个可能模型,并选择在该抽样模型下最优的动作。

快速了解

规范文档官方规范

工作原理

按后验可信度进行探索

算法先从后验抽取一个模型,再选择该模型下最优的动作。因此,在精确概率匹配下,一个动作被选中的概率等于它成为最优动作的后验概率。Russo 等人的教程从 Bernoulli Bandit 推广到结构化决策,并讨论先验、近似、非平稳、约束,以及简单后验采样可能失败的场景。

正确建模反馈、上下文与运行约束

Beta-Bernoulli 更新只适用于二元、条件独立且臂概率稳定的奖励。连续、带上下文、删失、延迟或漂移结果需要匹配的似然与后验近似。选择动作会改变能观察到的数据,因此应保存动作倾向、上下文、分配时间、奖励窗口、缺失反馈和模型版本。安全或策略约束必须在随机探索触达用户前筛选或惩罚候选动作。

评估累计决策与后验敏感性

Bandit 策略优化累计奖励或 Regret,而不只是固定实验结束后识别最佳臂。应跨重复模拟与在线护栏,比较累计和逐轮 Regret、奖励、不安全动作率、子群曝光、切换成本、后验收缩和漂移后恢复。Agrawal 与 Goyal为特定线性上下文老虎机给出保证;这些界不能原样迁移到任意模型或近似后验。

主要特点

  • 从当前后验抽取一个可能模型或参数
  • 选择抽样模型下最优动作,而非添加固定探索奖励
  • 按照模型表达的不确定性随机探索
  • 支持独立、上下文、结构化与函数空间决策
  • 依赖后验质量、反馈时序与平稳性假设
  • 在明确约束下以累计奖励或 Regret 评测

常见用途

  1. 在多个在线产品方案之间分配流量
  2. 使用上下文奖励模型选择推荐内容
  3. 通过后验函数抽样选择实验
  4. 在严格安全护栏下探索治疗或策略方案
  5. 随结果序贯到达动态调整资源分配

示例

loading...
Loading code...

常见问题

汤普森采样如何平衡探索与利用?

它从后验抽样,再选择该抽样世界中的最优动作。证据充分的动作经常胜出,不确定动作也会在某个可信抽样中成为最优,因此探索强度来自模型不确定性,而不是固定随机概率。

汤普森采样与 A/B 测试相同吗?

不同。固定周期随机 A/B 测试通常按预设分流做估计或假设检验;汤普森采样根据已观测结果自适应调整分配,以优化累计决策。这会改变曝光结构,需要支持序贯分析的推断方法。

汤普森采样必须使用 Beta 分布吗?

不必须。Beta-Bernoulli 只是二元奖励下方便的共轭示例。若与奖励和上下文匹配,也可使用高斯、广义线性、神经网络、高斯过程或其他后验模型,通常还需要近似推断。

汤普森采样如何处理延迟奖励?

应单独跟踪待返回动作,仅在归因窗口关闭后更新。忽略延迟会因失败或成功尚未返回而过度选择某个臂。评测还要模拟真实延迟,并定义迟到、删失和重复结果的合并规则。

汤普森采样在哪些情况下表现可能较差?

错设或过度自信的后验、非平稳奖励、少数据下不合适的先验、不安全探索、遗漏上下文、延迟反馈,或信息具有复杂长期价值的目标都可能导致失败,因此仍需护栏和替代基线。

相关术语

相关文章