研究人员推出了一种名为 Conformal Bandits 的新框架,该框架将 Conformal Prediction 整合到用于顺序决策的 bandit 问题中。这种方法旨在提供统计有效性并提高奖励效率,尤其是在传统方法(如 Thompson Sampling 和 Upper Confidence Bound)可能遇到困难的弱臂可分性场景中。该框架提供了有限样本预测覆盖保证,并通过模拟和投资组合分配的应用得到了证明,在遗憾和风险调整回报方面显示出实际优势。 AI
影响 该框架可以通过提供更强的统计保证和更高的效率来增强复杂环境中的决策制定。
排序理由 该集群包含一篇详细介绍新框架和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Conformal Bandits
- Conformal Prediction
- Hidden Markov models
- Simone Cuonzo
- Thompson sampling
- University of California, Berkeley
- Upper Confidence Bound
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →