研究人员开发了一种名为高概率约束UCB的新算法,用于具有连续动作的上下文老虎机问题。该算法通过对已实现动作成本强制执行高概率约束来解决安全问题,这对于临床试验和自主系统等应用至关重要,因为不安全的决策可能导致严重后果。与之前关注预期成本的方法不同,这种方法考虑了结果的可变性,提供了更强的安全保证。该算法在线性模型中实现了严格的遗憾界限,并扩展到更一般的函数类,实验结果表明与现有基线相比,其在减少安全违规方面非常有效。 AI
影响 增强了顺序决策系统中安全性的保证,这对于现实世界的AI应用至关重要。
排序理由 关于上下文老虎机新算法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →