PulseAugur
实时 07:25:13
实体 Contextual Bandits

Contextual Bandits

PulseAugur coverage of Contextual Bandits — every cluster mentioning Contextual Bandits across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_223276 ·

    新算法在连续动作上下文老虎机中强制执行安全约束

    研究人员开发了一种名为高概率约束UCB的新算法,用于具有连续动作的上下文老虎机问题。该算法通过对已实现动作成本强制执行高概率约束来解决安全问题,这对于临床试验和自主系统等应用至关重要,因为不安全的决策可能导致严重后果。与之前关注预期成本的方法不同,这种方法考虑了结果的可变性,提供了更强的安全保证。该算法在线性模型中实现了严格的遗憾界限,并扩展到更一般的函数类,实验结果表明与现有基线相比,其在减少安全违规方面非常有效。

  2. TOOL · CL_191320 ·

    新的 BC-ICL 方法利用基础模型实现高效上下文老虎机

    研究人员开发了一种名为 BC-ICL 的新方法,用于上下文老虎机,该方法利用预训练的表格基础模型实现更高效的个性化。该方法使用上下文学习,并通过引导重采样交互历史来选择动作,旨在克服数据稀疏和不确定性估计不可靠等挑战。实证结果表明,BC-ICL 在早期回合和整体表现强劲,在在线决策场景中优于现有基线。

  3. TOOL · CL_165083 ·

    新研究解决了上下文老虎机的跨域OPE/L问题

    一篇新研究论文提出了面向上下文老虎机的跨域策略离轨评估与学习(OPE/L),解决了现有方法的局限性。所提出的方法允许使用来自目标域和其他相关域的历史数据来评估和学习新策略。这种新颖的表述旨在提高在数据有限、确定性日志策略以及引入新动作等具有挑战性场景下的OPE/L性能,这些场景在个性化医疗和内容推荐等领域很常见。

  4. RESEARCH · CL_104670 ·

    新的 Thompson 采样方法解决了非平稳和私有的上下文赌博机问题

    两篇新研究论文介绍了 Thompson 采样在上下文赌博机方面的新方法。一篇题为“面向非平稳上下文赌博机的流校正 Thompson 采样”的论文提出了一种贝叶斯方法,通过基于显式漂移模型进行校正和重新加权来重用历史数据,其性能优于标准的遗忘基线。第二篇论文“AdaPrivate-TS:具有隐私放大的上下文赌博机的私有 Thompson 采样”提出了一种差分私有算法,该算法将 Thompson Sampling 与批处理 zCDP 组合…

  5. RESEARCH · CL_36336 ·

    新框架优化从日志数据中进行风险感知策略学习

    研究人员开发了一个新的风险感知离线策略学习框架,这对于在无法实时交互的高风险情况下做出决策至关重要。该方法允许通过使用日志数据来优化各种风险度量,包括均值-方差和熵风险。分析表明,与优化期望回报相比,优化这些通用风险标准不会产生额外的统计成本,达到了极小极大最优速率。