实体
Contextual Bandit
Contextual Bandit
PulseAugur coverage of Contextual Bandit — every cluster mentioning Contextual Bandit across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新算法支持在有限反馈下进行LLM专家路由
研究人员开发了用于大规模语言模型(LLM)专家在线学习的新算法,特别针对有限反馈场景。所提出的方法将路由到不同LLM专家的提示视为一个上下文老虎机问题。实验表明,即使在反馈受限的情况下,这些算法也能有效地学习有效的路由策略,并达到次线性遗憾界限。
-
新的AIRL方法无需故障标签即可解决工业故障检测问题
研究人员开发了一种使用对抗性逆强化学习(AIRL)的工业故障检测新方法。该方法将故障检测视为一个离线逆强化学习问题,解决了现实场景中故障标签稀缺的挑战。与忽略时间动态或需要手动奖励工程的传统监督学习或上下文老虎机方法不同,AIRL直接从状态转换中恢复内在的“健康”奖励。该框架在三个运行至失效的基准测试中表现出色,在检测渐进式退化方面优于现有方法。