PulseAugur
中
实时 04:27:23
实体 Adversarial Inverse Reinforcement Learning

Adversarial Inverse Reinforcement Learning

PulseAugur coverage of Adversarial Inverse Reinforcement Learning — every cluster mentioning Adversarial Inverse Reinforcement Learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_216015 ·

    新的AIRL-S框架统一了强化学习和基于搜索的方法,用于LLM的测试时扩展

    研究人员推出AIRL-S,一个新颖的框架,它统一了强化学习和基于搜索的方法,用于大型语言模型的测试时扩展。该方法从参考轨迹中推断出密集的奖励模型,无需标记过程数据,并避免了训练不稳定和奖励攻击等问题。在八个基准上的评估显示,AIRL-S比基础模型平均性能提高了9%,达到了GPT-4o的能力。

  2. TOOL · CL_167336 ·

    新的AIRL方法无需故障标签即可解决工业故障检测问题

    研究人员开发了一种使用对抗性逆强化学习(AIRL)的工业故障检测新方法。该方法将故障检测视为一个离线逆强化学习问题,解决了现实场景中故障标签稀缺的挑战。与忽略时间动态或需要手动奖励工程的传统监督学习或上下文老虎机方法不同,AIRL直接从状态转换中恢复内在的“健康”奖励。该框架在三个运行至失效的基准测试中表现出色,在检测渐进式退化方面优于现有方法。