PulseAugur
实时 10:01:11
实体 FrozenLake

FrozenLake

PulseAugur coverage of FrozenLake — every cluster mentioning FrozenLake across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_195892 ·

    新的推理方法提高了时间差分学习的准确性

    研究人员开发了一种名为“常数步长时序差分学习的自归一化推理”的新方法。该技术通过考虑序列依赖性和步长相关的平稳目标,可以从单个马尔可夫轨迹中进行更准确的推理。该方法提供了渐近枢纽置信区域,而无需估计长期协方差或选择带宽,从而能够实现内存不随轨迹长度增长的单遍实现。在FrozenLake和Garnet上的实验证明了其在为平稳目标提供覆盖和纠正Richardson-Romberg目标方面的有效性。

  2. TOOL · CL_151869 ·

    新框架通过树回滚提升LLM代理训练效率

    研究人员开发了一个名为进程评分器引导自适应树回滚(PATR)的新框架,以提高多轮LLM代理强化学习的效率。该方法通过将轨迹组织成树状并从有希望的状态选择性地分支,解决了长周期任务中浪费探索的问题。PATR利用特定任务的反馈来评分部分轨迹、重用共享前缀并修剪无望的路径,从而在给定的训练预算内实现更有效的探索。在FrozenLake和SWE-Bench基准上的评估表明,PATR在FrozenLake上将结果提高了多达+9.3个点,在SWE…

  3. TOOL · CL_93821 ·

    新的强化学习方法使用 K 步前瞻实现更快的学习

    研究人员开发了一种新颖的强化学习方法,用于非周期性、有限时间范围的马尔可夫决策过程 (MDP)。该方法引入了一种修改后的 Q 函数,将规划限制在 K 步前瞻,并包含一个阈值机制,仅当估计值超过动态阈值时才选择动作。提出了一种高效的表格学习算法,证明了快速有限样本收敛性,并实现了 K=1 时的 minimax 最优常数遗憾,以及 K>=2 时的改进遗憾界限。在合成 MDP 和 JumpRiverswim、FrozenLake 和 Any…