PulseAugur
实时 09:49:43
实体 value function

value function

PulseAugur coverage of value function — every cluster mentioning value function across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_191350 ·

    强化学习智能体因评论家偏差而在部分可观测性下挣扎

    一项对部分可观测性下强化学习智能体的最新分析表明,学习性能受到的影响比之前归因于策略限制的要大。研究人员发现,即使最优策略是可表示的,价值函数也是富有表现力的,学习算法也可能收敛到次优策略。这是因为智能体无法观察到完整状态,导致评论家将无法解释的变化误解为价值估计中的急剧曲率,从而将执行器引离真正的最优值。研究表明,调整价值估计的前瞻性视野,而不是简单地提供过去观测的记忆,是缓解这一问题的关键。

  2. RESEARCH · CL_174169 ·

    New Bounds for Transformer Training via Optimal Control and Robust Optimization

    研究人员为 Transformer 训练开发了新的有限样本泛化界限,将该过程构建为一个马尔可夫控制问题。通过分析量化模型并使用集中不等式,他们为度量空间上的经验定律推导出了显式界限。这项工作还将 Transformer 泛化与 Wasserstein 分布鲁棒优化联系起来。

  3. TOOL · CL_105946 ·

    Google DeepMind:强化学习智能体可能隐式建模环境

    Google DeepMind 的研究人员展示了一种通过反转贝尔曼方程来恢复智能体世界模型的方法,该方程通常用于确定最优策略。这项工作表明,强化学习(RL)智能体,即使是没有经过显式环境建模训练的智能体,也可以在其价值函数中隐式编码世界模型。这些发现挑战了对无模型智能体不学习环境表示的传统理解。