PulseAugur
实时 09:32:20
实体 Q-values

Q-values

PulseAugur coverage of Q-values — every cluster mentioning Q-values across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_254249 ·

    新框架模拟具有环境反馈的多智能体Q学习

    研究人员开发了一个新的框架,使用进化计算来模拟复杂环境反馈回路中的多智能体Q学习。该模型模拟了单个智能体学习、局部交互和环境变化如何相互影响。该框架使用平均场近似来预测群体行为,并通过在各种图结构上进行模拟进行了验证,结果表明该近似对于更大的群体和更高的平均度通常成立。

  2. TOOL · CL_191352 ·

    研究探讨折现马尔可夫决策过程中的转移核的可识别性

    本文研究了仅凭最优动作即可识别马尔可夫决策过程(MDP)的哪些方面,而不是直接观察转移概率或Q值。该研究侧重于折现MDP下转移核的可识别性,探讨了不同形式的奖励(状态-动作、仅状态或状态-动作-下一状态)如何影响对底层动力学的学习。研究结果表明,知道所有状态-动作奖励的最优动作不足以唯一确定转移概率,揭示了一个产生相同最优动作的n(n-1)维核族。

  3. TOOL · CL_16081 ·

    新的AdamO优化器增强了离线强化学习的稳定性和性能

    研究人员推出了一种名为AdamO的新型优化器,旨在增强离线强化学习的稳定性。该优化器解决了“崩溃”问题,即时序差分更新中的错误可能导致Q值极端且不可用。AdamO通过引入正交约束来防止TD误差的放大,理论上保证了任务安全,同时保持了Adam的连续时间耗散动力学。实证结果表明,当与现有基线集成时,AdamO在各种离线强化学习基准测试中提高了稳定性和性能。