PulseAugur
实时 14:51:14
实体 Boltzmann policy

Boltzmann policy

PulseAugur coverage of Boltzmann policy — every cluster mentioning Boltzmann policy across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_154454 ·

    新论文对强化学习中的玻尔兹曼理性进行了公理化。

    一篇新论文提出了玻尔兹曼理性(一种常见的随机选择模型)的公理化表征,该模型在强化学习中得到广泛应用。该研究区分了选择中的随机性与环境中的偶然性,并提出通过将独立性公理限制在环境彩票上,可以唯一地推导出玻尔兹曼策略及其相关的软贝尔曼方程。该框架为智能体设计提供了规范性评估,并阐明了无关选项独立性公理适用的条件。

  2. TOOL · CL_151944 ·

    新的Soft Q(λ)方法增强了离策略强化学习

    研究人员推出了一种新颖的熵正则化强化学习多步离策略方法Soft $Q(\lambda)$。该框架通过在任意行为策略下实现有效的信用分配,扩展了现有的soft Q-learning技术。所提出的方法使用了一个新的Soft Tree Backup算子和资格迹,提供了一种无模型的方法来学习熵正则化的价值函数,可用于未来的实证研究。