PulseAugur
实时 17:51:46
English(EN) Rationalizing Boltzmann Rationality: An Axiomatic Characterization of Entropy-Regularized Policies

新论文对强化学习中的玻尔兹曼理性进行了公理化。

一篇新论文提出了玻尔兹曼理性(一种常见的随机选择模型)的公理化表征,该模型在强化学习中得到广泛应用。该研究区分了选择中的随机性与环境中的偶然性,并提出通过将独立性公理限制在环境彩票上,可以唯一地推导出玻尔兹曼策略及其相关的软贝尔曼方程。该框架为智能体设计提供了规范性评估,并阐明了无关选项独立性公理适用的条件。 AI

影响 为理解强化学习中智能体的决策过程提供了理论框架。

排序理由 该集群包含一篇发表在arXiv上的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新论文对强化学习中的玻尔兹曼理性进行了公理化。

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Silviu Pitis ·

    对玻尔兹曼理性的合理化:熵正则化策略的公理化表征

    arXiv:2607.17316v1 Announce Type: new Abstract: The softmax policy $\pi(a \mid s) \propto \exp(\beta Q(s,a))$ is the default model of stochastic choice in reinforcement learning (RL). Various justifications based on robustness, exploration, and optimization have been offered in t…