Bellman
PulseAugur coverage of Bellman — every cluster mentioning Bellman across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新理论统一人工智能的通信、控制和决策
一篇新论文提出了一个实用信息理论的数学框架,旨在统一通信、控制和决策。该理论引入了 isoteleia 的概念,该概念将不同语义路径在导致相同最优行动时可以被视为实用等价的思想形式化。该框架将熵和信道容量等经典信息论概念扩展到面向任务的语境中,为智能系统基于其目标和资源约束可以提取的效用设定了基本限制。
-
新的推理方法提高了时间差分学习的准确性
研究人员开发了一种名为“常数步长时序差分学习的自归一化推理”的新方法。该技术通过考虑序列依赖性和步长相关的平稳目标,可以从单个马尔可夫轨迹中进行更准确的推理。该方法提供了渐近枢纽置信区域,而无需估计长期协方差或选择带宽,从而能够实现内存不随轨迹长度增长的单遍实现。在FrozenLake和Garnet上的实验证明了其在为平稳目标提供覆盖和纠正Richardson-Romberg目标方面的有效性。
-
新的 Wasserstein 策略梯度方法用于 LQ 控制问题
研究人员开发了一种用于熵正则化线性二次 (LQ) 控制问题的 Wasserstein 策略梯度 (WPG) 方法。该方法利用了无约束 LQ 控制问题具有线性高斯最优策略这一事实。WPG 方法通过考虑动作空间中的传输来更新动作律,并且 Bellman 验证论证证实了折扣占用加权的逐状态 Wasserstein 梯度与该策略类相切。因此,WPG 方法简化为反馈增益和动作协方差的有限维常微分方程 (ODE),该方程被证明是全局适定的,并且可…
-
新研究解决 LLM 代理的信用分配问题 · 已追踪 2 个来源
arXiv 上的两篇新研究论文探讨了大型语言模型代理的高级信用分配技术。第一篇论文《从推理到代理:大型语言模型强化学习中的信用分配》综合了现有研究,以应对在复杂的代理环境中确定哪些具体行动或推理步骤能带来预期结果的挑战。第二篇论文《Gated-BEPO:置信门控贝尔曼信用分配用于大型语言模型代理》引入了一种名为 Gated-BEPO 的新方法,该方法使用经验性滚动图和置信门来更有效地将稀疏终端结果的奖励传播到单个行动,并在各种基准测试…
-
新的拍卖系统优化了大型语言模型对话中的广告投放时机
研究人员开发了LLM-OSDA,一种用于多轮对话中原生广告的新型动态拍卖机制。该系统将最优停止理论与拍卖框架相结合,以确定赞助内容的投放时机和分配。一个名为StopNet的学习组件近似最优停止策略,旨在提高净收入同时保持用户留存。
-
新的鲁棒 Q-学习算法解决了具有 Wasserstein 不确定性的均场控制问题
研究人员开发了一种新的鲁棒 Q-学习算法,用于均场控制问题。该算法通过将量化-投影方案与 Wasserstein 对偶重构相结合,解决了公共噪声定律中 Wasserstein 不确定性带来的挑战。所提出的方法已证明了收敛性,并为同步和异步学习方案提供了有限时间迭代界限,数值实验验证了其在系统性风险和流行病相关模型上的性能。
-
撤回的论文详细介绍了新颖的连续时间策略评估方法
一篇已被撤回的研究论文提出了一种新颖的连续时间策略评估方法,称为高阶生成器回归。该技术旨在通过使用多步转移和矩匹配系数来估计时变生成器,从而改进标准的Bellman基线。该论文在理论上分解了估计误差,并提供了预期更高阶收益的制度图,在校准研究中显示出优于Bellman基线的持续改进。
-
Yann LeCun 澄清“世界模型”在AI中的技术定义
Yann LeCun 就AI中的“世界模型”一词进行了技术性讨论。他澄清说,在控制论和马尔可夫决策过程(MDP)的背景下,“世界模型”特指转移模型或动力学模型,这一概念可以追溯到20世纪60年代的Bellman和Kalman。LeCun 链接了一个进一步阐述这一历史观点的讲座。