PulseAugur
中
实时 11:39:29
实体 Bellman update

Bellman update

PulseAugur coverage of Bellman update — every cluster mentioning Bellman update across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_280310 ·

    新的“Queen”AI像特级大师一样下棋并解释其走法

    研究人员开发了“Queen”,一个拥有40亿参数的语言模型,能够以特级大师水平下棋并解释其走法。该模型集成了专门的国际象棋编码器和指令调优的语言模型,通过迭代蒸馏过程进行训练,该过程在多个周期内优化解释。这种方法将Queen的Elo评分从1782显著提升至2697,在对弈强度和谜题准确性方面均超越了其他前沿模型,同时其解释被发现与GPT-5.6“Sol”相当且连贯。该框架被建议作为一种可迁移的方法,将语言模型应用于其他具有可用专家编码器的领域。

  2. TOOL · CL_156517 ·

    新框架通过不确定性估计增强离线强化学习

    研究人员开发了一个名为“不确定性估计下的保守查询和自适应正则化”(CQR-UE)的新框架,以改进离线强化学习。该方法解决了在训练过程中选择信息性偏好查询和有效利用专家反馈的挑战。CQR-UE 利用 Morse 网络估计相对于离线数据集的策略动作不确定性,从而实现保守的查询策略,保持 Bellman 更新的稳定性。它还包含一个自适应正则化方案,在策略优化期间动态调整约束,在 D4RL 基准测试上表现出优越或具有竞争力的性能。

  3. TOOL · CL_93813 ·

    新的DRRL算法通过线性逼近实现有限时间收敛

    研究人员开发了一种新的分布鲁棒强化学习(DRRL)算法,即使在使用线性函数逼近的情况下也能提供有限时间收敛保证。该算法解决了现有DRRL方法的局限性,这些方法通常需要表格设置或特定的结构假设。新方法结合了目标网络和对偶函数逼近方案,利用矩跟踪批评者和后缀平均来实现收敛到最优鲁棒Q函数。