PulseAugur
实时 09:48:29
实体 Bellman Policy Optimization

Bellman Policy Optimization

PulseAugur coverage of Bellman Policy Optimization — every cluster mentioning Bellman Policy Optimization across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_254591 ·

    新的Bellman策略优化方法增强了LLM的推理能力

    研究人员推出了一种新颖的具有可验证奖励的强化学习(RLVR)方法——Bellman策略优化(BPO),旨在增强大型语言模型(LLMs)的推理能力。BPO是一种无判别器的方法,源自策略镜像下降(PMD),它将PMD重构为使用Bellman方程的轨迹级目标。这种重构绕过了在中间步骤估计状态值的需求,并且其实际损失函数通过基于平滑标记概率的失配校正权重进行近似。在数学推理基准上的实验表明BPO是有效的。