PulseAugur
实时 11:26:48
实体 Difficulty-Adaptive Sentence-entropy-guided Tree-structured Policy Optimization

Difficulty-Adaptive Sentence-entropy-guided Tree-structured Policy Optimization

PulseAugur coverage of Difficulty-Adaptive Sentence-entropy-guided Tree-structured Policy Optimization — every cluster mentioning Difficulty-Adaptive Sentence-entropy-guided Tree-structured Policy Optimization across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_244570 ·

    新的 DATPO 方法增强了大型推理模型的推理覆盖范围

    研究人员开发了一种新的 DATPO 方法,以提高使用可验证奖励强化学习 (RLVR) 训练的大型推理模型的推理能力。DATPO 通过优化训练 rollout 来解决 RLVR 在扩展内在推理覆盖范围 (pass@k) 方面的局限性。该方法结合了自适应难度树搜索和句子熵引导的分叉,以最大化语义多样性并克服局部化问题,在数学推理基准测试中优于现有方法。