PulseAugur
实时 04:09:23
实体 Mask-Aware Policy Gradients

Mask-Aware Policy Gradients

PulseAugur coverage of Mask-Aware Policy Gradients — every cluster mentioning Mask-Aware Policy Gradients across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_147419 ·

    新的掩码感知策略梯度在基准测试中提升DLM推理能力 · 跟踪2个来源

    研究人员开发了一种名为掩码感知策略梯度的新方法,以增强扩散语言模型(DLMs)的推理能力。该方法通过准确估计对数似然,解决了将强化学习应用于掩码扩散语言模型(MDLMs)的挑战。该技术将生成过程形式化为两阶段动作马尔可夫决策过程,优化了token放置和掩码决策。这种双重优化在数学推理和编码基准测试中取得了最先进的结果,在GSM8K上达到87.1%,在MBPP上达到53.4%。