PulseAugur
实时 17:07:56
实体 V-GRPO

V-GRPO

PulseAugur coverage of V-GRPO — every cluster mentioning V-GRPO across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_06524 ·

    V-GRPO方法通过更快、更稳定的强化学习增强去噪生成模型

    研究人员推出了一种新颖的在线强化学习方法V-GRPO,旨在使去噪生成模型与期望结果对齐。该方法通过有效利用证据下界(ELBO)代理,克服了先前的局限性,其性能优于优化采样轨迹的方法。V-GRPO将ELBO代理与GRPO算法相结合,并采用技术来减少方差和控制梯度步长,从而提高了文本到图像合成的稳定性和性能。