PulseAugur
实时 11:01:47
实体 RL algorithms

RL algorithms

PulseAugur coverage of RL algorithms — every cluster mentioning RL algorithms across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_247826 ·

    新的基于模型的强化学习方法优化模块化制造系统

    研究人员开发了一种使用基于模型的强化学习来控制柔性制造系统的新方法。该方法将近似逆过程模型纳入强化学习策略训练中,有助于将驱动动力学学习与状态空间动力学学习分离开来。该框架在实验室模块化生产测试台上进行了测试,并在性能和训练速度方面均显示出更高的效率,尤其是在离策略算法方面。

  2. RESEARCH · CL_141245 ·

    新的SpectraReward方法使用MLLMs进行零样本文本到图像生成

    研究人员推出了一种新颖的、无需训练的奖励函数SpectraReward,旨在利用预训练的多模态大语言模型(MLLMs)作为文本到图像生成的现成奖励模型。该方法评估从生成的图像中重建原始提示的程度,利用MLLM固有的图像-文本对齐能力,而无需偏好标签或奖励模型微调。一个专门的版本Self-SpectraReward,能够在统一的多模态模型中实现闭环自我改进框架。在各种扩散模型、RL算法和MLLM规模上的实验表明,SpectraRewar…