PulseAugur
实时 02:02:08
实体 Rank-Then-Act

Rank-Then-Act

PulseAugur coverage of Rank-Then-Act — every cluster mentioning Rank-Then-Act across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_132261 ·

    Rank-Then-Act框架在没有环境奖励的情况下学习控制策略

    研究人员开发了一个名为Rank-Then-Act (RTA) 的新颖框架,使强化学习代理能够在没有显式环境奖励的情况下从视频演示中学习控制策略。RTA利用视觉语言模型作为序数评分器,预测视频序列中的进展。然后,该评分器用于生成基于相关性的强化学习奖励信号,该信号在各种任务和环境中表现出稳定的性能,包括离散控制基准和连续控制任务。

  2. RESEARCH · CL_99607 ·

    新研究探索用于智能体生存、导航和可解释性的高级强化学习 · 跟踪 7 个来源

    研究人员正在探索强化学习(RL)的高级技术,以增强智能体的性能和可解释性。一项研究提出了程序化策略(PERL)作为进化 RL 中神经策略(NERL)的替代方案,证明了 PERL 更高的生存率。另一篇论文侧重于使用 RL 进行自主机器人的流感知导航,发现使用速度和记忆传感器训练的智能体优于那些具有显式全局流参数的智能体。此外,正在开发新的方法来解释 RL 智能体,例如使用归纳逻辑编程(ILP)为策略可解释性创建客观指标,以及一种称为 S…