PulseAugur
实时 11:56:11
实体 RL agents

RL agents

PulseAugur coverage of RL agents — every cluster mentioning RL agents across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_114506 ·

    Qwen-AgentWorld 训练语言模型作为强化学习智能体模拟器

    研究人员推出了 Qwen-AgentWorld,这是一种新颖的方法,它训练一个语言模型作为强化学习 (RL) 智能体的世界模型。该模型根据当前观察和智能体的动作来预测下一个环境状态,使其能够充当解耦的模拟器。这使得能够廉价且大规模地生成海量训练数据,克服了现实世界环境缓慢且成本高昂的限制。

  2. TOOL · CL_105946 ·

    Google DeepMind:强化学习智能体可能隐式建模环境

    Google DeepMind 的研究人员展示了一种通过反转贝尔曼方程来恢复智能体世界模型的方法,该方程通常用于确定最优策略。这项工作表明,强化学习(RL)智能体,即使是没有经过显式环境建模训练的智能体,也可以在其价值函数中隐式编码世界模型。这些发现挑战了对无模型智能体不学习环境表示的传统理解。

  3. RESEARCH · CL_99679 ·

    新的模型驱动方法简化了RL环境族的开发

    研究人员开发了一种新颖的模型驱动方法,以简化强化学习(RL)环境族的创建。该方法利用混合遗传算法,结合全局和局部搜索技术,生成多样化但相似的环境。通过模型转换管理突变和约束,由专用引擎实现操作,解决了传统环境开发劳动密集型的问题。