PulseAugur
实时 10:36:38
实体 R learner

R learner

PulseAugur coverage of R learner — every cluster mentioning R learner across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_245579 ·

    新方法通过以决策为中心的抽象增强离线强化学习

    研究人员开发了一种新的离线强化学习方法,该方法侧重于创建以决策为中心的抽象。这种方法旨在保留学习最优动作的关键信息,同时丢弃不相关的状态动态。所提出的技术利用因果机器学习和统计稀疏学习来估计Q函数差值,有可能导致更有效的决策过程。该方法在模拟和增强的真实世界数据中展示了方差改进,并分离了顺序决策的关键信息。