PulseAugur
实时 17:51:16
实体 max@k

max@k

PulseAugur coverage of max@k — every cluster mentioning max@k across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_154008 ·

    强化学习研究探索加速、验证和基础模型 · 跟踪 9 个来源

    近期多篇 arXiv 论文探讨了强化学习 (RL) 的进展和理论基础。其中一篇论文研究了随机重置如何通过改进奖励信息传播来加速 RL,使其超越随机搜索,即使在复杂的基于神经网络的任务中也是如此。另一篇综述统一了验证 RL 策略的现有方法,这对于安全关键型应用至关重要。进一步的研究深入探讨了基础模型、多智能体系统的 RL,并为可泛化的真实世界 RL 任务引入了一个大规模基准。此外,还提出了用于在实际迁移约束下优化 RL 和处理大型推理模…