PulseAugur
实时 08:12:42
实体 D4RL benchmark

D4RL benchmark

PulseAugur coverage of D4RL benchmark — every cluster mentioning D4RL benchmark across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_156517 ·

    新框架通过不确定性估计增强离线强化学习

    研究人员开发了一个名为“不确定性估计下的保守查询和自适应正则化”(CQR-UE)的新框架,以改进离线强化学习。该方法解决了在训练过程中选择信息性偏好查询和有效利用专家反馈的挑战。CQR-UE 利用 Morse 网络估计相对于离线数据集的策略动作不确定性,从而实现保守的查询策略,保持 Bellman 更新的稳定性。它还包含一个自适应正则化方案,在策略优化期间动态调整约束,在 D4RL 基准测试上表现出优越或具有竞争力的性能。

  2. TOOL · CL_58685 ·

    新的 Q-Guided Alignment 框架增强了序列模型的可控性

    研究人员推出了一种名为 Q-ALIGN DT 的新框架,旨在通过将面向返回(RTG)的输入与学习策略的实际性能进行对齐来增强条件序列模型(CSM)。该方法利用 Q 函数来指导 CSM,确保更高的 RTG 对应于具有更高预期回报的轨迹。在 D4RL 基准测试上的实验表明,Q-ALIGN DT 提供了卓越的可控性和性能,有效地学习了能够泛化到速度跟踪等复杂任务的结构化策略,而之前的方​​法在此类任务上表现不佳。