PulseAugur
实时 04:23:22
实体 Lars Van Der Laan

Lars Van Der Laan

PulseAugur coverage of Lars Van Der Laan — every cluster mentioning Lars Van Der Laan across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_217824 ·

    新的半参数DRL方法增强了长时因果推断

    研究人员开发了一种新的半参数双强化学习(DRL)方法,旨在提高从随机实验中进行长时因果推断的效率和稳定性。该方法解决了完全非参数DRL的局限性,尤其是在处理弱时间重叠和高维占用率时。新方法对Q函数本身施加半参数限制,而不是对奖励和转移定律施加限制,从而在允许丰富模型的同时提供潜在的效率提升。为确保稳健性,估计量通过加权Bellman残差最小化来定义,即使在模型错误指定的情况下也保持有意义。

  2. TOOL · CL_215806 ·

    新的校准DML方法增强了处理效应的统计推断

    研究人员开发了一种名为校准去偏机器学习(DML)的新方法,以提高双重稳健估计量的准确性。这些估计量通常用于分析处理效应和回归函数。新技术解决了不匹配问题,即一致性只需要一个干扰函数准确,而渐近正态性则需要两个快速收敛的函数。通过结合等渗回归进行校准,该方法即使一个干扰估计量收敛缓慢或不一致,只要满足部分正交条件,也能确保渐近正态性。该方法还包括一个用于置信区间的引导辅助方法,并在基准数据集上显示出偏倚减少和覆盖率提高。

  3. RESEARCH · CL_25979 ·

    新的 FQE 和 FQI 方法绕过 Bellman 完全性以实现稳定性

    研究人员开发了新的拟合 Q 评估 (FQE) 和软拟合 Q 迭代 (soft FQI) 方法,这些方法不需要 Bellman 完全性,而 Bellman 完全性在使用函数逼近时常常无法满足。所提出的技术,即静态加权 FQE 和静态重加权 soft FQI,通过重新加权回归步骤以匹配目标策略的静态分布来解决不稳定性问题。这些方法旨在提高强化学习的离策略评估的稳定性和减少值误差。