实体
Weighted importance sampling for off-policy learning with linear function approximation
Weighted importance sampling for off-policy learning with linear function approximation
PulseAugur coverage of Weighted importance sampling for off-policy learning with linear function approximation — every cluster mentioning Weighted importance sampling for off-policy learning with linear function approximation across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
离线RL利用MIMIC-IV数据优化脓毒症治疗
研究人员开发了一种新颖的方法,使用离线强化学习来优化重症监护室脓毒症的管理。通过分析MIMIC-IV数据库中的历史患者数据,该研究将液体和血管升压药的剂量建模为马尔可夫决策过程。所开发的策略使用加权重要性采样和拟合Q评估进行评估,结果显示其回报高于临床医生的实践,同时建议适度减少静脉输液。
-
新AI框架减少医疗记录中的冗余,以改进强化学习
研究人员开发了一种新的医学多模态强化学习框架,解决了临床记录中的时间冗余问题。该框架在策略学习前显式移除随时间重复的文本,从而提高了状态表示的质量。在真实ICU数据上的评估表明,这种考虑冗余的方法显著优于仅使用结构化数据或原始、未经编辑的记录的传统方法,从而在临床决策支持方面取得了更好的性能。
-
新的Kernel-WIS估计器改进了上下文老虎机中的离策略评估
研究人员推出了一种用于上下文老虎机中离策略评估的新估计器Kernel-WIS。该方法利用离线数据,并且设计为渐近一致的。Kernel-WIS旨在通过结合标准加权重要性采样和标准重要性采样的特性,尤其是在行为策略错误指定的情况下,优于现有基线。