PulseAugur
实时 04:46:34
实体 Fitted Q-evaluation

Fitted Q-evaluation

PulseAugur coverage of Fitted Q-evaluation — every cluster mentioning Fitted Q-evaluation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_206008 ·

    离线RL利用MIMIC-IV数据优化脓毒症治疗

    研究人员开发了一种新颖的方法,使用离线强化学习来优化重症监护室脓毒症的管理。通过分析MIMIC-IV数据库中的历史患者数据,该研究将液体和血管升压药的剂量建模为马尔可夫决策过程。所开发的策略使用加权重要性采样和拟合Q评估进行评估,结果显示其回报高于临床医生的实践,同时建议适度减少静脉输液。

  2. TOOL · CL_203897 ·

    新AI框架减少医疗记录中的冗余,以改进强化学习

    研究人员开发了一种新的医学多模态强化学习框架,解决了临床记录中的时间冗余问题。该框架在策略学习前显式移除随时间重复的文本,从而提高了状态表示的质量。在真实ICU数据上的评估表明,这种考虑冗余的方法显著优于仅使用结构化数据或原始、未经编辑的记录的传统方法,从而在临床决策支持方面取得了更好的性能。

  3. RESEARCH · CL_107860 ·

    离线RL框架优化仓库吞吐量控制 · 已追踪2个来源

    研究人员开发了一个新的框架,使用离线强化学习(RL)来优化仓库运营的吞吐量控制。该系统通过智能管理节流来动态调整设置,以平衡最大化吞吐量与维持下游稳定性。该方法结合了历史信息的状态表示和用于延迟影响的动作空间抽象,以及一个考虑上游和下游指标的奖励函数。实证结果显示,使用CQL策略可将系统健康度提高22.97%,平均节流持续时间减少3.18%。

  4. RESEARCH · CL_25979 ·

    新的 FQE 和 FQI 方法绕过 Bellman 完全性以实现稳定性

    研究人员开发了新的拟合 Q 评估 (FQE) 和软拟合 Q 迭代 (soft FQI) 方法,这些方法不需要 Bellman 完全性,而 Bellman 完全性在使用函数逼近时常常无法满足。所提出的技术,即静态加权 FQE 和静态重加权 soft FQI,通过重新加权回归步骤以匹配目标策略的静态分布来解决不稳定性问题。这些方法旨在提高强化学习的离策略评估的稳定性和减少值误差。