研究人员开发了STITCH-OPE,一个利用引导扩散模型进行离轨策略评估(OPE)的新框架。该方法旨在处理机器人和医疗保健等领域的**高维度、长周期问题**,在这些领域中直接与环境交互不切实际。STITCH-OPE通过在引导过程中减去行为策略的分数来**提高方差**,并通过拼接**部分轨迹**来生成扩展轨迹,在基准数据集上比现有的OPE技术有显著改进。 AI
影响 这种新的离轨策略评估框架可以通过提高离线数据性能估计的准确性,从而**实现更强大的机器人和医疗保健领域的人工智能开发**。
排序理由 该集群包含一篇详细介绍离轨策略评估新方法的**研究论文**。[lever_c_demoted from research: ic=1 ai=1.0]
- Behavior policy
- D4RL
- Denoising diffusion-weighted magnitude MR images using rank and edge constraints
- health care
- Hossein Goli
- OpenAI Gym
- robotics
- STITCH-OPE
- Target policy
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →