PulseAugur
实时 20:50:06
实体 Partially observable Markov decision processes and performance sensitivity analysis

Partially observable Markov decision processes and performance sensitivity analysis

PulseAugur coverage of Partially observable Markov decision processes and performance sensitivity analysis — every cluster mentioning Partially observable Markov decision processes and performance sensitivity analysis across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_154073 ·

    新框架统一了 POMDP 中的不确定性约简和奖励

    研究人员为部分可观察马尔可夫决策过程(POMDP)开发了一个新框架,该框架直接奖励不确定性约简。这种方法被称为最小化预期自由能(EFE),已被证明等同于求解一种特定类型的 POMDP,其中效用是预期的信息增益。在包括 Tiger 问题和 RockSample 在内的各种环境中的实验表明,EFE 规划无需针对特定任务进行调整,即可匹配或超越仅基于奖励的规划,并避免了过度探索问题。这为信息收集有成本的应用(如故障检测和医学筛查)提供了一个…

  2. TOOL · CL_93300 ·

    新的PO-PDDL公式化实现了LLM友好的机器人不确定性规划

    研究人员开发了PO-PDDL,一种新的符号化部分可观察马尔可夫决策过程(POMDPs)的公式化方法,它在保持PDDL的关系结构的同时,显式地建模了部分可观察性和随机性。该公式化旨在友好于LLM,并可在不同任务中重复使用。提出了一种从机器人执行的视觉演示中学习PO-PDDL模型的流水线,以识别部分可观察性并学习随机模型。在真实世界操作任务上的实验表明,该方法在不确定性下的鲁棒任务规划方面优于现有的PDDL和POMDP学习方法,并降低了规划成本。

  3. COMMENTARY · CL_88317 ·

    ReAct 模式增强了 LLM 的推理和行动能力

    ReAct 模式是一种用于大型语言模型(LLM)的设计模式,它增强了 LLM 在复杂环境中的推理和行动能力。它使 LLM 能够感知、推理和行动,从而能够从交互中学习并随时间进行适应。该模式基于马尔可夫决策过程(MDP)和部分可观察马尔可夫决策过程(POMDP)等概念,并应用于聊天机器人、虚拟助手、自动驾驶汽车和游戏等领域。

  4. RESEARCH · CL_68129 ·

    POMDP值函数被表征为半代数集

    研究人员已将部分可观察马尔可夫决策过程(POMDP)中的可行值函数集表征为半代数集。这扩展了先前关于完全可观察过程的研究,揭示了部分可观察性引入了非线性约束和更复杂的几何结构。这些发现为策略优化提供了新的见解,并突显了POMDP中的独特现象,例如孤立的局部奖励最大化器的可能性。

  5. TOOL · CL_34515 ·

    新框架结合采样和模型检测来合成POMDP策略

    研究人员开发了一个新的框架,用于合成部分可观察马尔可夫决策过程(POMDP)的策略,POMDP用于不确定性下的决策。该方法结合了可扩展但缺乏正式保证的基于采样的方法,以及提供正确性但难以扩展的形式化综合技术。通过使用采样作为成员预言机和模型检测作为等价预言机,该框架可以合成具有正式保证的有限状态控制器,在安全关键型应用中显示出潜力。

  6. TOOL · CL_25564 ·

    新的MCTS分析为POMDP规划提供理论保证

    研究人员开发了一种新的有限时间分析方法,用于蒙特卡洛树搜索(MCTS)在部分可观察马尔可夫决策过程(POMDPs)中的应用。这项工作为离散和连续观测空间提供了概率集中界,填补了像POMCP这样的MCTS风格求解器在理论保证方面的空白。所提出的方法Voro-POMCPOW使用Voronoi单元自适应地划分连续观测空间,以维持有限的分支因子,同时提供理论保证。