PulseAugur
实时 03:23:22
实体 partially observable Markov decision process

partially observable Markov decision process

PulseAugur coverage of partially observable Markov decision process — every cluster mentioning partially observable Markov decision process across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 14
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-13 research_milestone A new framework for adaptive mine planning using POMDPs was proposed in a research paper. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_225620 ·

    大型语言模型AI代理绕过复杂的概率计算,尽管存在理论框架

    用作AI代理的大型语言模型(LLM)本身不计算概率,尽管像部分可观察马尔可夫决策过程(POMDP)这样的理论框架表明它们应该这样做。虽然POMDPs为不完全信息下的决策提供了数学模型,并使用贝叶斯定理根据新观察更新信念,但基于LLM的代理通常不执行这些复杂的计算。精确求解POMDPs的计算成本使其不适用于实际应用,导致LLM代理依赖于不同、不太严谨的决策方法。

  2. TOOL · CL_215857 ·

    新框架为AI智能体的规范世界模型定义了范式

    本文通过根据建模通道(环境、智能体或联合智能体-环境系统)对强化学习中的世界模型进行分类,引入了一个理解世界模型的框架。利用计算力学,作者将这三种情况的规范预测模型定义为ε-变换器或ε-机。研究表明,规范环境模型与标准的预测状态表示一致,而另外两种情况则为智能体和联合系统产生了类似的规范模型。一个关键发现是,规范的、支持受限的环境状态通过规范的联合因果状态进行分解,其转换结构源自联合模型,而智能体侧的构建是偶对的。

  3. TOOL · CL_171917 ·

    新方法简化了强化学习中的部分可观察性

    研究人员开发了一种名为最小马尔可夫化(Minimal Markovization)的方法来解决智能体在部分可观察性下行动的挑战。该技术表征了全息覆盖决策过程(holonomy-cover decision processes)的最小马尔可夫充分统计量,这是一类特殊的POMDPs,其中可见动力学是马尔可夫的,而隐藏模式由可见转换置换。该方法引入了“稳定商”(stable quotient)来创建保留奖励和后继状态的逐观察抽象,证明了当前…

  4. TOOL · CL_156425 ·

    新方法使人工智能代理能够学习复杂的隐藏状态系统

    研究人员开发了一种新方法,使自主代理能够学习和推理具有隐藏状态的系统,这个问题通常被表述为学习离散的部分可观察马尔可夫决策过程(POMDP)。代理从POMDP的动作和观察空间知识开始,但必须从顺序数据中构建其状态空间、转移和观察模型。所提出的方法基于预测状态表示(PSRs)等谱方法,通过张量分解估计相似变换来学习POMDP矩阵。该方法允许在模型学习后为不同的目标和奖励函数生成新计划,并且还表明仅从顺序数据中学习超出状态分区的POMDP是不可能的。

  5. TOOL · CL_154058 ·

    新研究强调AI在处理模糊用户任务方面的挣扎

    一篇新研究论文介绍了一个评估语言模型与用户任务对齐能力的框架,即使这些任务是模糊的或不完全指定的。该方法被形式化为一个部分可观察马尔可夫决策过程(POMDP),测试模型在不断演变的用户交互中推断用户真实意图的能力。人类研究表明,当前模型在此任务对齐方面存在显著困难,仅在22-32%的时间内能恢复用户的意图任务,而人类的成功率为48%。尽管监督微调和强化学习有所改进,但在通过交互解决不确定性方面,模型仍落后于人类能力,表明其在交互式自主…

  6. RESEARCH · CL_154104 ·

    新方法在边缘GPU上加速贝叶斯推理,速度提升高达5倍

    研究人员开发了一种新的面向硬件的方法,以加速嵌入式GPU上的贝叶斯推理,解决了计算成本问题,该成本通常会阻碍其在资源受限的边缘设备上的部署。该方法通过重构内存布局和采用稀疏数组表示来优化张量收缩,这是变分消息传递算法中的一个关键瓶颈。该优化已应用于隐马尔可夫模型的算法,在NVIDIA Jetson Orin AGX上实现了高达5倍的速度提升,典型增益为2-2.5倍,同时保持了数值精度。

  7. TOOL · CL_100112 ·

    VOiLA框架使用扩散模型进行机器人不确定性规划

    研究人员开发了VOiLA,一个使用学习扩散模型进行POMDP智能体不确定性规划的新框架。VOiLA通过采用条件扩散模型进行转移和观测采样,以及基于粒子的信念更新,来学习与任务无关的POMDP模型。该框架将这些扩散采样器蒸馏成高效的前馈生成器,并将其与一个GPU并行规划器VOPP集成。这种蒸馏显著降低了采样成本,使得学习到的POMDP模型能够实际应用于在线规划,并在基准问题和物理机器人评估中展现出强大的性能和泛化能力。

  8. TOOL · CL_97992 ·

    新的POMDP框架优化不确定性下的锂生产

    研究人员开发了一个新的框架,使用部分可观察马尔可夫决策过程(POMDP)来优化锂生产决策。该方法解决了地质、需求和定价方面的不确定性,而这些不确定性在之前的模型中没有被充分捕捉。POMDP框架利用信念状态规划,能够动态适应各种锂价制度和提取技术,其表现优于人类启发式方法。研究表明,该方法在项目生命周期内能够实现更高的需求满足率,并改善经济和环境效益。

  9. RESEARCH · CL_97982 ·

    OmniAgent 使用主动感知进行高效视频理解 · 已追踪 2 个来源

    研究人员推出 OmniAgent,这是一种新颖的全模态智能体,用于视频理解,它利用基于部分可观察马尔可夫决策过程 (POMDP) 的迭代式观察-思考-行动 (Observation-Thought-Action) 循环。这种方法允许智能体选择性地将视听线索提炼成文本记忆,从而将推理复杂性与原始视频时长解耦,提高计算效率。该论文详细介绍了两种关键的训练方法:用于引导主动感知的智能体监督微调 (Agentic Supervised Fin…

  10. TOOL · CL_30729 ·

    新的POMDP框架实现了地质不确定性下的自适应矿山规划

    研究人员开发了一个新的矿山规划框架,通过将地质不确定性视为价值创造的活跃组成部分来适应它。该方法使用部分可观察马尔可夫决策过程(POMDP)进行序列决策,将未来的观测和信念更新整合到规划过程中。提出的SA-POMDP架构结合了模拟退火和基于集成的方法进行信念更新,与传统的静态规划方法相比,显著缩小了预期净现值(NPV)和实际净现值之间的差距。

  11. RESEARCH · CL_22508 ·

    新理论区分了AI能动性中的预测、压缩和赋权

    一篇新论文提出了一个理论框架,用于理解在部分可观测性下运行的AI系统的能动性。该研究引入了“桥接接口”的概念,以模拟智能体如何通过可控参数和环境状态与其环境进行交互。该论文证明了预测、压缩和赋权之间的分离,表明有效的AI设计应区分识别隐藏状态、优化接口和实现任务相关控制。

  12. RESEARCH · CL_16294 ·

    新的因果模型为数字经济政策模拟提供框架

    研究人员引入了两类新颖的因果模型,用于决策代理,称为结构因果决策模型(SCDMs)和结构因果决策过程(SCDPs)。这些模型通过显式表示因果关系并允许决策受其先决条件约束来扩展现有框架,同时还容纳了开放的根变量。SCDPs 因其表达能力而尤为突出,通过不假设理性信念形成并能够内生地建模记忆和变量折扣,超越了 POMDPs。

  13. RESEARCH · CL_16192 ·

    AI路由框架提升LEO卫星网络性能与效率

    研究人员开发了一种新颖的、基于时空学习的分布式路由框架,专为动态低地球轨道(LEO)卫星网络设计。该框架将图注意力网络(GAT)和长短期记忆(LSTM)集成在深度Q网络(DQN)架构中,能够基于局部观测做出自适应路由决策。该系统被构建为一个部分可观察马尔可夫决策过程(POMDP),以处理动态网络条件和流量变化。仿真结果表明,与现有方法相比,吞吐量、丢包率、队列长度和端到端延迟均有显著改善,队列长度减少高达23.26%。此外,该方法还因…

  14. RESEARCH · CL_08552 ·

    机器人研究利用神经信念实现不确定性下的鲁棒抓取

    研究人员开发了一种新的机器人鲁棒灵巧抓取方法,采用了变分神经信念参数化。该方法使用可微分的高斯混合模型来模拟接触参数和物体姿态中的不确定性,从而在不利条件下更有效地优化抓取成功率。仿真结果显示,与传统的粒子滤波方法相比,规划时间显著缩短,成功率有所提高;在机器人手臂上的实际测试也验证了其在不确定环境中的有效性。