PulseAugur
中
实时 22:05:04
实体 Constrained Markov Decision Processes with Expected Total Reward Criteria

Constrained Markov Decision Processes with Expected Total Reward Criteria

PulseAugur coverage of Constrained Markov Decision Processes with Expected Total Reward Criteria — every cluster mentioning Constrained Markov Decision Processes with Expected Total Reward Criteria across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_221212 ·

    新的强化学习算法MO-IKE增强了大型语言模型的知识编辑能力

    研究人员开发了一种新的多目标强化学习算法,名为MO-IKE,以改进大型语言模型的上下文知识编辑。该方法将提示构建视为一个结构化实体,同时优化可靠性、泛化性和特异性等竞争性目标,从而解决了先前方法的局限性。MO-IKE训练一个动态检索器来构建更平衡、更连贯的提示,显著提高了Llama-3.2等模型上的编辑成功率和释义一致性。

  2. TOOL · CL_158537 ·

    AI框架通过基于风险的决策增强IT修复安全性

    研究人员开发了一个新的IT运维自动化修复框架,将其视为一个风险约束的干预决策问题。该方法利用约束马尔可夫决策过程(CMDPs)来最大化修复成功率,同时遵守有限的虚假修复率(FRR)。该系统包含一个三维风险分解(爆炸半径、可逆性、认知不确定性)以实现可解释的安全性,以及一个适应上下文的人机协作门控机制,该机制会根据值班负载和业务关键性进行调整。在微服务基准测试上的实验表明,FRR显著降低,修复成功率提高,同时值班升级负载也随之减少。

  3. TOOL · CL_141685 ·

    新的CMDP算法绕过Slater条件以提高性能

    研究人员为在线片段式约束马尔可夫决策过程(CMDPs)开发了一种新算法,该算法改进了现有方法。该算法处理随机和对抗性约束,而无需Slater条件,这是一个重大的进步,允许在不存在严格可行解的情况下进行设置。它在懊悔和约束违反保证方面取得了改进,甚至解决了正约束违反问题,并在对抗性场景中提供了相对于无约束最优值的次线性 alpha-懊悔。该算法的有效性已通过合成实验得到证明。