PulseAugur
中
实时 05:49:46
实体 Markov decision process

Markov decision process

PulseAugur coverage of Markov decision process — every cluster mentioning Markov decision process across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
98
90 天内 98
发布 · 30天
0
90 天内 0
论文 · 30天
98
90 天内 98
层级分布 · 90 天
主题
关系
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/6 页 · 共 108 条
  1. TOOL · CL_286999 ·

    新分析为 PPO-Clip 调优提供理论指导

    研究人员开发了一种新的近端策略优化(PPO)与剪辑(PPO-Clip)的非渐近收敛性分析,将其视为一个闭环演员-评论家系统。该分析考虑了评论家学习、剪辑和回放重用等因素,为策略平稳性和评论家跟踪准确性提供了理论保证。研究结果为 PPO-Clip 的调优提供了指导,并建议在某些配置下具有多项式样本复杂度。

  2. TOOL · CL_284586 ·

    新算法解决了联邦强化学习中的对抗性智能体问题

    研究人员开发了Robust Async-Fed-Q,这是一种新颖的联邦强化学习算法,旨在即使在某些智能体采取对抗性行为的情况下也能保持协作学习效率。这种基于epoch的方法结合了单个智能体处的方差缩减估计和中央服务器处的鲁棒聚合。该算法提供了理论保证,表明协作的好处在诚实智能体之间得以保留,对抗性智能体的影响随着诚实智能体数据的增加而减小,最终在无限样本极限下消失。该工作还建立了信息论下界,实现了对抗鲁棒联邦强化学习的近乎匹配的上界和下界。

  3. TOOL · CL_284306 ·

    新的DHCG框架通过动态协作图增强LLM多智能体推理能力

    研究人员推出了一种新颖的DHCG框架,用于在LLM驱动的多智能体系统中构建动态分层协作图。该方法通过实现动态组合、减少错位依赖并提供灵活的可扩展性,解决了现有方法的局限性。DHCG协调规划器(Planner)、工作者(Worker)和生成器(Generator)模块,根据查询和执行反馈构建协作图,在代码生成、数学推理和领域特定任务中取得了最先进的性能。

  4. RESEARCH · CL_284665 ·

    新的DFL方法通过占用测度方法解决了MDP的可扩展性问题

    研究人员开发了一种新的决策导向学习(DFL)方法,用于马尔可夫决策过程(MDP),该方法解决了现有方法在可扩展性方面的局限性。通过将MDP重新表述为基于占用测度的线性规划(LP),该新技术推导出了闭式梯度,并克服了与不连续梯度和状态大小扩展相关的挑战。该方法采用增强拉格朗日代理和随机行草图,以及软状态聚合层,以有效地处理大型和连续状态空间。实验结果表明,与先前的基于KKT的DFL和两阶段基线相比,该方法实现了更低的遗憾和显著降低的计算成本。

  5. RESEARCH · CL_284309 ·

    新型AI助手ShanLiangRen提供个性化每日膳食规划

    研究人员开发了ShanLiangRen,这是一种新颖的营养助手,旨在实现个性化每日膳食规划。该系统通过采用检索增强生成方法和帕累托最优原则指导的精炼方法,解决了用户特定约束与一般营养目标之间的冲突。该助手将用户需求转化为规划实例,使用LLM迭代修改候选膳食计划,并输出包含明确成分和份量以及合规性报告的详细膳食计划。

  6. TOOL · CL_282901 ·

    新方法使用语法和强化学习生成受约束的平面图

    研究人员开发了一种生成平面图的新方法,平面图在各种科学和工程领域至关重要。这种新方法结合了参数化图语法和安全强化学习,以实现目标导向的生成能力。与提供有限控制或依赖弱约束满足的现有方法不同,该技术在生成过程中直接构建可行的平面图嵌入。该方法在一个新的受约束平面图生成基准套件上与经典和深度生成基线进行了测试,在遵守指定约束的同时,始终优于它们。

  7. TOOL · CL_280403 ·

    防御性策略梯度算法提高了强化学习的样本复杂度

    一种名为防御性策略梯度(DPG)的新算法已被开发出来,它改进了现有的强化学习方差缩减策略梯度方法。与先前需要对方差做出不切实际假设的方法不同,DPG 在没有这些限制的情况下实现了 O(ε−3) 的改进样本复杂度。该研究还为策略优化建立了理论下界,表明 DPG 的更快收敛速度是最优的。

  8. TOOL · CL_277199 ·

    新的 Bellman-Certified Rounding 方法改进了 MDP 中的稀疏策略部署

    研究人员开发了一种名为 Bellman-Certified Rounding 的新方法,以应对在马尔可夫决策过程 (MDP) 中部署稀疏策略的挑战。该技术旨在允许仅进行少量状态级更改的连续策略更新被舍入时,保留相当一部分的折扣回报。该方法从 Bellman 求解中导出可重用的包络,在舍入之前提供统一和候选特定的保证,将结构化套件上的认证覆盖率从 48.2% 提高到 74.1%。此外,它利用秩二有理表示进行加权曲率积分,显著降低了中值界限损失比。

  9. TOOL · CL_275063 ·

    新的Q学习算法为MDP提供无模型可达性

    研究人员开发了Quasar,一种新颖的无模型算法,它使用Q学习在没有非终端最大结束组件(MECs)的马尔可夫决策过程(MDPs)中实现可达性规范的渐近收敛。这种方法消除了对显式估计转移概率的需求,而这是先前基于模型的方法的要求。与现有的最先进的基于模型的技术相比,Quasar显著减小了内存占用,并在定量验证基准集上展示了更快的收敛速度,标志着在规范引导强化学习方面迈出了实用性的一步。

  10. RESEARCH · CL_268010 ·

    新研究优化LLM智能体工作流的成本和效率

    多篇研究论文正在探索优化大型语言模型(LLM)中多智能体工作流的方法,通过根据成本和能力智能地将任务路由到不同的模型层级。InFlowOp和MoFlow分别专注于无标签的成本优化和多目标生成。Planner-as-Router (PaR)和AgentRouter通过将模型选择直接集成到规划过程中来解决这个问题,目标是与仅使用前沿模型相比,显著降低成本。这些方法有望通过动态匹配任务复杂性与适当的模型层级,使LLM智能体系统更高效、更具成本效益。

  11. TOOL · CL_254434 ·

    新的AI控制框架允许将授权委托给未对齐的代理

    研究人员开发了一个新的AI代理控制框架,特别适用于那些需要长时间运行的代理。该方法被称为“k-鲁棒联盟对齐”,允许将授权委托给其他AI代理,即使这些代理与人类目标不完全对齐。该方法通过确保主代理的表现达到或超过基线来保证安全,前提是审查小组满足某些条件。实验表明,即使容忍一些否决,集体审查也能在不要求个体代理对齐的情况下保持安全。

  12. TOOL · CL_245453 ·

    AI框架在保持服务水平的同时降低5G能耗

    研究人员开发了一个新的由AI驱动的5G网络节能框架,该框架可确保服务水平协议(SLA)得到维持。该系统使用一种稳定性感知的约束强化学习方法,特别是约束近端策略优化(PPO),来动态管理无线资源和基站功率模式。在七个小区的环境中进行的模拟显示,在名义流量下,能耗显著降低了高达41.4%,同时在压力和未知流量条件下也保持了零SLA违规和吞吐量损失。

  13. TOOL · CL_235632 ·

    新算法为马尔可夫决策过程提供高效解决方案

    研究人员开发了一种新颖的算法,用于高效解决利用函数逼近的马尔可夫决策过程(MDP)问题。该新方法基于线性规划重构,并随着更多转移样本的可用而迭代地求解一个简化的线性系统。该算法实现了实例相关的目标差距和约束残差,理论保证为 $O(1/\sqrt{N})$,且与某些问题参数无关。

  14. TOOL · CL_233492 ·

    新的基准测试Sim2Signal解决了交通信号控制中的仿真到真实差距问题

    研究人员推出了Sim2Signal,这是一个新的基准测试,旨在系统地衡量和评估在交通信号控制中使用强化学习来弥合“仿真到真实差距”的方法。这种差距是指在模拟中训练的策略在现实世界部署中失败的现象,该差距被分解为观察、动作、转移和奖励组件,每个组件都单独诱导。在33个差距设置和10个校准网络上的实验表明,直接迁移会持续降低性能,并且缓解效果高度依赖于特定的网络和差距类型。研究发现,估计差距变化的方法通常比域随机化技术更有效。

  15. TOOL · CL_231252 ·

    新的DTMDP模型解决随机需求时序批量定货问题

    研究人员开发了一个离散时间马尔可夫决策过程(DTMDP)模型,以解决具有随机需求时序的多品项产能约束批量定货问题。该模型考虑了产能竞争和特定需求延迟等因素。与确定性模型相比,DTMDP模型显著增加了计算需求。为了应对这些复杂性,提出了一种遗传算法(GA),该算法在基准实例上表现出色,平均最优性差距为3.44%,平均优化速度提升了6.89。

  16. TOOL · CL_229360 ·

    新的 A-MADiff 算法优化移动网络中的 AI 生成内容交付

    研究人员开发了 A-MADiff,这是一种新颖的多智能体强化学习算法,旨在优化托管人工智能生成内容 (AIGC) 服务的移动网络中的任务编排。该框架通过采用一种去中心化方法来解决边缘服务器 GPU 内存耗尽的关键问题,在该方法中,每个节点将任务调度到本地或邻近服务器。A-MADiff 利用基于扩散的去中心化 Actor 和注意力引导的中心化 Critic 来管理 GPU 内存异构性并提高整体奖励。

  17. TOOL · CL_225620 ·

    大型语言模型AI代理绕过复杂的概率计算,尽管存在理论框架

    用作AI代理的大型语言模型(LLM)本身不计算概率,尽管像部分可观察马尔可夫决策过程(POMDP)这样的理论框架表明它们应该这样做。虽然POMDPs为不完全信息下的决策提供了数学模型,并使用贝叶斯定理根据新观察更新信念,但基于LLM的代理通常不执行这些复杂的计算。精确求解POMDPs的计算成本使其不适用于实际应用,导致LLM代理依赖于不同、不太严谨的决策方法。

  18. TOOL · CL_218141 ·

    新的分层强化学习框架增强了对话代理

    研究人员开发了一种名为ToSCA的新型两级分层强化学习(RL)框架,用于对话代理。该方法通过结合时间和策略抽象,弥合了现有token级或utterance级RL方法之间的差距。该框架使用深度Q网络(DQN)作为高级critic,并使用近端策略优化(PPO)作为低级actor-critic,通过双粒度奖励机制解决奖励稀疏性问题。实验表明,与现有基线相比,ToSCA在日常对话和情感支持对话中都提高了策略确定性和响应质量。

  19. TOOL · CL_218115 ·

    iScheduler 使用强化学习优化大规模资源分配

    研究人员开发了 iScheduler,一个使用强化学习优化大规模计算任务资源分配的新框架。该方法将资源投资问题(RIP)建模为马尔可夫决策过程,与传统方法相比,能够实现更快的调度和重新配置。发布了一个新的基准 L-RIPLIB,其中包含工业规模的云平台工作负载,用于评估 iScheduler。iScheduler 在速度方面表现出显著的改进,同时保持了具有竞争力的资源成本。

  20. RESEARCH · CL_212098 ·

    新分析探讨自然Actor-Critic算法的加速收敛

    研究人员分析了一种单循环、熵正则化的自然Actor-Critic算法,重点关注其在非正则化目标上的收敛速度。该研究探讨了两种优化机制:随机优化,使用联合Lyapunov递推;以及确定性优化,采用策略镜像下降。通过引入指数平移机制并利用正的最小作用间隙,该算法实现了加速收敛速度,在特定情况下优于现有方法。