Ippolito
PulseAugur coverage of Ippolito — every cluster mentioning Ippolito across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新分析揭示多智能体策略优化的最优聚合方法
一篇新的研究论文介绍了一种合作多智能体策略优化的规范形式分析,重点关注如何聚合来自邻近智能体的信息。该研究形式化了两个关键的设计选择,即支持矩阵 SA 和 SR,并证明它们的乘积决定了优化目标。研究结果表明,在优势(advantage)方面聚合邻近智能体有利于奖励信号,而保持每个智能体的比例(ratio)最优则有利于似然比(likelihood ratios),以避免方差的指数增长。
-
研究发现MARL基准测试可能不需要复杂的推理
一篇新发表在arXiv上的研究论文对当前合作式多智能体强化学习(MARL)基准测试的有效性提出了质疑。该研究引入了诊断工具来评估智能体是否真正采用了Dec-POMDP推理,这涉及到推断隐藏状态并基于局部信息进行协调。研究结果表明,许多流行的MARL基准测试并不需要这种复杂的推理,简单的反应式策略通常也能取得相当的性能。该研究认为,当前的训练范式可能导致对进展的评估过高,并呼吁在该领域进行更严格的环境设计和评估。
-
新的MARL框架提升网络安全响应安全性
研究人员开发了一种新颖的安全契约图多智能体强化学习(MARL)框架,命名为ACD$^3$-GAT,以提高自主网络安全响应系统的可部署性。与传统的仅基于奖励的MARL不同,该框架将运营预算与奖励分开,并纳入了约束优化和反事实动作筛选。在CAGE Challenge 4中的评估表明,无约束方法会持续违反停机时间预算,而提出的ACD$^3$-GAT和C-MAPPO-GAT方法显著降低了停机成本和违规率,显示出改进的运营纪律和安全性。