Command And Data Processing
PulseAugur coverage of Command And Data Processing — every cluster mentioning Command And Data Processing across labs, papers, and developer communities, ranked by signal.
-
新的RCI框架通过稀疏反馈增强安全离线强化学习
研究人员开发了一个名为基于重分配的成本推断(RCI)的新框架,以改进安全离线强化学习。该方法通过将轨迹级别的停止信号转换为密集的每步成本标注来解决稀疏反馈的挑战。RCI框架在理论上保留了最优策略集,同时在实践中增强了成本Critic的学习。在高速公路驾驶和机器人操作任务上的实验表明,与现有基线相比,RCI显著降低了违规率。
-
AI框架通过基于风险的决策增强IT修复安全性
研究人员开发了一个新的IT运维自动化修复框架,将其视为一个风险约束的干预决策问题。该方法利用约束马尔可夫决策过程(CMDPs)来最大化修复成功率,同时遵守有限的虚假修复率(FRR)。该系统包含一个三维风险分解(爆炸半径、可逆性、认知不确定性)以实现可解释的安全性,以及一个适应上下文的人机协作门控机制,该机制会根据值班负载和业务关键性进行调整。在微服务基准测试上的实验表明,FRR显著降低,修复成功率提高,同时值班升级负载也随之减少。
-
新的强化学习框架解决灾难性安全违规问题
研究人员推出了一种新的框架——鲁棒峰值成本约束强化学习(RP-CRL),该框架专为安全关键型应用设计,在这些应用中,单次成本违规可能导致灾难性后果。与现有方法不同,RP-CRL解决了峰值成本约束马尔可夫决策过程中可能存在的零对偶间隙缺失问题,并采用鲁棒公式来处理模拟与现实世界动力学之间的差异。所提出的解决方案利用了代理优化框架和积分概率度量来进行鲁棒价值估计,即使在动态扰动下也能有效执行安全策略并获得良好的奖励性能。
-
Dynamic-TD3算法通过障碍物轨迹预测增强无人机路径规划
研究人员开发了Dynamic-TD3,这是一种旨在改善无人机(UAV)在具有动态障碍物环境中路径规划的新型算法。该框架通过将导航建模为约束马尔可夫决策过程(CMDP)来解决深度强化学习中的安全探索困境。它结合了用于预测远程意图的自适应轨迹关系演化机制(ATREM)和用于处理传感器噪声的物理感知门控卡尔曼滤波器(PAG-KF),最终提高了避碰能力和效率。