PulseAugur
实时 10:03:47

新的RATTL框架增强了AI在不确定环境中的安全性

研究人员开发了RATTL(风险对抗总回报学习),一种在不断演变的不确定性下进行序贯决策的新方法。该方法将智能体的谨慎程度与其认知不确定性挂钩,使用贝叶斯后验来定义一个Wasserstein模糊集。随着智能体收集更多证据,其后验集中,其行为会从鲁棒的最坏情况规划平滑地过渡到风险中性回报最大化。该框架保证智能体的性能将保持在无信息鲁棒值和完全知识最优值之间,并且随着确定性的增加,差距会缩小。这种方法旨在增强在不确定环境中运行的智能体(包括基于大型语言模型的智能体)的运行时安全性。 AI

影响 通过动态调整谨慎级别,增强了在不确定性下运行的AI智能体(特别是LLM)的运行时安全性。

排序理由 学术论文,详细介绍了一种新的AI安全方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的RATTL框架增强了AI在不确定环境中的安全性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Deep Kumar Ganguly, Jan Kretinsky ·

    量化不断演变的风险下的不确定性:用于安全序贯决策的依赖信念的鲁棒性

    arXiv:2608.17574v1 Announce Type: new Abstract: How cautious should an agent be while it is still learning its environment? We propose RATTL (Risk-Adversarial Total-Reward Learning), which ties caution to epistemic uncertainty: the agent holds a Bayesian posterior over unknown dy…