研究人员开发了RATTL(风险对抗总回报学习),一种在不断演变的不确定性下进行序贯决策的新方法。该方法将智能体的谨慎程度与其认知不确定性挂钩,使用贝叶斯后验来定义一个Wasserstein模糊集。随着智能体收集更多证据,其后验集中,其行为会从鲁棒的最坏情况规划平滑地过渡到风险中性回报最大化。该框架保证智能体的性能将保持在无信息鲁棒值和完全知识最优值之间,并且随着确定性的增加,差距会缩小。这种方法旨在增强在不确定环境中运行的智能体(包括基于大型语言模型的智能体)的运行时安全性。 AI
影响 通过动态调整谨慎级别,增强了在不确定性下运行的AI智能体(特别是LLM)的运行时安全性。
排序理由 学术论文,详细介绍了一种新的AI安全方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Conditional Value-at-Risk
- Entropic Value-at-Risk
- Large language models
- Sequential Decision Making
- Wasserstein ambiguity set
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →