研究人员开发了一种新颖的学习算法,专为在具有不可逆动力学的环境中运行的智能体设计,在这些环境中错误无法撤销。该算法允许智能体向导师请求帮助,并在相似状态之间转移知识,从而实现安全运行和有效学习。所提出的方法即使在没有重置可能性的复杂、无界和高风险场景中,也能随着时间的推移实现亚线性遗憾和有限次数的导师查询。 AI
影响 使 AI 智能体能够在错误无法挽回的高风险环境中更安全地运行。
排序理由 该集群包含一篇在 arXiv 上发表的研究论文,详细介绍了一种新的安全学习算法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- arXivLabs
- Benjamin Plaut
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv Recommender
- Influence Flower
- Markov decision processes
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →