研究人员开发了Robust Async-Fed-Q,这是一种新颖的联邦强化学习算法,旨在即使在某些智能体采取对抗性行为的情况下也能保持协作学习效率。这种基于epoch的方法结合了单个智能体处的方差缩减估计和中央服务器处的鲁棒聚合。该算法提供了理论保证,表明协作的好处在诚实智能体之间得以保留,对抗性智能体的影响随着诚实智能体数据的增加而减小,最终在无限样本极限下消失。该工作还建立了信息论下界,实现了对抗鲁棒联邦强化学习的近乎匹配的上界和下界。 AI
影响 这项研究可以提高协作式AI学习系统的鲁棒性和效率,尤其是在存在不可信参与者的情况下。
排序理由 这是一篇详细介绍联邦强化学习新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Bellman optimality operator
- Federated Q-learning
- Markov decision process
- reinforcement learning
- Robust Async-Fed-Q
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →