研究人员开发了一种在线拟合 Q-迭代新方法,用于连续动作零和马尔可夫博弈。该方法利用凸凹神经网络函数逼近器来确保极小极大问题的纯策略鞍点。该研究为具有连续状态和动作的非线性二次博弈建立了有限样本保证,标志着该领域的一项重大进展。 AI
影响 引入了一种解决复杂序贯决策问题的新颖方法,可能影响对抗学习和规划领域的 AI 研究。
排序理由 学术论文,详细介绍了新的算法方法和理论保证。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.MA (Multiagent) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →