Akshay Balsubramani 的一篇题为“集中博弈:贝叶斯更新、后悔与信息”的新论文探讨了一个双人零和重复博弈。该博弈的价值恒等式旨在同时生成贝叶斯更新和指数权重后悔的精确计算。该研究引入了一个比较器类变分形式,该形式是各种集中现象的基础,其终端收益代表了比较器相对于具有固定相对熵的先验所能达到的最大收益。论文详细介绍了 Gibbs/Bayes 权重如何作为学习者的唯一 Bellman 均衡器出现,而对数分配函数则充当价值函数。 AI
排序理由 该集群包含一篇发表在 arXiv 上的学术论文。[lever_c_demoted from research: ic=1 ai=0.7]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →