Imperfect Information Games
PulseAugur coverage of Imperfect Information Games — every cluster mentioning Imperfect Information Games across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的分层深度反事实遗憾最小化算法增强了不完美信息博弈的学习能力
研究人员推出了一种名为分层深度反事实遗憾最小化(HDCFR)的新型算法,旨在提高在具有庞大状态空间的不完美信息博弈中的学习效率。该方法整合了基于技能的策略学习,能够开发分层策略,其中低层组件代表子博弈的技能,高层组件管理技能转换。HDCFR还允许纳入预定义的人类专业知识,并提取可迁移技能以用于类似任务。
-
新研究探索鲁棒、自适应和结构化强化学习技术 · 追踪 10 个来源
arXiv 上发表的多篇研究论文探讨了强化学习 (RL) 技术的进展。其中一篇论文统一了基于正则化的方法,以实现针对对抗性扰动的鲁棒深度强化学习,并提出了一种具有动态更新的拉格朗日乘子的约束优化方法。另一篇论文介绍了 CLAW,一种使用超网络生成低秩适配器来适应基于模型的强化学习中的世界模型的方法,在少样本学习场景中表现优于现有方法。此外,还介绍了用于长时限 LLM 代理的粒度自适应信用分配、用于具有局部对称性的强化学习的群代数状态表…
-
新算法解决复杂多人博弈中的纳什均衡问题 · 跟踪3 个来源
研究人员开发了一种名为“投影可利用性下降”(Projected Exploitability Descent, PED)的新算法,用于近似计算具有不完美信息的复杂多人博弈中的纳什均衡。该算法最小化了可利用性函数的一个代理目标,这是一个非凸且不光滑的目标。虽然 PED 在长时间运行中表现出持续的改进,但最初的性能不如已有的方法,如虚构博弈(Fictitious Play, FP)和反事实遗憾最小化(Counterfactual Regr…