Overcooked
PulseAugur coverage of Overcooked — every cluster mentioning Overcooked across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的 ROTATE 框架增强了 AI 代理与未知伙伴的协作能力
研究人员开发了一个名为 ROTATE 的新框架,用于训练 AI 代理与不熟悉的伙伴协作,这是一个被称为临时团队合作 (AHT) 的挑战。与先前将队友生成和代理训练分开的方法不同,ROTATE 将这些过程统一到一个开放式学习循环中。该算法在改进 AHT 代理和生成暴露代理协作弱点的对抗性队友之间交替进行。在 Overcooked 和 Level-Based Foraging 任务上的实验表明,ROTATE 在泛化到未知队友方面显著优于现有方法。
-
《星露谷物语》新模组加入胡闹厨房式厨房和超市管理
《星露谷物语》的一款新模组允许玩家经营一家超市,并融入了类似《胡闹厨房》的游戏机制。该模组引入了一个“厨房”元素,玩家可以在其中准备食物,风格让人想起《胡闹厨房》。模组的开发值得注意,并提到AI生成对话可能是某些玩家的界限。
-
游戏新闻汇总:漫威电影、星露谷物语模组和斯普拉遁头目战
此集锦包含三条不同的游戏新闻。一条讨论了漫威决定在三年内只发布四部电影以优先考虑质量。另一条重点介绍了一个将《胡闹厨房》风格的商业管理游戏玩法融入《星露谷物语》的模组。第三条则关注《斯普拉遁 Raiders》的 Pudyin Den 被认为是任天堂最具挑战性的头目战之一。
-
研究发现MARL基准测试可能不需要复杂的推理
一篇新发表在arXiv上的研究论文对当前合作式多智能体强化学习(MARL)基准测试的有效性提出了质疑。该研究引入了诊断工具来评估智能体是否真正采用了Dec-POMDP推理,这涉及到推断隐藏状态并基于局部信息进行协调。研究结果表明,许多流行的MARL基准测试并不需要这种复杂的推理,简单的反应式策略通常也能取得相当的性能。该研究认为,当前的训练范式可能导致对进展的评估过高,并呼吁在该领域进行更严格的环境设计和评估。
-
新研究表明高熵导致Dec-POMDP中的对称等变策略
一篇新论文探讨了高熵正则化如何在分布式部分可观察马尔可夫决策过程(Dec-POMDPs)中产生对称等变策略。研究表明,足够高的熵可以确保策略梯度流在不同初始化下收敛到兼容的联合策略。在Hanabi和Overcooked等环境中的实证测试表明,增加熵系数会显著影响跨局回报,并且在训练后通过贪婪化策略有改进的潜力。
-
研究人员开发了具有不同奖励塑造的多智能体AI的零样本协调
研究人员开发了一种用于多智能体强化学习中零样本协调(ZSC)的新方法,使智能体即使在奖励信号被不同地塑造时也能与未知伙伴有效协作。该方法包括使用四种不同算法选择的随机奖励塑造来训练一组方法。在Overcooked环境中的实验显示出显著的改进,与基线ZSC算法相比,稀疏奖励增加了62.2%至119.2%。