研究人员推出了 DungeonBench,这是一个旨在评估在《龙与地下城》战斗等复杂游戏环境中战术推理能力的新基准。该基准考虑了广泛的游戏机制,包括几何、时机、资源管理和规则交互,这些在现有模拟器中常常被简化。DungeonBench 提供两个赛道:“遭遇战”(Encounter)用于单场战斗战术,以及“日”(Day)用于评估跨越多场遭遇战的长期资源管理和生存能力。初步评估显示,尽管前沿语言模型在单场遭遇战中表现良好,但它们在链接的、多遭遇战场景所需的战略规划方面存在困难。 AI
影响 该基准有望推动 AI 在执行复杂、基于规则的战术推理能力方面的进步,可能对游戏和其他战略领域中的 AI 代理产生影响。
排序理由 该项目是一篇介绍新 AI 评估基准的研究论文。
- alphaXiv
- CatalyzeX
- DagsHub
- Day
- DungeonBench
- Dungeons & Dragons
- Encounter
- Gotit.pub
- Hugging Face
- Ismayil Ismayilov
- ScienceCast
- System Reference Document
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →