PulseAugur
实时 06:34:12

DungeonBench benchmark 测试 AI 在《龙与地下城》战斗中的战术推理能力

研究人员推出了 DungeonBench,这是一个旨在评估在《龙与地下城》战斗等复杂游戏环境中战术推理能力的新基准。该基准考虑了广泛的游戏机制,包括几何、时机、资源管理和规则交互,这些在现有模拟器中常常被简化。DungeonBench 提供两个赛道:“遭遇战”(Encounter)用于单场战斗战术,以及“日”(Day)用于评估跨越多场遭遇战的长期资源管理和生存能力。初步评估显示,尽管前沿语言模型在单场遭遇战中表现良好,但它们在链接的、多遭遇战场景所需的战略规划方面存在困难。 AI

影响 该基准有望推动 AI 在执行复杂、基于规则的战术推理能力方面的进步,可能对游戏和其他战略领域中的 AI 代理产生影响。

排序理由 该项目是一篇介绍新 AI 评估基准的研究论文。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

DungeonBench benchmark 测试 AI 在《龙与地下城》战斗中的战术推理能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Ismayil Ismayilov, Atakan Kara, Kaan Oktay ·

    DungeonBench:面向《龙与地下城》战斗中规则丰富战术推理的基准测试

    arXiv:2607.29577v1 Announce Type: new Abstract: Games and simulators make valuable benchmarks by turning decisions into measurable outcomes, but many current suites under-test rules-rich tactical reasoning: the ability to choose well when geometry, timing, resources, objectives, …