研究人员推出了DiG-bench,这是一个新的基准测试,旨在评估AI在受控游戏环境中通过实验发现新知识的能力。该基准测试包含70个独立的、具有独特未知转换规则和获胜条件的关卡,分为七个难度等级。虽然最简单的关卡可以被多个模型解决,但最具挑战性的关卡则挑战了当前AI能力的极限。其中21个关卡的一个子集已公开,其余关卡将用于安全评估。 AI
影响 该基准测试有望推动AI在复杂未知环境中学习和泛化知识的能力的进步。
排序理由 该集群描述了一个新的AI研究学术基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- CORE Recommender
- DagsHub
- DiG-bench
- Gotit.pub
- Hugging Face
- Influence Flower
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →