PulseAugur
中
实时 10:37:29
实体 dig.bench

dig.bench

PulseAugur coverage of dig.bench — every cluster mentioning dig.bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_207335 ·

    AI 代理在规则发现方面遇到困难;探索测试时训练的权衡

    发布了一个新的基准 dig.bench,用于评估 AI 代理通过实验发现未知游戏规则的能力,目前顶级模型在匹配人类表现方面遇到困难。另外,研究表明测试时训练允许 AI 模型在使用过程中进行适应,降低了内存需求但增加了计算需求。此外,对 Qwen3.8、Qwen3.6 和 Gemma 4 模型在 24GB GPU 上的比较突出了特定硬件限制下的性能。

  2. TOOL · CL_199967 ·

    新的DiG-bench基准测试AI在游戏中的知识发现能力

    研究人员推出了DiG-bench,这是一个新的基准测试,旨在评估AI在受控游戏环境中通过实验发现新知识的能力。该基准测试包含70个独立的、具有独特未知转换规则和获胜条件的关卡,分为七个难度等级。虽然最简单的关卡可以被多个模型解决,但最具挑战性的关卡则挑战了当前AI能力的极限。其中21个关卡的一个子集已公开,其余关卡将用于安全评估。