实体
ARC-Bench
ARC-Bench
PulseAugur coverage of ARC-Bench — every cluster mentioning ARC-Bench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的ARC-Bench协议揭示了冻结JEPA世界模型的关键缺陷
研究人员开发了ARC-Bench,一个旨在评估冻结潜在世界模型动作排序能力的新评估协议。研究发现,这些通过根据预测的未来嵌入对候选动作进行评分来进行规划的模型,常常无法正确排序动作。由于闭环重规划机制,这一缺陷在很大程度上未被发现,导致次优的动作选择,并夸大了潜在表征的真实性能。即使使用不同的视觉骨干网络,包括V-JEPA 1和V-JEPA 2,研究结果也保持一致。
-
AutoResearchClaw系统增强自主科学发现
研究人员开发了AutoResearchClaw,这是一个新颖的多代理系统,旨在通过迭代过程和人机协作来增强自主科学发现。该系统包含代理之间的结构化辩论、从失败中学习的自我修复执行引擎以及可验证的结果报告,以防止不准确。在ARC-Bench基准测试中,AutoResearchClaw比现有系统提高了54.7%,突显了在关键决策点进行有针对性的人工干预的有效性。