研究人员开发了ARC-Bench,一个旨在评估冻结潜在世界模型动作排序能力的新评估协议。研究发现,这些通过根据预测的未来嵌入对候选动作进行评分来进行规划的模型,常常无法正确排序动作。由于闭环重规划机制,这一缺陷在很大程度上未被发现,导致次优的动作选择,并夸大了潜在表征的真实性能。即使使用不同的视觉骨干网络,包括V-JEPA 1和V-JEPA 2,研究结果也保持一致。 AI
影响 揭示了当前世界建模方法的根本性局限性,可能影响更鲁棒的AI规划和控制系统的开发。
排序理由 该集群包含一篇学术论文,详细介绍了AI模型的新基准和评估方法。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →