研究人员开发了GAGR-Lab,一个旨在评估模型执行联合空间-几何与解析函数推理能力的新框架。该框架使用笛卡尔游戏场景和Rust轨迹执行来测试这种推理的各个方面,包括空间感知、度量基础和函数构建。一项使用Llama 3.2 11B Vision Instruct进行的初步研究显示,在命中目标或输出评分方面均未取得成功,表明在此类复杂推理任务中存在重大挑战。 AI
影响 引入了一个评估复杂AI推理能力的新颖框架,突显了Llama 3.2 11B Vision Instruct等模型当前的局限性。
排序理由 介绍AI推理能力新评估框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →