一项名为 SciReC 的新基准已被开发出来,用于评估多模态大语言模型 (MLLMs) 的关系推理能力。该基准利用基于缺陷的诊断框架 (DMRA) 来量化视觉理解、知识展示和记忆回忆的贡献,以识别错误来源。在评估中,Claude-4.6 在整体关系分数上优于 GPT-5.4,得分为 73%,而 GPT-5.4 为 68%。研究还发现,模型在天文学相关任务上的表现最差,并且关系推理是所有测试模型出错的主要原因。 AI
影响 为多模态 LLM 建立了新的评估标准,突出了关系推理和领域性能方面的具体弱点。
排序理由 该集群包含一篇介绍 LLM 新评估基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →