研究人员推出了GRADE,一个旨在评估多模态AI模型在图像编辑任务中基于学科的推理能力的新基准测试。该基准测试包含10个学术领域的520个样本,并采用多维度评估协议,评估学科推理、视觉一致性和逻辑可读性。对20个最先进模型的实验显示,当前AI在处理知识密集型编辑场景方面存在显著局限性,突显了统一多模态模型未来发展的关键领域。 AI
影响 强调了当前AI模型在专业推理任务中的局限性,指导了多模态AI的未来发展。
排序理由 该集群描述了在arXiv上发布的新学术基准测试及相关论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →