研究人员推出了MIEScore,这是一种旨在评估多源图像编辑(MIE)能力的新评估模型,这对于高级图像处理任务至关重要。现有基准在评估MIE方面常常不足,因此创建了MIE-Bench,这是一个包含16个任务的3000个编辑实例的大型数据集。该基准包含超过108,000个视觉质量、指令遵循和属性保持的人工评分。MIEScore是一个多模态大型语言模型,在与MIE任务的人类偏好保持一致方面表现出最先进的性能。 AI
影响 这项工作为评估高级图像编辑模型提供了一个更强大的框架,有可能加速多模态AI能力的进步。
排序理由 该集群描述了一篇介绍特定AI任务新评估方法和基准数据集的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →