研究人员推出了 ScribbleEdit,这是一个旨在评估视觉语言模型 (VLM) 和大型语言模型 (LLM) 在仅基于用户涂鸦执行图像编辑任务方面的能力的新基准。当前模型在此类输入方面存在困难,通常无法准确解释用户意图和仅凭涂鸦获得的空间信息。ScribbleEdit 基准包含一个自动数据构建管道和一个特定的评估协议,用于衡量意图对齐,揭示了现有基于 VLM/LLM 的编辑模型存在的显著缺陷。为了解决这些局限性,研究人员提出了一种软标记基线,该基线可改善语义理解,并在基准测试中优于标准模型。 AI
影响 该基准可能会通过将 VLM/LLM 开发重点放在理解来自稀疏、直观输入的用户意图,从而推动交互式图像编辑工具的改进。
排序理由 该集群描述了一个新的基准和一个针对特定人工智能研究问题的基线提案,已在 arXiv 上发布。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →