研究人员推出了 Arena-T2I Hard,这是一个旨在评估文本到图像模型在复杂、多方面提示上的忠实度的新基准。该基准包含 310 个源自实际使用的提示,将请求分解为大约 30 个特定约束,解决了现有基准使用更简单指令的局限性。评估显示 11 个系统之间存在显著的性能差距,最强的闭源模型得分为 0.855,凸显了对更鲁棒的忠实度测试的需求。该论文还提出了一种依赖感知检查表奖励系统和一种组解耦归一化技术,以改进 SD3.5-Medium 和 FLUX.1-dev 等模型的忠实度和美学权衡。 AI
影响 该基准可能会推动文本到图像模型能力的改进,特别是在准确渲染复杂用户请求方面。
排序理由 该集群包含一篇研究论文,介绍了用于评估文本到图像模型的新基准和方法。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →