研究人员开发了两个新框架VISTA和DiverseVAR,以解决文本到图像生成中视觉自回归(VAR)模型的局限性。VISTA基于Infinity构建,是首个用于VAR模型的基于梯度的测试时对齐方法,在2B骨干模型上将组合准确性提高了近20%,而无需更改模型参数。DiverseVAR通过将噪声注入文本嵌入并采用新颖的尺度-旅行细化技术来保持图像质量,专注于在测试时增强图像多样性。这两种方法都旨在在无需重新训练的情况下提高VAR模型的性能。 AI
影响 这些框架提供了在无需重新训练的情况下提高文本到图像生成模型组合准确性和多样性的方法。
排序理由 两篇研究论文介绍了用于改进视觉自回归模型的新框架。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →