研究人员开发了一种名为语义浏览的新方法,以增强文本到图像生成的图像多样性。该方法允许用户浏览结构化的图像库,基于有意义的语义决策而非随机机会来探索变体。通过利用视觉-语言模型和代理工作流,该系统在文本层面诱导多样性,从而实现对图像输出更可控和可解释的创意探索。 AI
影响 能够对图像生成输出进行更可控和可解释的探索。
排序理由 该集群描述了在arXiv上的学术论文中提出的一种新方法。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- Semantic Browsing
- vision-language model
- text-to-image models
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →