研究人员开发了两种新颖的物体在图像组合中放置的方法。第一种方法“presto”利用多模态大语言模型(MLLM)来指导物体位置和尺度的启发式搜索,在开放世界场景中取得了最先进的成果,并与以度量驱动的方法相比,展示了卓越的感知连贯性。第二种方法提出了一种混合生成-判别模型,通过预测锚点的合理性分数并生成合理的放置集来平衡效率和有效性。这两种方法都旨在提高物体在各种场景中放置的空间和语义连贯性。 AI
影响 这些进展可以通过实现更自然、更连贯的物体放置来改进AI驱动的图像编辑和内容创作工具。
排序理由 arXiv上发表了两篇研究论文,详细介绍了图像组合中物体放置的新方法。
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Multimodal Large Language Model
- OPA dataset
- presto
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →