研究人员开发了EyeControl,一种使用多模态大语言模型(MLLM)和基于扩散的修饰执行器来增强图像视觉焦点的新型代理。该系统允许用户通过最少的输入将注意力引导到特定区域,有效地实现图像的“点睛”。EyeControl通过将用户意图与目标编辑区域和色调调整联系起来,确保协调的全局和局部编辑以获得自然效果。配套的ControlArt-Bench数据集为视觉焦点增强提供了高质量的评估。 AI
影响 这项研究可能为专业人士和普通用户带来更直观、更有效的图像编辑工具。
排序理由 这是一篇详细介绍新AI模型和数据集的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- ControlArt-Bench
- diffusion-based retouching executor
- EyeControl
- Hugging Face
- multimodal large language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →