PulseAugur
实时 08:15:30
English(EN) InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion

InsertFuse框架通过新颖的蒸馏和条件化技术增强了多类别图像插入能力

研究人员推出了一种新颖的框架InsertFuse,用于多类别的参考引导图像插入。该系统通过训练专门的“专家”来解耦特定类别的学习与跨类别整合,然后使用Insertion On-Policy Distillation (IOPD) 将它们的能力合并到一个模型中。为了增强空间控制和参考保真度,InsertFuse集成了Token-Aligned Geometry Conditioning (TAGC) 和 Region-Balanced Flow Matching,以及Reference CFG以加强视觉引导。在AnyInsertion基准测试和一个新的多类别数据集上的实验表明,InsertFuse在生成质量和参考依从性方面达到了最先进的性能。 AI

影响 该框架有望提高AI生成图像的质量和控制力,特别是在需要精确参考引导插入的应用中。

排序理由 这是一篇详细介绍图像插入新框架和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

InsertFuse框架通过新颖的蒸馏和条件化技术增强了多类别图像插入能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Guangzhao Li, Qingyan Wei, Huayu Zheng, Yige Zheng, Chaoyang Zhang, Jie Yang, Yunan Ding, Yan Tai, Siqi Luo, Xiaohong Liu ·

    InsertFuse:一个统一的框架,用于多类别参考引导图像插入

    arXiv:2608.06490v1 Announce Type: new Abstract: We present InsertFuse, a unified framework for multi-category reference-guided image insertion. Its key idea is to decouple category-specific expertise learning from cross-category capability consolidation. InsertFuse first trains s…