实体
Multi-Modal Diffusion Transformer
Multi-Modal Diffusion Transformer
PulseAugur coverage of Multi-Modal Diffusion Transformer — every cluster mentioning Multi-Modal Diffusion Transformer across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
UniLayDiff 使用扩散Transformer统一内容感知布局生成
研究人员推出了一种新颖的统一扩散Transformer模型UniLayDiff,用于内容感知布局生成。该模型旨在将各种布局生成任务,例如由元素类型、大小或关系条件化的任务,统一到一个单一的、可端到端训练的系统中。通过将布局约束视为多模态扩散Transformer框架中的一个独立模态,UniLayDiff 能够捕捉背景图像、布局元素和各种条件之间复杂的交互作用。该模型还通过LoRA微调整合了关系约束,在各种生成任务上取得了最先进的性能,…
-
AI利用文本和结构指导生成图示
研究人员开发了一个新的生成框架,旨在创建视觉上吸引人且信息丰富的图示。该系统使用多模态扩散Transformer,它同时接收用于语义意图的文本提示和用于结构指导的上下文图像。该框架包含结构和语义对齐机制,以确保生成的图示既美观又忠实于底层数据,其性能优于现有的可控生成和图像编辑方法。
-
新方法实现具有风格一致性的开放词汇场景文本编辑
研究人员开发了一种新颖的自提示方法,用于编辑图像中的场景文本,解决了现有方法忽略目标区域的视觉细节并受限于预训练字形编码器的局限性。这项新技术直接从图像构建风格和字形提示,利用多模态扩散 Transformer (MM-DiT) 的上下文学习能力。该方法实现了开放词汇和风格一致的文本编辑,在各种语言上展示了最先进的性能。