实体
Multi-Modal Diffusion Transformer
Multi-Modal Diffusion Transformer
PulseAugur coverage of Multi-Modal Diffusion Transformer — every cluster mentioning Multi-Modal Diffusion Transformer across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI利用文本和结构指导生成图示
研究人员开发了一个新的生成框架,旨在创建视觉上吸引人且信息丰富的图示。该系统使用多模态扩散Transformer,它同时接收用于语义意图的文本提示和用于结构指导的上下文图像。该框架包含结构和语义对齐机制,以确保生成的图示既美观又忠实于底层数据,其性能优于现有的可控生成和图像编辑方法。
-
新方法实现具有风格一致性的开放词汇场景文本编辑
研究人员开发了一种新颖的自提示方法,用于编辑图像中的场景文本,解决了现有方法忽略目标区域的视觉细节并受限于预训练字形编码器的局限性。这项新技术直接从图像构建风格和字形提示,利用多模态扩散 Transformer (MM-DiT) 的上下文学习能力。该方法实现了开放词汇和风格一致的文本编辑,在各种语言上展示了最先进的性能。