Multimodal Diffusion Transformer
PulseAugur coverage of Multimodal Diffusion Transformer — every cluster mentioning Multimodal Diffusion Transformer across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的GenSyn10数据集对跨不同生成器的AI图像检测进行基准测试
研究人员推出了GenSyn10,一个旨在对AI生成图像的检测进行基准测试的新数据集。该数据集包含60,000张与CIFAR-10对齐的图像,这些图像使用三种不同的生成模型创建:FLUX.2-dev、HunyuanImage-3.0和Qwen Image 2512。GenSyn10旨在提高AI生成图像检测器在分布外泛化能力,因为当前模型经常难以处理它们未训练过的生成器。虽然在GenSyn10上微调的模型在已见过的生成器上能达到高精度,但…
-
新的AI系统DetailAnywhere可根据图像生成特定时尚细节
研究人员推出了一款名为DetailAnywhere的新系统,该系统旨在从产品图像中生成特定的时尚细节。该系统解决了创建如衣领或织物纹理等区域的逼真特写图像的挑战,同时保持服装的整体特征。DetailAnywhere采用了一种新颖的跨模态特征对齐蒸馏(CFAD)方法,利用DINOv3教师模型来对齐多模态扩散Transformer中的图像分支。此外,还采用了一致性奖励模型,通过强化学习优化生成质量,显著优于现有的开源方法。
-
AudioX-Turbo框架实现高效多模态音频生成
研究人员推出AudioX-Turbo,一个新颖的框架,旨在从文本、视频和音频信号等各种多模态输入高效生成音频。该系统采用师生蒸馏方法,将高保真教师模型AudioX-Base蒸馏成更快的学生模型AudioX-Turbo。此过程显著减少了生成所需的采样步数,使其比现有的多步基线效率高约25倍。为了支持该框架,还创建了一个名为IF-caps-Pro的大型数据集,包含约920万个样本。
-
UniSonate模型统一了语音、音乐和音效的生成
研究人员开发了UniSonate,一个新颖的统一框架,用于通过自然语言指令生成语音、音乐和音效。该模型通过协调结构化语义表示与非结构化声学纹理,解决了生成式音频的碎片化问题。UniSonate采用动态令牌注入机制和多模态扩散Transformer (MM-DiT),在文本到语音和文本到音乐任务中实现了精确的时长控制和最先进的结果,同时在文本到音频生成方面也表现出竞争力。