PulseAugur
实时 00:19:14
实体 Multimodal Diffusion Transformer

Multimodal Diffusion Transformer

PulseAugur coverage of Multimodal Diffusion Transformer — every cluster mentioning Multimodal Diffusion Transformer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_208558 ·

    新框架SCENARIODIFF改进多模态时间序列预测

    研究人员推出SCENARIODIFF,一个旨在通过整合文本上下文来增强多模态时间序列预测的新型框架。这种分层方法将信息组织成不同的代理:历史上下文代理用于证据提取,场景代理用于定性描述,锚点引导代理用于事件相关锚点。这些信号条件化多模态扩散Transformer,而锚点混合采样允许在不重新训练的情况下进行局部轨迹细化。在Time-MMD基准上的实验表明,SCENARIODIFF在事件驱动领域特别有效,突显了显式场景引导的好处。

  2. TOOL · CL_213744 ·

    SCENARIODIFF框架通过场景引导增强多模态时间序列预测能力

    SCENARIODIFF是一个新框架,专为多模态时间序列预测而设计,在外部事件影响未来动态时尤其有效。它将来自文档的上下文信息构建为三个层次:历史证据提取、定性场景描述和稀疏锚点生成。该框架对多模态扩散Transformer进行条件化,并采用锚点混合采样(Anchor Blended Sampling)技术,无需重新训练即可进行局部轨迹优化。在Time-MMD基准上的实验表明,SCENARIODIFF在事件驱动领域表现出色,突显了显式…

  3. TOOL · CL_154143 ·

    新的GenSyn10数据集对跨不同生成器的AI图像检测进行基准测试

    研究人员推出了GenSyn10,一个旨在对AI生成图像的检测进行基准测试的新数据集。该数据集包含60,000张与CIFAR-10对齐的图像,这些图像使用三种不同的生成模型创建:FLUX.2-dev、HunyuanImage-3.0和Qwen Image 2512。GenSyn10旨在提高AI生成图像检测器在分布外泛化能力,因为当前模型经常难以处理它们未训练过的生成器。虽然在GenSyn10上微调的模型在已见过的生成器上能达到高精度,但…

  4. TOOL · CL_123325 ·

    新的AI系统DetailAnywhere可根据图像生成特定时尚细节

    研究人员推出了一款名为DetailAnywhere的新系统,该系统旨在从产品图像中生成特定的时尚细节。该系统解决了创建如衣领或织物纹理等区域的逼真特写图像的挑战,同时保持服装的整体特征。DetailAnywhere采用了一种新颖的跨模态特征对齐蒸馏(CFAD)方法,利用DINOv3教师模型来对齐多模态扩散Transformer中的图像分支。此外,还采用了一致性奖励模型,通过强化学习优化生成质量,显著优于现有的开源方法。

  5. TOOL · CL_86898 ·

    AudioX-Turbo框架实现高效多模态音频生成

    研究人员推出AudioX-Turbo,一个新颖的框架,旨在从文本、视频和音频信号等各种多模态输入高效生成音频。该系统采用师生蒸馏方法,将高保真教师模型AudioX-Base蒸馏成更快的学生模型AudioX-Turbo。此过程显著减少了生成所需的采样步数,使其比现有的多步基线效率高约25倍。为了支持该框架,还创建了一个名为IF-caps-Pro的大型数据集,包含约920万个样本。

  6. RESEARCH · CL_04991 ·

    UniSonate模型统一了语音、音乐和音效的生成

    研究人员开发了UniSonate,一个新颖的统一框架,用于通过自然语言指令生成语音、音乐和音效。该模型通过协调结构化语义表示与非结构化声学纹理,解决了生成式音频的碎片化问题。UniSonate采用动态令牌注入机制和多模态扩散Transformer (MM-DiT),在文本到语音和文本到音乐任务中实现了精确的时长控制和最先进的结果,同时在文本到音频生成方面也表现出竞争力。