Diffusion Transformer
PulseAugur coverage of Diffusion Transformer — every cluster mentioning Diffusion Transformer across labs, papers, and developer communities, ranked by signal.
20 天有情绪数据
-
Swift-Image 模型推动紧凑型图像生成性能前沿
研究人员推出了 Swift-Image,这是一款紧凑且统一的文本到图像生成、单图像编辑和多图像编辑模型。该模型采用了高效的 6B 参数 Diffusion Transformer (DiT) 和渐进式训练流程,并通过并行专家强化学习和训练后多教师蒸馏得到增强。一个独立的 Prompt Enhancer 组件将用户请求转化为视觉规范,并且该模型已压缩至 3B 参数,性能损失极小。Swift-Image 在其参数类别和训练预算内的开源模型…
-
新的MeanFlow-Transfer方法加速生成模型训练
研究人员开发了一种名为MeanFlow-Transfer (MF-T)的新方法,用于在数据有限的新领域上加速生成模型的训练。该方法通过将不同的源模型输出映射到共享的速度表示中,实现了适应和加速的统一,从而能够优化各种预训练模型。此外,还引入了Continuous Adversarial MeanFlow (CAMF)作为一种训练后技术,通过将对抗性精炼扩展到有限区间平均速度,增强了对精细细节的恢复能力,提高了图像质量,并显著减少了所需…
-
4DAnyone 使用新颖的扩散技术从单个视频中重建4D人物
研究人员开发了4DAnyone,一个能够从单个、未校准的视频中重建三维人物模型的创新框架。该系统生成一致的多视图视频,然后将其转换为4D高斯溅射表示。为了解决众多视图之间扩展和保持一致性的挑战,4DAnyone采用了参考上下文打包来压缩参考视图,并采用目标上下文路由来促进去噪过程中不同视图组之间的信息交换。
-
FirstDiff 方法实现时间序列单步异常检测
研究人员推出了一种新颖的多变量时间序列单步异常检测方法 FirstDiff。与需要完成整个反向扩散过程的现有扩散方法不同,FirstDiff 利用初始预测噪声来推断异常。这显著降低了计算成本,同时保持了最先进的性能,并在五个公开基准数据集上得到了证明。
-
InstructVVT框架实现了指令驱动的视频虚拟试穿
研究人员开发了InstructVVT,一个用于视频虚拟试穿的新框架,它使用扩散Transformer和多模态大语言模型,在不依赖辅助空间先验的情况下实现精确的服装替换。这种方法可以直接从源视频、参考服装和指令输入中进行细粒度控制。与ViViD-S和TripVVT-Bench等基准上的现有方法相比,该系统在服装保真度、结构保持和时间一致性方面表现出卓越的性能。
-
MLLM 通过语义校正和视觉规划增强文本到视频生成
两篇新的研究论文探讨了通过整合多模态大语言模型(MLLM)和扩散模型来增强文本到视频生成。第一篇论文介绍了一个框架,该框架将 MLLM 反馈直接注入扩散采样循环中进行中间生成语义校正,在不改变模型参数的情况下提高对齐度和保真度。第二篇论文系统地研究了 MLLM 和扩散 Transformer(DiT)的融合,发现自回归生成且显式以 DiT 为条件的离散语义视觉标记比提示精炼更有效。这种称为 BiVidGen 的方法展示了改进的语义对齐…
-
RGBX-Next:扩散模型推动逼真生成式渲染
研究人员推出 RGBX-Next,一个专为正向和逆向渲染设计的新型生成式框架。该系统利用扩散 Transformer 模型,通过以传统渲染的 G-Buffer 为条件来实现逼真的图像和视频生成。该框架可以从现有视觉数据中估计 G-Buffer,并从这些 Buffer 中渲染新内容,在生成式渲染和内在分解任务中均展现出高质量。
-
VoiceDesigner框架实现多样化的文本到语音生成和编辑
研究人员推出VoiceDesigner,一个用于文本到语音生成和编辑的新框架,旨在解决当前系统的局限性。该系统旨在生成更多样化的声音,包括虚构角色,并提供增强的编辑功能,如语音克隆和属性修改。VoiceDesigner利用混合数据管道和具有架构改进的扩散Transformer,以实现更好的提示对齐和感知质量。
-
AI 生成跨多表的合成健康数据 · 跟踪 2 个来源
研究人员开发了一种新颖的两阶段跨表数据生成(CTDG)框架,旨在从多个异构表中创建合成健康数据集。第一阶段将各种原始表标准化为通用的统计格式,捕捉边际分布和成对相关性。第二阶段采用扩散 Transformer 模型学习这些标准化表之间的模式并生成新的合成表,然后将它们重构为真实的原始表。这种方法有效地解决了现有方法在处理多个不匹配输入表时遇到的局限性,能够以高保真度生成无限数量的合成异构数据集,并在保真度和多样性之间取得有利的权衡。
-
PixRestore:无VAE的像素扩散Transformer用于图像修复
研究人员开发了PixRestore,一种利用无VAE的像素空间扩散Transformer的新型图像修复模型。与以往适配文本到图像模型的方法不同,PixRestore在补丁化像素上从头开始训练,保留了细粒度的细节并避免了内容不一致的伪影。该模型通过预测DINO特征相似性的特征可靠性,融合可靠的层特征作为条件,并监督不太可靠的层以去除退化,从而适应各种退化。PixRestore通过约5000万个参数和单步推理展示了高效率,与现有模型相比,…
-
ClipProj v3.1 通过使用更小的文本编码器来减小模型尺寸
ClipProj 模型已更新至 3.1 版本,通过用更小的 4B 或 8B 版本替代大型 MiniMax H3 文本编码器,提供了改进的多语言语音生成能力。此次更新旨在保持高质量输出的同时,显著减小模型尺寸和计算需求。开发者正在寻求母语人士的反馈,以进一步提高所支持语言的发音准确性。
-
新的 GATO-Vid 方法为文本到视频生成提供无梯度的空间控制
研究人员开发了 GATO-Vid,一种新的文本到视频生成方法,可在没有基于梯度优化的计算成本的情况下提供精确的空间控制。该方法利用了一种新颖的、通过解析求解的交叉注意力分数,提供了一个封闭形式的解,该解被注入到 Transformer 的潜在空间中。实验表明,与现有方法相比,GATO-Vid 以最小的开销实现了卓越的定位精度。
-
MiniMax AI 发布开源音乐模型,并在视频编辑基准测试中名列前茅
MiniMax AI 发布了 Minimax Music 3,这是一个开源的音乐生成模型,采用了 8B LLM 和 2.7B Diffusion Transformer。该模型能够根据文本提示和歌词生成完整的歌曲,并通过 diffusers 和 Comfy 等库在消费级 GPU 上运行。此外,MiniMax AI 还宣布其 H3 模型 MiniMax-H3 在 Video Edit Arena 中取得了最高排名,获得 1390 分,超…
-
新的GATO-Vid方法可在文本到视频生成中实现精确的空间控制
研究人员开发了GATO-Vid,一种新的免训练文本到视频生成方法,可在不依赖计算成本高昂的基于梯度的优化的情况下实现精确的空间控制。该方法利用了从交叉注意力分数推导出的解析解,绕过了反向传播的需要。与现有方法相比,GATO-Vid在计算开销极小的情况下展示了卓越的定位精度。
-
Dyna Robotics发布Dyna-2世界动作模型,该模型基于100万小时人类视频训练
Dyna Robotics推出了Dyna-2,一个专为机器人操作任务设计的新型世界动作模型。该模型在超过一百万小时的人类以自我为中心的视频的广泛数据集上进行了预训练,旨在克服机器人学习中动作标记数据的瓶颈。Dyna-2展示了一种源自人类视频数据的新型扩展定律,该定律成功地迁移到了未见的机器人任务中,与前代Dyna-1相比,性能显著提高。
-
研究发现 AI 艺术检测器难以应对新的生成模型
一篇新发表在 arXiv 上的研究论文探讨了当前 AI 艺术检测模型在面对新的生成架构时的局限性。研究发现,在一种模型(如基于 U-Net 的潜在扩散模型)上训练的检测器,在评估由不同架构(如 Stable Diffusion 3.5 Medium)生成的图像时表现不佳。虽然 CLIP ViT-L/14 等模型表现最佳,但它们仍然存在显著的泛化差距,将许多 AI 生成的图像误判为人类创作。这项研究强调了开发更鲁棒、能够适应生成模型快速…
-
LiveAnimate 实现实时、稳定的长篇幅人体动画
研究人员开发了 LiveAnimate,一个能够实时生成稳定、长篇幅人体动画的新颖系统。该系统利用一个拥有140亿参数的视频扩散 Transformer,并通过 Reference-Anchored Teacher-Forcing Adaptation 和 Block-wise Self-Forcing Distillation 等专门的训练技术进行增强,以实现三步采样预算。为了在不增加计算负载的情况下保持长时间的视觉一致性,Live…
-
研究发现AI艺术检测器难以应对新的生成模型
Hugging Face的一项新研究调查了AI艺术检测器在面对不同模型生成的图像时的鲁棒性。研究人员发现,在一种架构(如基于U-Net的潜在扩散模型)上训练的检测器,在评估更新的架构(如Stable Diffusion 3.5 Medium)时表现不佳。这种“生成器迁移”会导致误分类,表明当前AI艺术检测方法存在泛化差距,并强调了对更具适应性的检测系统的需求。
-
NullEdit 通过隐蔽的无操作方法保护图像免受VLM操纵
研究人员开发了NullEdit,一种新颖的方法,用于保护图像免受视觉语言模型(VLM)的未经授权操纵。与现有会破坏图像或无法阻止编辑的防御措施不同,NullEdit旨在采用一种隐蔽的无操作方法。它重定向VLM的内部表示,确保输出保持自然,并在没有明显伪影的情况下保留原始内容和身份。在CelebA-HQ和VGGFace2数据集上使用Step1X-Edit和Qwen Image Edit进行了测试,NullEdit显著降低了EditRew…
-
新方法利用事件相机增强AI视频帧插值
研究人员开发了一个新颖的基于适配器的框架,将事件相机数据集成到预训练的图像到视频扩散模型中,以改进视频帧插值。该方法利用图像扭曲事件(IWEs)和双向稀疏光流来指导扩散过程,减少伪影并增强时间连贯性。该方法旨在利用事件相机的高时间分辨率运动线索,而无需对现有扩散模型进行完全重新训练,并在基准测试中表现出卓越的性能。