Diffusion Transformers
PulseAugur coverage of Diffusion Transformers — every cluster mentioning Diffusion Transformers across labs, papers, and developer communities, ranked by signal.
12 天有情绪数据
-
新方法为模拟内存计算硬件重新校准扩散Transformer
研究人员开发了一种新颖的方法,用于在与模拟内存计算(CIM)硬件一起使用时重新校准扩散Transformer(DiTs)。该方法解决了CIM固有的非理想性如何扭曲分类器自由指导(CFG)信号的问题,而CFG信号对于生成高质量图像至关重要。通过仅在采样过程中调整CFG尺度,该方法有效地恢复了生成质量,显著缩小了由CIM噪声在PixArt-Sigma、PixArt-alpha和DiT-XL/2等各种模型中引起的FID分数差距。
-
新的SEFS框架使扩散模型风格化无需辅助编码器
研究人员为扩散模型开发了一个名为SEFS(Style-Encoder-Free Stylization,无风格编码器风格化)的新框架,该框架允许在不需要对齐的内容-风格-目标三元组或辅助视觉编码器的情况下进行风格迁移。SEFS从单个训练图像的低分辨率裁剪中生成风格令牌,保留局部外观统计信息,同时最大限度地减少不期望的场景结构的迁移。该框架还为目标内容纳入了边缘和分割线索,并使用风格到去噪的重新归一化技术进行令牌对齐,并计划公开提供代码。
-
新AI框架隐式生成平面设计布局
研究人员开发了一个名为 Mise-en-Scène 的新框架,该框架使用扩散 Transformer 来隐式生成平面设计布局。这种方法将布局规划与视觉合成相结合,使元素排列与渲染的画布一起出现,这与预测显式边界框的传统方法不同。然后,该框架使用确定性的匹配和放置步骤,以确保原始资产被精确地整合到草拟的位置,从而产生可编辑的分层设计。在 PrismLayersPlus 基准测试上的评估表明,Mise-en-Scène 在感知的设计质…
-
新的AViTS框架提高了Diffusion Transformer在图像生成方面的效率
研究人员开发了AViTS,一个旨在提高用于图像生成的Diffusion Transformers (DiTs) 效率的新框架。该方法自适应地选择时空令牌,优先处理分辨率细化所需的关键令牌,而推迟处理不太重要的令牌。AViTS旨在减少冗余计算,并提高DiTs动态分辨率采样中的质量-效率权衡。该框架已在FLUX上实现了高达6.34倍的FLOPs减少,在Qwen Image Edit和FLUX.1-Kontext-dev上实现了近9倍的FL…
-
新方法通过新颖的特征缓存策略加速扩散模型 · 已追踪2个来源
两篇新的研究论文提出了加速扩散模型的新颖方法,扩散模型在图像和视频生成方面计算量很大。第一篇论文《重新思考逐令牌特征缓存》(Rethinking Token-wise Feature Caching)介绍了DuCa,一种双重特征缓存策略,通过随机令牌选择迭代地应用激进和保守的缓存,挑战了“重要”令牌总是需要计算的观念。第二篇论文《LinCa: 通过可学习分解特征缓存加速扩散模型》(LinCa: Accelerating Diffusi…
-
MLLM 通过语义校正和视觉规划增强文本到视频生成
两篇新的研究论文探讨了通过整合多模态大语言模型(MLLM)和扩散模型来增强文本到视频生成。第一篇论文介绍了一个框架,该框架将 MLLM 反馈直接注入扩散采样循环中进行中间生成语义校正,在不改变模型参数的情况下提高对齐度和保真度。第二篇论文系统地研究了 MLLM 和扩散 Transformer(DiT)的融合,发现自回归生成且显式以 DiT 为条件的离散语义视觉标记比提示精炼更有效。这种称为 BiVidGen 的方法展示了改进的语义对齐…
-
SCOPE框架提升扩散Transformer在视频注意力方面的效率
研究人员开发了SCOPE,一个新颖的无需训练的稀疏注意力框架,旨在提高扩散Transformer(DiTs)在视频处理中的效率。SCOPE通过采用子空间聚类和在线每头Top-K估计方法来解决自注意力的二次成本问题。这种方法允许更具适应性和细粒度的注意力键选择,在保真度和延迟方面均优于现有方法。在测试中,SCOPE在HunyuanVideo数据集上实现了高达1.99倍的速度提升。
-
新的BAG策略通过自适应缓存加速Diffusion Transformer
研究人员开发了BAG(Budget-Aware Gating),一种旨在加速Diffusion Transformer(DiTs)的新型缓存策略。与之前缺乏预算感知或实例适应性的方法不同,BAG使用轻量级门控网络动态决定是重用缓存的特征还是执行完整计算。该方法通过离线到在线调度蒸馏进行训练,在FLUX.1-dev和Wan2.1数据集上,在各种加速级别和分辨率下,始终优于现有的缓存技术。
-
MAVISEG 增强了扩散 Transformer 中的零样本分割能力
研究人员开发了 MAVISEG,这是一种新颖的无训练细化层,旨在增强扩散 Transformer 中的零样本开放词汇分割能力。与独立评估像素的现有方法不同,MAVISEG 利用了扩散过程中的结构化信号,例如时间动态和视觉统计。这种方法与捕捉无关,并在六个基准测试中展示了卓越的性能,在所有基准测试中都实现了最佳的平均交并比 (mIoU)。研究结果表明,扩散 Transformer 包含比当前提取的更多的概念信息,而 MAVISEG 成功…
-
Flash-VAED 框架将视频生成速度提高 6 倍
研究人员开发了 Flash-VAED,这是一个旨在加速用于视频生成的潜在扩散模型中的 VAE 解码器的框架。该方法采用通道剪枝和主导算子优化来降低推理成本,在保持高达 96.9% 的重建性能的同时,实现了约 6 倍的 VAE 解码速度提升。当集成到端到端生成管线中时,Flash-VAED 可将过程加速高达 36%,而对质量的影响极小,这在 VBench 2.0 等基准测试中得到了证明。
-
新方法可检测视频扩散模型中的物理学合理性
研究人员开发了一种通过分析中间去噪表示来识别视频扩散模型中物理学合理性的方法。他们发现,即使在高噪声水平下,这些模型也能编码出预测物理准确性的信号。该信号可以被提炼成一个轻量级的物理学验证器,然后用于改进推理时机制,如渐进轨迹选择和奖励梯度引导。在各种视频扩散模型上的实验表明,这些技术可以在不微调生成器的情况下提高物理一致性并减少推理时间。
-
AdaCorrection 框架提升扩散 Transformer 的图像生成效率
研究人员开发了 AdaCorrection,一个旨在提高用于图像和视频生成的扩散 Transformer (DiTs) 效率的新框架。DiTs 以其高质量的输出而闻名,但由于其迭代性质,计算成本很高。AdaCorrection 通过自适应地校正缓存的中间特征来解决这个问题,防止时间漂移并保持生成质量,同时实现更快的推理。该方法以最小的开销实现了可比的生成性能,提供了适度的加速。
-
新研究探讨了扩散模型缩减尺寸图像训练中的梯度准确性
研究人员调查了在缩减尺寸图像上训练扩散 Transformer 对梯度信号的影响。他们发现,虽然缩减尺寸的潜在表示可以在高噪声水平下保留大部分的剩余信号,但训练梯度信号受到与噪声相关的项和与目标网格标记数量相关的地板项的影响。这种分析有助于识别在训练过程中保持梯度准确性的特定噪声窗口和缩减尺寸路径,从而使 LoRA 适配器的训练时间减少 14.6%。
-
新的UDT架构融合了U-Net与Diffusion Transformer
研究人员推出UDT,一种融合了U-Net和Diffusion Transformer(DiTs)优势的新型生成模型架构。UDT采用数据自适应Token合并技术,在保持Transformer的Token维度的同时,调和了U-Net的编码器-解码器结构与DiTs的表示能力。该方法在图像生成任务上实现了更快的收敛速度和更优的性能,优于现有的U-Net DiTs,并取得了与其他先进方法相当的结果。
-
新的DiverseDiT++框架增强了扩散Transformer的表示学习
研究人员开发了DiverseDiT++,一个旨在通过促进其内部表示的多样性来增强扩散Transformer(DiTs)性能的新框架。该研究引入了一种新颖的度量标准,即加权多样性得分(WDS),它量化了DiTs内部不同块之间的表示差异。该得分与合成质量高度相关,表明其可用作性能指标和优化指南。DiverseDiT++采用特定技术来鼓励各块学习不同的特征,从而提高性能并加快收敛速度。
-
新的ROAD框架大幅削减3D生成训练成本
研究人员推出了一种新颖的ROAD框架,旨在显著降低高保真3D形状生成相关的计算成本。通过利用现有的判别式3D基础模型的语义和结构理解,ROAD将这些先验知识迁移到扩散Transformer中。该框架采用一种互惠目标对齐策略,结合了整体语义浓缩(Holistic Semantic Condensing)以实现全局一致性,以及结构最优对齐(Structural Optimal Alignment)以实现详细的几何匹配。这种方法使得仅使用基…
-
新的MIND网络使用扩散变换器增强医疗图像融合
研究人员开发了MIND,一种新颖的多模态意图驱动网络,它利用扩散变换器进行医疗图像融合。该网络通过首先使用BioMedGPT从源图像生成诊断意图文本来整合来自各种成像模态的信息。为了保持空间连续性和语义一致性,MIND采用了多尺度潜在适配器和医疗语义一致性损失。在包括Harvard、BraTS和GFP在内的数据集上的实验表明,MIND提高了融合质量,改进了下游脑肿瘤分割,并支持用于临床决策支持的交互式融合。
-
新方法提升扩散 Transformer 的效率和性能 · 跟踪 4 个来源
研究人员开发了新方法来提高扩散 Transformer 的效率和性能,这是 AI 图像和视频生成的一个关键架构。Chimera,一种混合视觉扩散骨干网络,结合了不同的注意力机制和一种新颖的缩放方法,与传统模型相比,实现了显著的计算效率提升。此外,MMOE 通过借鉴大型语言模型的高效专家设计,实现了扩散 Transformer 的现代化,从而加快了收敛速度并改善了质量-成本平衡。Calibri 提供了一种参数高效的扩散 Transfor…
-
MegaSlide-DiT 使单 GPU 能够适配大型视频扩散模型
研究人员开发了 MegaSlide-DiT,这是一个能够在一块高端 GPU 上适配大型视频扩散模型的系统。这是通过将模型权重和优化器状态保留在主机 RAM 中,并将仅必要的碎片流式传输到 GPU 来实现的。此外,该系统用线性复杂度的 3D 可变形滑动注意力(3D-DSA)算子取代了计算成本高昂的二次注意力,该算子能够自适应运动。
-
Sol-Attn 通过高效的稀疏注意力加速视频生成
研究人员开发了 Sol-Attn,一种新的无需训练的稀疏注意力方法,旨在加速视频生成模型的推理。与以往因僵化的路由或丢弃信息而难以兼顾效率和准确性的方法不同,Sol-Attn 在单次通过中统一了动态路由、稀疏计算和近似校正。这种方法允许动态但可控的块预算,而无需物化代理分数,并且它会重用未选定块的分数来近似其贡献。实验表明,Sol-Attn 在视频生成方面实现了高达 2.1 倍的速度提升,在视频编辑方面实现了 2.3 倍的速度提升,同…