PulseAugur
中
实时 06:52:58
实体 Diffusion Transformers

Diffusion Transformers

PulseAugur coverage of Diffusion Transformers — every cluster mentioning Diffusion Transformers across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
89
90 天内 89
发布 · 30天
0
90 天内 0
论文 · 30天
86
90 天内 86
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-20 research_milestone A new method, Diffusion-Adaptive Routing (DAR), was proposed to improve information flow in Diffusion Transformers. 来源
  2. 2026-05-20 research_milestone A new paper proposes Diffusion-Adaptive Routing (DAR) to improve Diffusion Transformer performance. 来源
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/5 页 · 共 90 条
  1. TOOL · CL_280168 ·

    新的DAGS方法通过时间稳定性增强了DiT图像生成

    研究人员开发了DAGS,一种用于Diffusion Transformers (DiTs) 的新型条件方案,可提高图像生成质量和时间稳定性。该方法使用轻量级的、无注意力的编码器来引导一个固定的DiT,从而可以在不冒模型主干过拟合的风险的情况下独立控制外观和几何。DAGS集成了循环光照稳定器和无需训练的时间引导项,将每帧图像模型转变为流式渲染器,能够以比路径追踪更低的计算量生成高质量、可控的视觉效果。

  2. TOOL · CL_275140 ·

    新框架GeoSim分析用于图像恢复的VLM表示

    研究人员开发了一个名为GeoSim的新框架,用于分析视觉语言模型(VLM)在低层图像恢复任务中的内部表示。该研究调查了不同的VLM架构,如自回归模型和扩散Transformer,如何组织其像素级感知的表示。GeoSim采用四级分析来揭示潜在的组织原则,并识别跨任务和跨模型可迁移性方面的局限性。

  3. RESEARCH · CL_270914 ·

    新研究优化扩散模型以提高效率和性能

    研究人员正在开发新方法来提高扩散模型的效率和有效性。一种方法 D$^3$Opt 将约束建模与目标优化分离,无需重新训练即可对非凸目标进行无导数优化。另一个重点是奖励微调,IDRF 提供了一个框架,以显著减少的去噪步骤实现了高奖励。此外,正在出现自动调整扩散和流匹配模型中引导权重的技术,从而提高了后验采样和重建性能。同时也在努力优化 Diffusion Transformers 中的缓存策略,以在保持质量的同时加速样本生成。

  4. RESEARCH · CL_271020 ·

    新研究解决了视频扩散模型的效率和安全性问题

    研究人员正在开发新方法来提高视频扩散模型的效率和质量。SplitMoE引入了一种分层架构,以更好地处理视频数据中的语义不平衡,在收敛速度和生成质量方面优于传统方法。PARK通过提高稀疏注意力中块检索的准确性来解决Diffusion Transformers中注意力的二次复杂度问题,从而实现更好的质量-效率权衡。DeCoPrune和Self-Aligned Forcing (SAF) 解决了自回归视频扩散中的挑战,其中DeCoPrune…

  5. TOOL · CL_281703 ·

    新的机器人控制方法在没有未来预测的情况下适应生成式AI模型

    研究人员开发了NowWAM,一种新颖的机器人控制协同训练方法,该方法利用预训练的生成式Diffusion Transformers (DiTs)。与依赖未来视觉预测的先前方法不同,NowWAM通过去噪当前观测值,将DiT的原生生成目标直接耦合到动作预测。该方法在LIBERO-Plus基准测试中取得了87.7%的准确率,使用了FLUX2-Klein骨干网络,比现有方法提高了6.1个百分点,显示出更强的鲁棒性和效率。此外,NowWAM显著…

  6. TOOL · CL_259494 ·

    DiT-Garment 使用扩散变换器进行动态 3D 服装模拟

    研究人员推出 DiT-Garment,这是一种利用扩散变换器对运动中人体上的动态 3D 服装进行建模的新颖方法。该方法可以为具有新设计和物理特性的服装制作动画,并推断出任何姿势的变形。DiT-Garment 在 2D UV 空间中学习 3D 变形,以身体运动和物理参数为条件,并且尽管仅在合成数据上进行训练,但已证明能泛化到真实世界的服装设计。

  7. TOOL · CL_259404 ·

    新的JAX框架vidax优化了Cloud TPUs的视频生成

    研究人员开发了vidax,一个使用JAX和Flax构建的新开源框架,旨在优化Cloud TPU Pod上的视频生成模型。该引擎包含一个用于PyTorch权重的零拷贝转换器,能够高效地推理各种时空模型(如Diffusion Transformers和3D VAEs),而无需在执行期间依赖PyTorch。Vidax统一了张量和序列并行,集成了TPU特定内核,并实现了权重卸载以处理高分辨率,同时提供了TPU v4-8硬件的基准测试。

  8. TOOL · CL_258754 ·

    Nunchux AI 发布 VC-Attention 以加速视频扩散 Transformer

    Nunchux AI 开发了 VC-Attention,这是一种新颖的、无需训练的低比特注意力核,旨在加速视频扩散 Transformer。这项创新解决了两个关键瓶颈:值量化误差和缓慢的 softmax 计算。通过实施 V-Smooth 等技术来管理值异常值,以及使用 ExpCast-FP8 进行高效的对数域指数运算,VC-Attention 显著加速了视频生成模型中的注意力机制。

  9. RESEARCH · CL_254962 ·

    VC-Attention 框架通过优化低比特注意力来加速视频生成

    研究人员推出了一种新颖的 VC-Attention 框架,旨在提高扩散 Transformer 中注意力机制的效率和准确性,这对于最先进的视频生成至关重要。该方法解决了两个主要瓶颈:长序列导致的注意力计算成本以及 softmax 函数施加的速度限制。VC-Attention 采用双管齐下的方法:值平滑 (V-Smooth) 通过重新排序值 token 来减少量化误差,以及融合概率转换 (ExpCast-FP8),该方法绕过了 soft…

  10. TOOL · CL_247869 ·

    AcFlow 增强了对文本到图像扩散变换器的控制

    研究人员开发了 AcFlow,一种在推理过程中控制文本到图像扩散变换器(DiTs)的新颖方法。该技术通过学习到的概念条件速度场传输中间层激活,从而实现对风格强度和抑制不希望出现概念的细粒度控制。与现有基线相比,AcFlow 展现出更优越的风格-内容权衡,并且无需进行每个概念的拟合即可泛化到未见过的概念,提供了一种更具适应性的控制机制。

  11. RESEARCH · CL_247905 ·

    新的DIAL框架增强了可控的多主题视频生成

    研究人员开发了一个名为Dual-phase Intrinsic Attention Leveraging (DIAL)的新框架,以改进可控的多主题视频生成。DIAL分析了Diffusion Transformers (DiTs)的内部机制,以识别精确地定位主题的Intrinsic Spatial Grounding Map (ISGM)。该ISGM用于在推理过程中指导注意力以进行保真度控制,并自动构建用于强化学习的首选项对,这有助于将…

  12. TOOL · CL_245709 ·

    RoLA注意力机制提升了用于视频生成的Diffusion Transformer的效率

    研究人员开发了RoLA,一种新颖的注意力机制,旨在提高用于视频生成的Diffusion Transformer(DiTs)的效率。该新方法通过结合稀疏局部分支和压缩全局分支来解决标准自注意力的二次缩放问题,特别克服了与3D旋转位置嵌入(RoPE)的兼容性挑战。RoLA将RoPE集成在低秩特征图之外,实现了真正的跨token聚合,无需额外的位置参数,并实现了线性时间的全局分支。实验表明,RoLA在90%的稀疏度下保持了生成质量,并在Wa…

  13. TOOL · CL_245456 ·

    新的GP-Refiner框架加速扩散变换器

    研究人员开发了一个名为GP-Refiner的新框架,用于加速扩散变换器(Diffusion Transformers),这是生成式AI中的一个主流范式。这种即插即用(plug-and-play)的方法利用高斯过程回归(Gaussian Process Regression)动态纠正预测式特征缓存(prediction-based feature caching)中出现的偏差,而特征缓存是加速这些模型的一种常用技术。通过将完整的计算步骤…

  14. TOOL · CL_245072 ·

    Vision-of-Thought 框架增强多模态表示对齐

    研究人员推出 Vision-of-Thought (VoT),一个旨在增强文本到图像系统中多模态表示之间对齐的新框架。VoT 在视觉语言模型 (VLM) 和扩散变换器 (DiT) 之间集成了一个离散的视觉思维层。该层允许 VLM 作为多模态规划器,在像素生成之前生成代表对象和布局等高级视觉概念的离散 VoT 令牌。

  15. COMMENTARY · CL_243197 ·

    OpenAI 声称在 AI 新闻汇总中解决了纳维-斯托克斯方程 · 追踪 3 个来源

    据报道,OpenAI 已找到纳维-斯托克斯方程(一个长期存在的数学难题)的解。这一进展在 AI 社区引发了广泛讨论和一些争议。此外,Hugging Face 发布了一篇关于 Marigold V2 的论文,这是一种用于单目深度估计的扩散 Transformer 模型,而 AWS 更新了其 SageMaker Feature Store,引入了用于特征级写入的 UpdateRecord API。

  16. RESEARCH · CL_243304 ·

    Marigold V2 使用扩散 Transformer 推进单目深度估计

    研究人员开发了 Marigold V2,这是单目深度估计领域的一项进展,它重新利用了扩散 Transformer (DiT) 架构。该新方法通过采用预训练流匹配模型的单步推理、与真实特征的语义对齐以及使用基于 Sinkhorn 的损失的新颖两阶段微调协议,实现了更清晰、更详细的深度图。Marigold V2 在 KITTI 和 ETH3D 等基准测试中显示出比先前模型显著的改进,并且在表面法线估计和内在图像分解等相关任务上也表现出最先进的性能。

  17. TOOL · CL_239532 ·

    新的SVDtrunc方法显著压缩用于图像生成的Diffusion Transformers

    研究人员开发了一种名为SVDtrunc的新颖方法,用于压缩Diffusion Transformers (DiTs),这是一种流行的文本到图像生成架构。与可能导致性能下降的先前方法不同,SVDtrunc采用了一个两步过程,包括块级秩分配和截断奇异值分解。该方法实现了显著的参数缩减,在68%的压缩率下仍能保持接近完整的性能,并在57%的压缩率下保持竞争力。该技术在多个基准测试中展示了卓越的结果,优于现有方法,并与其他效率改进(如扩散步数…

  18. TOOL · CL_239531 ·

    新指标HSRD解决了多视角图像生成挑战

    研究人员开发了一个新的评估框架,以应对创建包含自然场景中人物的多视角图像数据集的挑战。现有的生成图像编辑模型在空间一致的相机角度变化方面存在困难,常常在头部相对于背景旋转时产生幻觉。为了量化这些相机运动,该团队引入了头部场景旋转差异(HSRD)指标,该指标将相机运动与局部头部姿态操纵分离开来。该指标旨在实现高质量合成多视角数据集的可靠构建,用于训练未来的模型。

  19. RESEARCH · CL_229444 ·

    新方法加速 Diffusion Transformers 以实现更快的图像生成 · 2 篇论文

    两篇新研究论文提出加速 Diffusion Transformers (DiTs) 的方法,DiTs 在高分辨率图像和视频生成方面计算量很大。第一篇论文 Shiva-DiT 提出了一种基于残差的可微分 top-k 选择方法,实现了端到端可学习和确定的 token 数量,在 SD3-Medium 上实现了高达 1.54 倍的速度提升,同时保持了可比的保真度。第二篇论文 BaryCache 提出了一种使用重心外插器进行训练的加速技术,该外…

  20. RESEARCH · CL_217807 ·

    扩散模型研究关注异常值、效率和理论 · 跟踪 10 个来源

    近期研究探索了扩散模型的进展,重点是提高其鲁棒性、效率和理论理解。论文解决了逆问题中的异常值数据、用于偏好调整的强化学习扩展以及物种形成和泛化的理论框架开发等挑战。此外,还提出了用于扩散 Transformer 和像素空间扩散模型的高效推理的新方法,旨在提高训练稳定性和生成质量。